语言模型是怎么学会的

拖动一个滑块,看一堆随机数字如何在一千步里变成一个预测。

训练步数 0

点击图中任意一段,可打开该步骤。

完整的循环

文本碎片 → 数字 → 一层层权重 → 分数 → 百分比 → 误差 → 对每个权重的修正。没有什么被背下来:训练就是对数字做上百万次微小调整,直到正确的下一个词变成最有可能的那个。

内容一览

  1. 1 把文本切成碎片 — 碎片里连带着前面的空格,所以切法不同就是不同的行。
  2. 2 用数字代替词 — 推动滑块,抖动就会停下,数字落在有意义的值上。
  3. 3 层与注意力 — 线的颜色是权重的正负,粗细是大小。现在所有权重都是随机的。
  4. 4 预测 — 正确的下一个词「牛奶」,眼下还排第三。
  5. 5 误差与学习 — 滑块驱动这个循环:到第 1000 步,「牛奶」92%,「拖拉机」0.01%,误差降到 0.08。
阅读更多 我是怎么稀里糊涂在浏览器里做出一套 LLM 编排系统的 从架构角度回看 Litseller 如何用 GPT API、React、提示词和浏览器端编排,生成一个图书目录的结构化内容。

可交互的讲解

训练步数 0
1 / 5