🤖 AI 与大模型

200 行看懂 LLM(下):反向传播与 Adam

Understanding LLMs III: Backprop & Adam

9 章·9 分钟·8 篇技术深读
开启:视频讲到哪,技术深读自动跟到哪
0:00 0:00
章节(9)
B19 计算图:把运算历史记下来
B20 链式法则:梯度一步步算回去
B21 backward:梯度从 loss 灌回参数
B22 Adam:方向看 m,步长看 v
B23 学习率衰减:越接近终点越小心
B24 训练循环:六步重复一千次
B25 推理生成:温度采样带来多样性
B26 从 microgpt 到 GPT-4:原理一致,规模不同
B27 三集回顾:200 行代码看懂语言模型
技术深读站 · 作者 项思炼 · elane.xiangsilian.com