從零開始訓練一個大型語言模型 | Stanford 公開課 |中集

從零開始訓練一個大型語言模型 | Stanford 公開課 |中集

The Only Bamboo
The Only Bamboo
2026年9月4日  #AI #CS336 #大語言模型

大家好,我是 Jim,這裡是 AI Notebook。這是史丹佛 CS336 系列的中集。上集我們把成本算出來了,六乘上參數量再乘上資料量,一千張顯示卡要跑一百四十四天,一個參數要吃掉十六個位元組,所以一張卡根本裝不下一個七百億參數的模型。算完之後問題不會消失,它只會變得更具體。中集要回答的就是接下來那三個問題。第一,這個模型到底跑不跑得動,你要怎麼把它切開,攤到幾千張卡上面。第二,這筆錢花對了沒有,你憑什麼在還沒開始訓練之前,就決定模型要多大,資料要餵多少。第三,五個月燒完之後,你怎麼知道它到底有多好。這三個問題對應的是課程的第七到第十二講,而它們其實共用同一種能力。

📎 資料來源
• Stanford CS336, Spring 2025, Lecture 7: Parallelism 1 https://www.youtube.com/watch?v=l1RJcDjzK8M
• Stanford CS336, Spring 2025, Lecture 8: Parallelism 2 https://www.youtube.com/watch?v=LHpr5ytssLo
• Stanford CS336, Spring 2025, Lecture 9: Scaling laws 1 https://www.youtube.com/watch?v=6Q-ESEmDf4Q
• Stanford CS336, Spring 2025, Lecture 10: Inference https://www.youtube.com/watch?v=fcgPYo3OtV0
• Stanford CS336, Spring 2025, Lecture 11: Scaling laws 2 https://www.youtube.com/watch?v=OSYuUqGBQxw
• Stanford CS336, Spring 2025, Lecture 12: Evaluation https://www.youtube.com/watch?v=x-R5l2HsXqM
• Stanford CS336 course website (Spring 2025) https://stanford-cs336.github.io/spring2025/
• CS336 Lecture 10 執行紀錄 (lecture_10.py trace) https://stanford-cs336.github.io/spring2025-lectures/?trace=var/traces/lecture_10.json

---
Jim AI Notebook | Note the Future
每日深度解析 AI 最新進展

#AI #CS336 #大語言模型 #史丹佛 #平行運算 #ScalingLaws

章節:
00:00 開場:中集的三個問題
00:48 一百四十八次故障
02:35 一張卡裝不下:三種切法
04:29 資料、張量、流水線平行
08:22 ZeRO 與 FSDP
11:15 頻寬階層與切法守則
13:18 Scaling Laws:錢怎麼花對
17:23 Chinchilla 二十比一
20:15 推理成本:訓練一次、服務永遠
23:22 KV cache 四招瘦身
28:02 vLLM:作業系統的智慧
29:12 Transformer 之後的兩條路
30:31 模型到底有多好