Heng-xiu/smol_training_playbook_zh_tw

See the code

README

小語言模型訓練手冊

SmolLM Training Playbook - 繁體中文版

這是一份完整的大語言模型訓練實戰指南,由 Hugging Face 團隊基於訓練 SmolLM3 的真實經驗撰寫。本書不僅展示了成功的配方,更重要的是記錄了那些失敗、基礎設施崩潰、以及塑造每個決策的除錯過程。

📚 關於本書

訓練一個高效能大語言模型,究竟需要什麼?

學術論文讓一切看起來如此順理成章:精心設計的架構、用心策劃的資料集、充足的算力。但那些報告只呈現了成功的那一面——它們不會告訴你凌晨兩點調試資料載入器的煎熬、突如其來的損失峰值、或是那個悄悄破壞訓練的張量並行化 bug。

這本手冊帶你走過完整的旅程:

  • ✅ 從預訓練到後訓練的完整流程
  • ✅ 真實的失敗案例與解決方案
  • ✅ 基礎設施挑戰與最佳實踐
  • ✅ 41 個章節,超過 50 萬字的技術細節

🎯 適合誰閱讀

  • 想要訓練自己語言模型的研究者與工程師
  • 希望深入理解 LLM 訓練細節的開發者
  • 對大規模分散式訓練感興趣的技術人員
  • 追求理論與實踐結合的 AI 實踐者

📖 閱讀時長

預計:2-4 天

🏗️ 章節導覽

第一部分:準備階段

  1. 簡介 - 開始這段旅程
  2. 訓練羅盤 - 為什麼 → 是什麼 → 怎麼做

第二部分:預訓練

  1. 從小型消融實驗開始 - 小步快跑,快速驗證
  2. 設計模型架構 - 架構決策的藝術
  3. 資料策劃的藝術 - 資料煉金術
  4. 訓練馬拉松 - 長征開始

第三部分:後訓練與基礎設施

  1. 超越基礎模型 — 後訓練 - 從基礎模型到生產助手
  2. 基礎設施 - 無名英雄 - 幕後功臣

第四部分:總結

  1. 結論 - 旅程的終點,新起點
  2. 參考文獻 - 知識的源頭

🌟 特色

  • 真實案例:基於 SmolLM3 (3B 參數,11T tokens) 的真實訓練經驗
  • 完整流程:涵蓋預訓練、後訓練、基礎設施的完整技術棧
  • 失敗經驗:不只講成功,更重視失敗的教訓
  • 系統方法:從消融實驗到大規模訓練的系統化方法論
  • 工程實踐:GPU 優化、分散式訓練、監控除錯等實戰技巧

🔗 相關資源

📝 翻譯說明

本譯文採用繁體中文(台灣用法),力求:

  • ✅ 保留所有技術術語的英文原文
  • ✅ 意境傳神而非字面對應
  • ✅ 讓技術文檔也能讀出溫度與韻味

開始閱讀第一章:簡介

完整索引章節導航

Contributors

Heng-xiu

9 commits

Heng-xiu/smol_training_playbook_zh_tw

See the code

README

小語言模型訓練手冊

SmolLM Training Playbook - 繁體中文版

這是一份完整的大語言模型訓練實戰指南,由 Hugging Face 團隊基於訓練 SmolLM3 的真實經驗撰寫。本書不僅展示了成功的配方,更重要的是記錄了那些失敗、基礎設施崩潰、以及塑造每個決策的除錯過程。

📚 關於本書

訓練一個高效能大語言模型,究竟需要什麼?

學術論文讓一切看起來如此順理成章:精心設計的架構、用心策劃的資料集、充足的算力。但那些報告只呈現了成功的那一面——它們不會告訴你凌晨兩點調試資料載入器的煎熬、突如其來的損失峰值、或是那個悄悄破壞訓練的張量並行化 bug。

這本手冊帶你走過完整的旅程:

  • ✅ 從預訓練到後訓練的完整流程
  • ✅ 真實的失敗案例與解決方案
  • ✅ 基礎設施挑戰與最佳實踐
  • ✅ 41 個章節,超過 50 萬字的技術細節

🎯 適合誰閱讀

  • 想要訓練自己語言模型的研究者與工程師
  • 希望深入理解 LLM 訓練細節的開發者
  • 對大規模分散式訓練感興趣的技術人員
  • 追求理論與實踐結合的 AI 實踐者

📖 閱讀時長

預計:2-4 天

🏗️ 章節導覽

第一部分:準備階段

  1. 簡介 - 開始這段旅程
  2. 訓練羅盤 - 為什麼 → 是什麼 → 怎麼做

第二部分:預訓練

  1. 從小型消融實驗開始 - 小步快跑,快速驗證
  2. 設計模型架構 - 架構決策的藝術
  3. 資料策劃的藝術 - 資料煉金術
  4. 訓練馬拉松 - 長征開始

第三部分:後訓練與基礎設施

  1. 超越基礎模型 — 後訓練 - 從基礎模型到生產助手
  2. 基礎設施 - 無名英雄 - 幕後功臣

第四部分:總結

  1. 結論 - 旅程的終點,新起點
  2. 參考文獻 - 知識的源頭

🌟 特色

  • 真實案例:基於 SmolLM3 (3B 參數,11T tokens) 的真實訓練經驗
  • 完整流程:涵蓋預訓練、後訓練、基礎設施的完整技術棧
  • 失敗經驗:不只講成功,更重視失敗的教訓
  • 系統方法:從消融實驗到大規模訓練的系統化方法論
  • 工程實踐:GPU 優化、分散式訓練、監控除錯等實戰技巧

🔗 相關資源

📝 翻譯說明

本譯文採用繁體中文(台灣用法),力求:

  • ✅ 保留所有技術術語的英文原文
  • ✅ 意境傳神而非字面對應
  • ✅ 讓技術文檔也能讀出溫度與韻味

開始閱讀第一章:簡介

完整索引章節導航

Contributors

Heng-xiu

9 commits

Languages

HTML

100.0%