【書籍特點】
☆Transformer 編碼器-解碼器架構與序列建模
☆自注意力機制、縮放點積注意力與 Softmax 權重
☆多頭注意力設計、拼接與線性變換
☆殘差連線、層歸一化、位置編碼實作要點
☆PyTorch 動態計算圖、自動微分、GPU 加速
☆從零實作基礎 Transformer 並完成訓練與測試
☆Hugging Face Transformers:模型載入、配置、訓練與推理
☆資料前置處理與分詞:清洗、BPE、WordPiece、截斷與填充
☆微調與遷移學習:全參數/部分參數、凍結層、增量訓練
☆文字生成推理:Beam Search、Top-K、Top-P、溫度與重複控制
☆模型最佳化:剪枝、蒸餾、量化、TorchScript、Profiler、AMP、Checkpointing
☆分散式訓練與落地:多GPU/All-Reduce/梯度累積,分類/問答/NER,可解釋性(SHAP、LIME),Docker 與 Kubernetes 部署
【內容簡介】
本書以Transformer為主線,從PyTorch實作到Hugging Face預訓練模型訓練與微調,依序整理資料前置處理、分詞(BPE、WordPiece)、生成推理(Beam Search、Top-K、Top-P)、模型最佳化(剪枝、蒸餾、量化、TorchScript、Profiler)、混合精度與多GPU分散式訓練,並以分類、問答、命名實體辨識等NLP任務貫穿,最後完成智慧文字分析平臺的容器化與雲端部署。內容以可執行範例串接關鍵機制,適合大模型開發與NLP研發人員作為實作導向的參考。
本書共分12章,第1章介紹大模型與Transformer技術背景、PyTorch特點與簡易Transformer實作;第2章介紹編碼器-解碼器結構、位置編碼、殘差連線與層歸一化的模組化實現;第3章介紹注意力與多頭注意力、權重視覺化與解讀;第4章介紹Hugging Face Transformers載入配置、訓練推理與Tokenizer/Dataset/Pipeline整合;第5章介紹文字清洗、停用詞、BPE/WordPiece分詞、截斷與填充;第6章介紹領域微調、遷移學習、凍結層與增量訓練;第7章介紹文字生成推理與輸出控制;第8章介紹剪枝、蒸餾、量化、混合精度與效能分析;第9章介紹多GPU並行與分散式訓練;第10章介紹分類、問答與命名實體辨識實作;第11章介紹SHAP、LIME與注意力可解釋性;第12章整合前述技術開發智慧文字分析平臺並完成Docker與Kubernetes部署。
☆Transformer 編碼器-解碼器架構與序列建模
☆自注意力機制、縮放點積注意力與 Softmax 權重
☆多頭注意力設計、拼接與線性變換
☆殘差連線、層歸一化、位置編碼實作要點
☆PyTorch 動態計算圖、自動微分、GPU 加速
☆從零實作基礎 Transformer 並完成訓練與測試
☆Hugging Face Transformers:模型載入、配置、訓練與推理
☆資料前置處理與分詞:清洗、BPE、WordPiece、截斷與填充
☆微調與遷移學習:全參數/部分參數、凍結層、增量訓練
☆文字生成推理:Beam Search、Top-K、Top-P、溫度與重複控制
☆模型最佳化:剪枝、蒸餾、量化、TorchScript、Profiler、AMP、Checkpointing
☆分散式訓練與落地:多GPU/All-Reduce/梯度累積,分類/問答/NER,可解釋性(SHAP、LIME),Docker 與 Kubernetes 部署
【內容簡介】
本書以Transformer為主線,從PyTorch實作到Hugging Face預訓練模型訓練與微調,依序整理資料前置處理、分詞(BPE、WordPiece)、生成推理(Beam Search、Top-K、Top-P)、模型最佳化(剪枝、蒸餾、量化、TorchScript、Profiler)、混合精度與多GPU分散式訓練,並以分類、問答、命名實體辨識等NLP任務貫穿,最後完成智慧文字分析平臺的容器化與雲端部署。內容以可執行範例串接關鍵機制,適合大模型開發與NLP研發人員作為實作導向的參考。
本書共分12章,第1章介紹大模型與Transformer技術背景、PyTorch特點與簡易Transformer實作;第2章介紹編碼器-解碼器結構、位置編碼、殘差連線與層歸一化的模組化實現;第3章介紹注意力與多頭注意力、權重視覺化與解讀;第4章介紹Hugging Face Transformers載入配置、訓練推理與Tokenizer/Dataset/Pipeline整合;第5章介紹文字清洗、停用詞、BPE/WordPiece分詞、截斷與填充;第6章介紹領域微調、遷移學習、凍結層與增量訓練;第7章介紹文字生成推理與輸出控制;第8章介紹剪枝、蒸餾、量化、混合精度與效能分析;第9章介紹多GPU並行與分散式訓練;第10章介紹分類、問答與命名實體辨識實作;第11章介紹SHAP、LIME與注意力可解釋性;第12章整合前述技術開發智慧文字分析平臺並完成Docker與Kubernetes部署。


















