E-BOOK 大模型算法:强化学习、微调与对齐 余昌叶 大模型算法:强化学习、微调与对齐
PDF

《大模型算法:强化学习、微调与对齐》[81M]PDF|百度网盘|亲测有效

📥 PDF 电子书 · 百度网盘 · 约 84M 👤 余昌叶 📖 电子工业出版社 📋 9787121500725 🌐 zh-CN 📅 2,025 年出版
37
下载次数
4.8
用户评分
64.0MB
文件大小
PDF
  • 强化学习在大模型中的应用:帮助读者理解如何利用RLHF、PPO等算法对大模型进行人类反馈对齐训练。
  • 微调技术选型困难:系统讲解全量微调、LoRA、QLoRA等参数高效微调方法的原理与适用场景。
  • 对齐效果不佳:深入剖析对齐目标设计、奖励模型训练及安全对齐策略,提升模型输出质量。
  • 算法与工程脱节:提供从理论推导到代码实现的完整路径,弥合学术研究与工业落地之间的鸿沟。

📑 章节目录

  1. 大模型基础与Transformer架构回顾
  2. 预训练语言模型与指令微调概述
  3. 强化学习基础:MDP、策略梯度与PPO
  4. 人类反馈强化学习(RLHF)全流程解析
  5. 奖励模型训练与偏好数据构建
  6. 参数高效微调:LoRA、QLoRA与Adapter
  7. 全量微调与分布式训练策略
  8. 对齐技术:DPO、IPO与KTO方法对比
  9. 安全对齐与红队测试
  10. 大模型评估与对齐效果度量
  11. 工业级微调与对齐实战案例
  12. 前沿趋势与未来挑战