发布于2026-08-22 阅读(0)
扫一扫,手机访问
如今的AI工程师,正被迫向“全栈”进化。
放在几年前,路径还很清楚:你只需要懂模型调用、写写Prompt、搭个RAG或者套个Agent框架,就能捣鼓出一个看上去还行的AI应用。但到了2026年,真正的难题已经悄悄换了方向——
AI到底怎么才能在复杂任务里,跑得稳定、可靠、且可评估?
这意味着,问题不再局限于单一模块。模型、训练、推理、系统和Agent编排,它们之间的边界越来越模糊:
训练出了问题,可能是优化器、数据分布或者并行策略的锅;
推理延迟上不去,瓶颈可能藏在Attention机制、KV cache或者系统调度里;
Agent的翻车,往往是模型能力、工具接口和记忆机制联合搞出来的“事故”。
技术栈在快速膨胀,但相关的知识却散落四处。实践者们特别需要一张能把模型、训练、系统和Agent串起来的地图——而不是一堆零散的碎片。
针对这个痛点,亚马逊首席应用科学家 Haggai Roitman 写了一本面向实践者的统一参考手册。它不是传统意义上的论文综述,更像是一张贯穿 Agentic AI 技术栈的导航图。

链接:https://arxiv.org/abs/2606.24937
对工程实践者来说,这本书最大的价值在于:当你面对真实问题,能快速定位到自己所处的系统层级,并看清上下游之间的依赖关系和影响链条。
它不单是写给AI爱好者的科普,真正对标的是那些在构建AI系统的工程师、研究员和技术负责人。
Roitman 的假设是,读者熟悉神经网络和基础概率论,但不要求你已经精通LLM、强化学习或系统工程的背景。
理解LLM内部机制,包括注意力机制、位置编码、MoE路由和Flash Attention;
掌握GPU系统、分布式训练、推理优化和基于vLLM的生产部署;
熟悉LoRA/QLoRA、量化、知识蒸馏、优化器选择和学习率调度等高效训练与微调方法;
理解RLHF、DPO、GRPO、KTO等偏好优化流程,以及奖励黑客和模式崩塌这些常见坑;
弄明白DeepSeek-R1、OpenAI o1/o3和QwQ这类推理模型,是如何通过强化学习获得推理能力的;
学会Agent编排、记忆设计、MCP工具集成、A2A多Agent协调和Agent评估方法。
全书的叙述线非常清晰。它不是术语的大杂烩,而是沿着一条完整的路径展开:一个语言模型从底层架构出发,经过训练、对齐、推理和评估,最终变成一个能够行动的Agent系统。
这部分从Transformer、token、注意力机制和优化方法起步,讨论序列建模能力的来源,以及Flash Attention、LoRA、MoE、量化与蒸馏这些效率优化方法;同时覆盖GPU架构、分布式训练、vLLM等系统基础,以及MDP、TD Learning、Q-Learning、Policy Gradient、Actor-Critic、GAE等经典强化学习内容。它为后面的对齐、推理与Agent训练搭好了底层框架。
这一部分关注语言模型如何被对齐、优化与训练。内容涵盖RLHF基础、PPO、DPO、GRPO及多种偏好优化变体,也包括奖励模型训练、SFT最佳实践、大规模训练系统架构,以及面向Agent的轨迹级训练方法。
这部分聚焦推理能力的形成机制。以DeepSeek-R1、OpenAI o1/o3/o4-mini和QwQ等模型为例,讨论强化学习、过程奖励、搜索方法与测试时计算,是如何塑造思维链、回溯与自我验证这些推理行为的。
这一部分系统讨论模型与Agent的评估方法。从perplexity、pass@k、ELO等指标,到LLM-as-Judge、人工标注、数据污染检测,再到面向Agent的评估体系。核心目标只有一个:建立起对模型质量与Agent能力的可靠衡量方式。
这部分关注Agentic AI的工程层。覆盖RAG、记忆系统、上下文管理与编排、设计模式、环境与基准、MCP、Agent Skills、A2A、多Agent系统、开发框架,以及Agentic UI。
这部分是全书的评估与参考部分,包括覆盖全书主题的详细问答题库、公式与API速查表、常见故障与修复线索,以及结尾处对未来方向和延伸阅读的整理。
Haggai Roitman 在AI研究与大规模生产系统的交叉领域深耕了二十多年。他的研究方向涵盖信息检索、推荐系统、自然语言处理、LLM、面向LLM的强化学习及Agent系统。他发表了超过100篇同行评审论文,持有约100项专利,本科和博士都毕业于以色列理工学院。
他和Agent的故事,其实在二十年前就开始了。攻读信息系统工程本科时,Roitman 就学习了面向智能体的软件工程(AOSE),并用JADE搭建过多Agent系统。之后,他又用OntoBuilder构建了购物Agent,尝试让它自动在不同的电商网站上填写搜索和订单,通过本体匹配来理解不同网站的数据结构。
在他看来,2024到2026年之所以特别,是因为几条技术路线终于交汇到了一起:LLM提供了语言理解与生成能力,强化学习负责推理与对齐,MCP标准化了工具调用,而编排框架则把这些能力组织成可运行的系统。
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
4
5
6
7
8
9