五个阶段不要混为一谈
现代模型不是“一次训练完成”。可以用五阶段地图理解:
- 预训练:从海量序列学 next-token prediction,获得通用表示与知识。
- 监督后训练:用高质量指令/回答示例改善任务跟随和输出形式。
- 偏好与对齐:用人类、规则或模型反馈优化帮助性、风格与安全边界。
- 推理/工具强化学习:奖励可验证解题、搜索、代码和长程任务轨迹。
- 部署时推理:冻结权重,在时间、token、工具和权限预算内执行。
每一步解决不同问题。预训练能让模型写出代码形状,但未必听从“只返回 JSON”;后训练能改善格式,却不能自动获得今天的数据;工具训练能学会何时搜索,但网页访问仍由外部系统执行。
Grok-1 公开到哪里
初代模型卡确认:Grok-1 先做 next-token 预训练,产品版本再用人类和早期 Grok-0 模型反馈 fine-tune。开放权重发布的是 2023 年 10 月预训练结束的 raw base model,没有针对对话应用微调。
Grok 3:让模型花时间推理
xAI 对 Grok 3 Think 的公开描述是:用大规模强化学习改进 chain-of-thought 策略,使模型能回退、比较解法和验证,并允许数秒到数分钟的 test-time compute。
直觉上,普通生成像看到题就写第一条路线;reasoning 模式允许在输出前或过程中探索更多 token 和分支。更多计算通常提高难题成功率,但增加延迟和费用,也不保证一定正确。
“思考更久”是部署预算与后训练行为的组合,不能从 UI 中一段可见推理文字精确反推内部全部计算。
Grok 4 / 4.5:工具与长程轨迹
Grok 4 发布文称将 reasoning RL 扩大,并训练模型使用网页、X 搜索和代码解释器。Grok 4.1 Fast 描述在模拟环境中训练多工具、多轮任务。Grok 4.5 材料进一步提到软件工程和技术任务、自动与模型评分、持续数小时的 agent rollout。
这类训练需要可验证环境:模型发出动作,环境返回观察,评分器根据测试、任务结果或 rubric 给奖励。它比单轮“好回答/坏回答”更接近教代理完成工作流。
状态(问题 + 历史 + 工具结果)
→ 策略模型选择:继续推理 / 调工具 / 最终回答
→ 环境执行并返回观察
→ 验证器评分任务结果
→ 强化学习更新策略
上图是通用教学伪代码;xAI 没有公开具体 RL 算法、reward model、trajectory 数据或完整训练配置。
对齐并不是一个“安全开关”
对齐涉及帮助性、遵循指令、拒绝高风险请求、减少幻觉、风格与公平等多目标。目标之间会冲突:更强拒绝可能损失正常任务可用性;更自由的工具使用扩大能力,也扩大误操作表面。
xAI 的 Grok 4、4 Fast、4.1、4.20 模型卡公开高层安全评测、拒绝训练和部署缓解。这些材料适合了解风险管理范围,不足以复现训练,也不应拿某个安全 benchmark 替代通用质量判断。
工程上真正可控的部分
即使基础模型闭源,应用仍能控制:
- system instruction 与输入模板;
- 允许的工具、参数 schema 与权限;
- reasoning effort、最大输出和总预算;
- 搜索域、日期与引用验证;
- 结构化输出、重试与测试;
- 人类确认点、审计日志与数据保留。
本章检查点
预训练塑造基础分布,后训练塑造行为,工具和应用连接外部世界,部署策略限制行为范围。一个可靠系统不是“找到最强模型”就结束,而是把每层责任做成可观察边界。