GROK / FIELD GUIDE

输入关键词搜索全部课程标题、摘要与正文。按 ↑ ↓ 选择,Enter 打开。

来源档案
TRAIN → ALIGN → ACT·38 min

从预训练到工具使用:模型生命周期

把预训练、后训练、对齐、推理时计算和工具强化学习串成一条流水线,并标出 xAI 公开到哪一步。

源码确认官方声明合理推断未公开

五个阶段不要混为一谈

现代模型不是“一次训练完成”。可以用五阶段地图理解:

  1. 预训练:从海量序列学 next-token prediction,获得通用表示与知识。
  2. 监督后训练:用高质量指令/回答示例改善任务跟随和输出形式。
  3. 偏好与对齐:用人类、规则或模型反馈优化帮助性、风格与安全边界。
  4. 推理/工具强化学习:奖励可验证解题、搜索、代码和长程任务轨迹。
  5. 部署时推理:冻结权重,在时间、token、工具和权限预算内执行。

每一步解决不同问题。预训练能让模型写出代码形状,但未必听从“只返回 JSON”;后训练能改善格式,却不能自动获得今天的数据;工具训练能学会何时搜索,但网页访问仍由外部系统执行。

Grok-1 公开到哪里

初代模型卡确认:Grok-1 先做 next-token 预训练,产品版本再用人类和早期 Grok-0 模型反馈 fine-tune。开放权重发布的是 2023 年 10 月预训练结束的 raw base model,没有针对对话应用微调。

Grok 3:让模型花时间推理

xAI 对 Grok 3 Think 的公开描述是:用大规模强化学习改进 chain-of-thought 策略,使模型能回退、比较解法和验证,并允许数秒到数分钟的 test-time compute。

直觉上,普通生成像看到题就写第一条路线;reasoning 模式允许在输出前或过程中探索更多 token 和分支。更多计算通常提高难题成功率,但增加延迟和费用,也不保证一定正确。

“思考更久”是部署预算与后训练行为的组合,不能从 UI 中一段可见推理文字精确反推内部全部计算。

Grok 4 / 4.5:工具与长程轨迹

Grok 4 发布文称将 reasoning RL 扩大,并训练模型使用网页、X 搜索和代码解释器。Grok 4.1 Fast 描述在模拟环境中训练多工具、多轮任务。Grok 4.5 材料进一步提到软件工程和技术任务、自动与模型评分、持续数小时的 agent rollout。

这类训练需要可验证环境:模型发出动作,环境返回观察,评分器根据测试、任务结果或 rubric 给奖励。它比单轮“好回答/坏回答”更接近教代理完成工作流。

状态(问题 + 历史 + 工具结果)
  → 策略模型选择:继续推理 / 调工具 / 最终回答
  → 环境执行并返回观察
  → 验证器评分任务结果
  → 强化学习更新策略

上图是通用教学伪代码;xAI 没有公开具体 RL 算法、reward model、trajectory 数据或完整训练配置。

对齐并不是一个“安全开关”

对齐涉及帮助性、遵循指令、拒绝高风险请求、减少幻觉、风格与公平等多目标。目标之间会冲突:更强拒绝可能损失正常任务可用性;更自由的工具使用扩大能力,也扩大误操作表面。

xAI 的 Grok 4、4 Fast、4.1、4.20 模型卡公开高层安全评测、拒绝训练和部署缓解。这些材料适合了解风险管理范围,不足以复现训练,也不应拿某个安全 benchmark 替代通用质量判断。

工程上真正可控的部分

即使基础模型闭源,应用仍能控制:

  • system instruction 与输入模板;
  • 允许的工具、参数 schema 与权限;
  • reasoning effort、最大输出和总预算;
  • 搜索域、日期与引用验证;
  • 结构化输出、重试与测试;
  • 人类确认点、审计日志与数据保留。

本章检查点

预训练塑造基础分布,后训练塑造行为,工具和应用连接外部世界,部署策略限制行为范围。一个可靠系统不是“找到最强模型”就结束,而是把每层责任做成可观察边界。

本教材只把公开源码用于解释 Grok-1;当前闭源模型的内部结构,除非 xAI 明确披露,否则均标为未知。