先看全景,再看断点
Grok 的公开历史不是一条“参数越来越大”的线,而是几条并行轨道:基础模型能力、长上下文、视觉、推理时计算、搜索与工具、成本效率、消费产品。最重要的断点发生在 Grok-1:它有公开权重与示例架构;后续主力模型只有规格、模型卡和行为层信息。
2023:Grok-1 与最初产品
2023 年 11 月的模型卡将 Grok-1 描述为自回归 Transformer,8,192 token 上下文,先做 next-token 预训练,再用人类和早期 Grok-0 模型反馈微调。它被用作 Grok 产品的语言引擎,但模型卡也明确:语言模型本体不会独立搜索网络。
2024 年 3 月,xAI 公开 314B 基础模型权重、SentencePiece tokenizer 和 JAX 推理示例,Apache-2.0 覆盖这次发布的源码和权重。该 checkpoint 是 2023 年 10 月完成预训练的原始基础模型,没有针对特定应用(包括对话)微调。
2024:长上下文、视觉与 Grok-2
Grok-1.5 把公开规格的上下文提高到 128K,并报告数学和代码评测改善。发布文还披露训练基础设施建立在 JAX、Rust 与 Kubernetes 上,有故障节点剔除、checkpoint 和重启优化;但没有发布权重或网络逐层配置。
两周后的 Grok-1.5V 是首个公开介绍的多模态版本,可处理照片、图表、文档和截图。8 月的 Grok-2 / Grok-2 mini 把文本、视觉、聊天、代码和推理作为产品组合;12 月,改进版 Grok-2 加入公开 API 型号,并在 X 产品中强调搜索、引用和 Aurora 图像生成。
2025:Reasoning、Agent 与原生工具
Grok 3 的核心变化是把推理时计算做成显式产品形态。xAI 介绍 Grok 3 (Think) 和 Grok 3 mini (Think) 经大规模强化学习训练,可花数秒到数分钟探索、回退和检查;同时发布 DeepSearch 代理预览,并声明 1M 上下文。
Grok 4 将工具使用进一步纳入强化学习:官方称模型学会自行选择网页、X 搜索和代码解释器。Grok 4 Heavy 则被描述为多代理并行思考的产品/系统形态。这里的“原生”更合理地理解为模型经过工具使用训练并能产生调用决策,不是把浏览器或 Python 解释器做进神经网络权重。
9 月的 Grok 4 Fast 关注“智能密度”:2M 上下文,单一权重通过提示切换 reasoning / non-reasoning,API 当时仍以两个 slug 暴露。11 月的 Grok 4.1 改善风格、协作和事实性;Grok 4.1 Fast 与 Agent Tools API 强调长程工具调用与服务端搜索、执行和文件检索。
2026 快照:型号会迁移,接口比名字稳定
截至 2026-07-26,xAI 文档重点展示 Grok 4.5 与 Grok 4.3 等当前模型,并已让一批旧 slug 在 2026-05-15 退休或重定向。产品线还包含 Grok Build、Imagine 图像/视频和 Voice。
怎样阅读“代际变化”
| 变化 | 可以确认 | 不应脑补 |
|---|---|---|
| 8K → 128K → 1M/2M | 发布规格的上下文增长 | 相同 RoPE/GQA 实现直接放大 |
| Think / reasoning | 官方说明经 RL 学习更长推理 | 可见文本等于完整内部思维 |
| Web/X search | 产品与 API 有工具接口 | 参数实时同步互联网 |
| 视觉、语音、生成 | 有对应模型或产品 API | 单一通用模型完成所有模态 |
| 更快、更便宜 | 特定版本定价与厂商评测 | 所有任务质量都更高 |
本章检查点
Grok-1 之后,我们拥有越来越丰富的能力与系统证据,却没有相应完整的网络结构证据。技术写作应该保留这条断点,而不是用熟悉的 Grok-1 图填满未知部分。