今天这期先从一句话开始。

它同时打到模型、Agent 工作台和自动化三层,最贴近普通人“能不能把一段真实工作交给 AI”的问题。后续如果做选题,不要只讲 Grok 分数,要拆它的任务触发、工具连接和验收边界。

今天只看这 2 件事

1. xAI 发布 Grok 4.5,并把“自动跑任务”推到 Grok 里

发生了什么:xAI 在 7 月 16 日发布 Grok 4.5,主打编程、Agent 任务和知识工作,还同步推出 Grok Automations:用户写一次任务,Grok 可以按日程或邮件触发自动运行。

为什么重要:这不是单纯又发一个模型,而是把“模型能力 + 工作台 + 定时任务 + 邮件触发”绑在一起。AI 产品竞争正在从聊天窗口往可持续执行的任务系统走。

对我们有什么影响:这条很适合继续追:普通人以后不只比较哪个模型回答更好,而是比较谁能接住真实工作。我们可以拿它讲“把任务交给 AI 前,先写清触发条件、输入和验收标准”。

2. NVIDIA 把 Agent 时代的算力账,重新算到后训练成本上

发生了什么:NVIDIA 7 月 17 日发文强调 Vera Rubin 平台面向 Agentic AI 的后训练工作负载,核心指标不是只看单卡性能,而是看“每美元买到多少智能”和后训练循环能跑多快。

为什么重要:模型变成 Agent 后,训练不是一次性结束,强化学习、沙盒、rollout、评测会持续消耗算力。谁能把后训练成本压下来,谁就能更频繁地改模型、训工具使用、修安全问题。

对我们有什么影响:这给内容提供一个很好的底层解释:为什么 AI 公司都在抢算力。不是为了堆参数好看,而是为了让模型不断跑任务、试错、验收和再训练。

为什么放在一起看

这几条新闻表面上不完全是一类事,但它们都指向同一个变化:

AI 正在从“演示一个能力”,进入“嵌进真实工作流”。

写代码也好,看专业数据也好,进政府和产业系统也好,真正的门槛都不只是模型聪不聪明,而是它能不能被指挥、被检查、被约束,最后变成一个可靠的工作环节。

我的判断

今天最值得记住的,不是某家公司又发了一条新闻。

是人的位置又往后退了一格,也往上抬了一格。

以后很多活,AI 会更快地写、更快地算、更快地试。但谁来定义任务,谁来验收结果,谁来判断风险,谁来决定要不要真的上线,这些事情反而更重要。

所以我现在看 AI 新闻,会先问一句:这条新闻改变了哪个工作流?

如果答案只是“模型又强了一点”,我会先放一放。如果答案是“某个行业、某个岗位、某个系统里的做事方式变了”,那就值得留下。

可以直接带走

今天可以做一个很小的动作:给你正在用的 AI 工具补一张验收卡。

不用复杂,就写四行:

  1. 这次让 AI 做什么?
  2. 结果怎么才算过关?
  3. 哪些地方必须人工看一眼?
  4. 出错以后怎么撤回?

越是看起来强的 AI,越需要这种朴素的验收动作。

其他信号

  • Our Approach to Bioresilience: Isomorphic Labs and Google DeepMind:公开价值在生物安全:DeepMind 和 Isomorphic 把 AI 药研放进生物韧性框架,读者要关注模型、实验室验证和安全边界怎么一起设计。
  • 英伟达 N1X 首个 Cinebench 2026 跑分曝光:微软 Surface Ultra 工程样机单核成绩接近苹果 M3 Max:公开价值在端侧算力:N1X 工程机跑分接近高端桌面芯片,说明 AI PC 竞争会继续围绕本地推理、续航和 Windows 生态展开。
  • Moonshot AI 发布开源模型 Kimi K3,性能接近前沿闭源模型:公开价值在开放模型竞争:Kimi K3 如果权重和长上下文能力兑现,团队选模型时就要同时比较性能、可私有化和长期任务成本。
  • 摩尔线程联合创始人王东:推理市场没有”万能芯片”,而是解决方案的组合:公开价值在国产推理落地:推理市场不靠一颗万能芯片解决,企业更需要按模型大小、延迟、能耗和软件栈组合方案。
  • 马斯克透露 Grok 4.6 参数规模达 2 万亿,下周完成初始训练:公开价值在模型路线观察:Grok 4。6 进入训练节点,读者要看的不是参数数字本身,而是后续能力、价格和产品入口能不能跟上。
  • 阿里云发布灵骏真武 M890 超节点实例,单台可承载十万亿参数级 MoE 大模型推理:公开价值在云端推理供给:超节点实例面向超大 MoE 推理,企业部署大模型时会更关心吞吐、稳定性和总体账单。

今天不重复

最近 3 天已经讲过的相近内容,这次先不展开:

  • Google 给 Gemini 企业 Agent 接入 Parallel Web Search