封面提示词:Autumn, autumn streets, autumn scenery, lovers, Chinese retro style --chaos 10 --ar 16:9 --raw --profile wzivx8f --stylize 50 --hd
上周值得说的就是那个 GPT-6。我玩 GPT-6 的 3D 建模和做游戏玩得比较多。
另外,我还和杨攀、橘子、乔木一起弄了个播客,每周会聊聊当周的主要新闻,并针对这些分享一些我们的认知、观点和看法。这个播客应该会每周更新,长期坚持下去,内容绝对量大管饱。感觉不错的话,大家可以关注看看。
上周精选✦
Open AI 发布 GPT-6 Astra
上周最值得关注的,就是 OpenAI 的 GPT-6 Astra模型发布。具体能力大家已经看很多了,这里不再赘述。OpenAI 号称它是世界上最智能、最对齐的模型,在 Computer Use、网页浏览、软件工程、网络安全、科学和专业工具上都刷新了当前的 SOTA。
刚发布时还没上线,隔了一天正式上线。API 定价为每 100 万 token 输入 $10、输出 $50;Fast 模式的输出速度是标准模式的 2 倍,定价也是 2 倍。
硬件与算力方面,黄仁勋透露训练用了 10 万台 NVIDIA Blackwell NVLink 72,后续算力中心还会有 40 万台新 GPU 上线。OpenAI 在算力配置上确实非常领先。
现在的测试基准明显不够用了:ARC、AGI 相关的测试直接干到了 99.9% 的成功率,网络安全测试达到 100%,很多项都在 96% 或 88%,非常恐怖。
由于采用了循环推理深度,它的思考过程比 GPT-5.6 更难监控,进而更难对齐和蒸馏。
针对这个新模型的几点使用建议:
- Agent 的 prompt(如 agent.md)和 skills 需要做针对性优化,尽量简短,没必要写太复杂,写多了反而会降低智能度。
- Astro 比以往更谨慎,容易中断任务。如果需求描述不清晰,很容易跑一半就停住,所以提示词要描述得更明确。
- 建议把推理强度调到中等或高(中等基本就够用)。
- 提示时可以强调“使用当前电脑里的所有应用,或你能想到的所有工具去完成”。它在调用工具这方面非常强,比你更清楚该用什么。
Open AI 首席科学家发了篇长文,核心观点值得注意:
- 模型成长速度极快且没有放缓趋势,很快会进入递归自我改进阶段,未来几年会出现同等甚至更大的能力跃升。
- AI 是“生长出来”的,而不是“设计出来”的。它的整体行为无法被完全理解,研究它就像神经科学(脑科学)一样,是在测试探索而非自顶向下设计。
- 当前模型对齐非常困难(包括目标对齐和价值对齐),核心挑战在泛化:模型进入未见过的新环境,对齐就会失效。
- 思维链监控方面,由于循环推理深度的机制,模型会自主隐藏推理过程,不再输出显式思考内容。目前没有任何实验室把对齐和监控做到足以支撑继续发布更强模型的程度,因此他主张自愿放缓发布节奏,建立共享的安全门槛与国际协调机制。
- 到 8 月,中位数研究员每天消耗 $600 推理算力;前 10%(90分位)的研究员每天消耗超过 $7,000 算力。
- 6 月起,研究组织中 Agent 的工作量首次超过人类(每个人类对应 3.14 个 Agent 工作日)。
- 目标在今年 9 月初拥有全自动化的研究实习生,2028 年 3 月做出全自动 AI 研究员。
黄仁勋以及 Open AI 总裁都公开表示:AGI 其实已经到了。

Anthropic 发布 Fable 5.1 模型
上周 Anthropic 发布了 Fable 5.1 和 Mythos 5.1,两者的权重相同。输入输出价格和 Fable 5 一样,缓存价格降了 75%。
官方的说法是,按 token 计费的话,典型负载大约会便宜 25%,重度 Agent 负载大概会便宜 45%。
但时间线上全在说 Fable 5.1 的订阅额度消耗得非常快,可能 20 分钟、半小时整个额度就用光了。
而且这模型还有一些更严重的问题:
不支持强制的 tool choice,更早的模型读不了它的 thinking block,导致不能中途换模型,改历史消息会让 thinking 失效。
输出带有不可见的文本水印(这个之前聊过,非常恶心,会导致生成的文案质量变差)
Artificial Analysis 帮 Anthropic 做预发布测评的反馈显示:即使缓存降价 75%,Fable 5.1 Max 跑完任务的实际开销依然比 Fable 5 Max 贵 20%,因为它的输出 token 大约是 Fable 5 的 1.7 倍。
看起来还是挺拉胯的,反而更贵了,再加上隐形文本水印以及无法切换模型这些问题。
是不是意味着一旦它触发了安全护栏,你切到 Opus 5,缓存就直接失效掉了,随后调用成本跟着大幅上涨?
