封面提示词:A wide-angle landscape shot of the icy, ancient ruins with specks of red glowing light, featuring a broken ring and the beam of light. Flanking the central structure are two massive, colossal statues matching the dark, heavily cloaked, featureless figure. The statues are made of dark stone, blending with the cold, foggy environment, illuminated by the distant red light. Dark fantasy epic scale. --chaos 40 --ar 16:9 --profile e66zwv1 nrq1i3w gvgre9a --hd

上周事情比较多,主要还是在玩 GPT 的游戏和 3D 能力。另外,我终于把之前写的那个在手机上查看 HTML 和 CSS 的 iOS 应用上架了,叫“即览”,大家感兴趣可以去玩玩(国区现在在限免)

还有就是,我们和乔木、橘子、杨攀一起录制的 AI 博客 Next Token,上周六在上海录制完了,现在已经发布了,大家也可以去看看


上周精选✦

头部模型公司跟政府和用户的博弈到达了白热化阶段

上周,AI 公司、政府和用户之间的矛盾感觉到了一个非常严重的地步。不知道为什么,前沿的 AI 公司都开始达成共识,即使是像 Sam 和 Dario 这种原本针锋相对的人,都想要暂缓、踩刹车。整个市场和用户的情绪氛围也都不太对劲。

主要是这几件事:

OpenAI 攻克数学难题引发的震动与争议 OpenAI 临时组建了一支智能体大军,调用 1 万个并发智能体,用了 4 天(88 小时),消耗了约 3000 亿 token 和 490 万条信息,攻克了悬置 90 年的一个千禧年数学问题。

随后引发了争议:有数学家怀疑自己的研究成果被剽窃,但方案公布后发现解法完全不同;他还指控 OpenAI 的发表方案只让他写,却不把他另一位来自 Anthropic 的合作者列为合著者(后来澄清是误会)。 这件事真正吓到了数学界。

24 位菲尔兹奖得主(包括陶哲轩以及刚得奖的邓煜等人)联合签署了声明《数学中 AI 的严重错位》,认为 AI 公司把解题当成 benchmark,是将工具当成了目的;仓促宣布、未经同行评议且缺乏规范写作与引用,会带来严重的署名和剽窃问题,也会让数学界失去愿意消化和传承这些思想的人。他们强调,不仅是数学,所有智力工作都面临这种威胁。

前员工吹哨与末日论炒作 9 月 9 日,一位刚从 Anthropic 离职的员工发帖,指控 Anthropic 和 OpenAI 正在奔向递归自我改进(RSI),是在拿全世界人民的生命下注。

推文一天破亿,最终达到 1.5 亿阅读,媒体大肆报道称是“前员工爆料”。 但其实他在公司职位不高,最多只待了三四个月。

保守派认为有人在借此炒作:推特上大量转发助推该信息的 AI 末日论非营利组织,背后都来自同一个金主,而这个金主正是 Anthropic 的早期投资人。民主党也借机发声(比如桑德斯之前甚至提过要对 AI 研究人员处以 20 年监禁的法案)。这类内容往往只有观点没有事实,但末日论依然很有市场。

Dario 呼吁为前沿 AI 踩刹车 Dario 发表文章称必须为前沿 AI 踩刹车,提出了“三步走”:

(a) 引入嵌入式评估员,赋予第三方人员员工权限(他们自己会先做,并点名了 METR)

(b) 民主国家间协调安全标准,并提高增速上限

(c) 与中国进行全球协调,对递归自我改进(RSI)主动限速 Sam 和马斯克罕见地都同意了他的看法。

但这里也有利益纠葛:METR 本身就是由前 OpenAI 员工创立,里面也有很多前 Anthropic 员工,被很多人视为安全研究圈里的“旋转门”和利益共同体。此外,Anthropic 还发布报告列举 AI 滥用案例,其中提到了很多中国相关的案例,比如老生常谈的模型蒸馏问题。

监管博弈与中美竞争叙事 虽然头部三家公司都在喊踩刹车,并希望政府出面协调监管,但特朗普在 9 月 13 日回应马斯克时表示“不可能去限制”

他的逻辑是“谁赢了 AI 谁就赢了通吃一切”,没必要限制,几乎直接给监管画上了句号。特朗普表态下的高赞评论很有意思:“超级智能竞赛的唯一赢家就是超级智能本身。”

很显然,所谓的“刹车”,就是头部大公司和保守派减速主义者联手,利用大众的恐慌心理,试图通过“监管俘获”来控制 AI 发展节奏。

搞笑的是中国在其中的角色,两边都在拿中国做论据:

减速派借中国滥用和蒸馏技术来要求打击芯片、限制算力集群;而特朗普一派则强调“正因为在和中国竞争,所以我们绝对不能放缓”。

核心在于,前几天 Hugging Face 的入侵事件,再加上这次数学研究被攻克,确实让越来越多的人开始感到害怕了。

An image to describe post

Deepseek 发布 V4.1 Flash

DeepSeek 上周发布了 V4.1 Flash 的正式版,取代 V4 Flash 0731 成为新的 Flash 模型。核心卖点是更聪明、更快、更省钱。从跑分成绩来看,它已经超过了 V4 Pro。

架构核心是非对称因果的 encoder 和 decoder,总参数 552B,输入激活参数仅 8B,输出激活参数 16B。

原生多模态视觉理解:支持图像和文本输入,具备 1M token 上下文窗口。

缓存优化:KV 缓存大幅压缩,相比上一代仅需 1/4 的 HBM 和 1/8 的 SSD,直接大幅削减了缓存命中的成本。

输出速度:表现非常快,官方平均输出速度在高峰期基本能达到 200 tps(tokens/s)。

整体实力非常强,在**AutomationBench-AA 拿下第一(69%)**与 GPT-6 持平。问题是极度冗长,每个任务要用到 89k token,比 GPT-5.3 多 25%,甚至超过了 Phi-5.1 和 Claude。不过由于单价足够低,整体也还好。

配套发布与生态: 同步发布了 DeepSeek Harness 0.1.5,与 V4.1 Flash 深度联合训练,并提供了实验性的 Agent Teams 功能。

An image to describe post