Episode
AI 乱炖 · 2026-10-02
Show notes
1997 年,Deep Blue 在国际象棋中击败了 Garry Kasparov;2016 年,AlphaGo 在围棋中战胜了李世石;而德州扑克 AI 击败职业玩家也已经有很多年了。但有一个经典棋盘游戏 Stratego 一直没能被攻下——即使是预算雄厚的 DeepMind,也没能造出一台能稳定战胜顶尖人类玩家的机器。现在,一支来自 Carnegie Mellon、MIT、纽约大学和 Stanford 的研究团队做到了。他们的 AI 系统名为 Ataraxos,以 15 胜 1 负 4 平的战绩击败了公认史上最强的 Stratego 选手 Pim Niemeijer,而训练它只用了 16 块 GPU 和几千美元。先说这个游戏难在哪。在 Stratego 中,每名玩家拥有 40 枚代表军衔的棋子,军衔从元帅一直到间谍,外加炸弹和军旗,夺得对方的军旗即获胜。对手知道你的棋子在哪里,却不知道它们是什么身份;只有当两枚棋子在战斗中相撞时,身份才会揭示:较弱的一方被移出棋盘,获胜一方的身份随之公开。这和国际象棋、围棋那种全信息博弈完全不同——搜索树里不存在一个固定的局面,对手的每枚棋子都是一个未知的隐藏状态,没法靠蛮力把树搜穿。它更接近扑克这类不完全信息博弈,而计算机早在多年前就攻克了扑克,但 Stratego 把隐藏信息的规模和时间跨度都拉大了一个量级。该研究的共同作者、纽约大学研究员 Eugene Vinitsky 概括得很准:「Stratego 有一个非常独特的特点,那就是它包含海量隐藏信息,并且这些信息是在很长的时间尺度上逐步展开的。」
Google 曾承诺在 6 月推出 Gemini 3.5 Pro,结果整个夏天都在陆续发布更小的 Flash 系列模型。现在,Google 准备重新回到前沿战场,带来了 Gemini 4 Argon。公司宣称,这个新模型在编程、知识工作和网络安全方面拥有业界领先的表现,但外界暂时还不被允许使用它——虽然大多数人还要继续等,Google 表示公司内部的工程师已经在大量使用这个新模型。从披露的内部用法能看到两个很具体的例子。第一,据报道,Argon 利用「全舰队遥测数据」帮 Google 在其数据中心节省了 300 TiB 内存,这是把模型能力直接变成基础设施效率的用法。第二,Argon 的智能体一直在 Google 内部推动把 C/C++ 代码库迁移到 Rust,包括核心 re2 和 libgav1 库中的数千行代码,以及 Fuchsia 操作系统 Zircon 内核中的超过 80 万行代码——这类迁移通常要靠大量人工审查才能推进,现在由智能体来跑量。基准方面,Google 也带来了一整套测试来支撑它的说法:在软件工程基准 DeepSWE v1.1 上,Gemini 4 Argon 拿到 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5。Google 还承诺 Argon 在一系列长链条任务上有同样实力,并拿出了它在经济分析 Vals Index 测试中的业界领先得分作为佐证。
AI 安全研究员 Roman Yampolskiy 解释了他为什么相信:一旦人工智能开始亲手构建下一代 AI,人类将不再是掌控者。他还阐述了为什么他认为威胁不在于 AI 会憎恨人类,而在于它根本不会在乎人类——一个不在乎人类目标系统,不会为了作恶而行动,但也不会把人类利益放进它的目标函数里。这期内容的要点包括:被统称为「AI」的其实是三种截然不同的技术;为什么 2027 年是各实验室希望 AI 开始构建 AI 的年份;递归自我改进是什么——也就是 AI 训练出的系统再去训练下一代系统、每一代的能力上限都由上一代决定——以及它为什么可能改变一切;还有关于超级智能的讨论。
一位开发者在 r/vibecoding 分享了自己在 AI 辅助创作上探索边界的实验:他用 Claude Code 加 Opus 协助打造了虚拟歌手 Astra Blue,把昨天的 AI 新闻写成了一首歌,歌名叫「Can Everybody Stop Shipping?」,还做了一个完整的音乐视频。据他介绍,制作流程很轻:视频采用一次性成片,只用了 2 张参考图,再合成进歌曲里;创意层面的任何决定都来自 Opus 5.5,他本人只负责编排整条流水线。分工也很清楚:歌曲由 Astra GPT6 作词,音乐由 Suno 生成,演唱由虚拟歌手 Astra Blue 完成——每个环节交给当时最合适的工具。他在后记中把这位虚拟歌手标注为 Astra Blue。
完整图文版:本期完整文章
本期文字由 AI 辅助整理,音频为 AI 合成配音。