「咸话咸说」旗下的 AI 技术分享栏目「AI 乱炖」,主要随聊近期的工具、论文与实践进展。今天我们聊聊两项技术动态:一项是多校联合团队研发的 Ataraxos AI 在经典博弈游戏 Stratego 中击败顶尖人类棋手;另一项则是 Google 公布但暂未对外开放的 Gemini 4 Argon 模型及其内部工程应用。
1. 高校联合团队研发 Ataraxos AI,击败 Stratego 顶尖人类棋手
继国际象棋、围棋和扑克先后被机器攻破后,经典博弈游戏 Stratego 此前一直未被攻破,即便拥有雄厚预算的 DeepMind,也未能造出能够稳定击败顶尖人类棋手的机器。来自 Carnegie Mellon、MIT、New York University 和 Stanford University 的联合研究团队研发出名为 Ataraxos 的 AI,仅耗费 16 块 GPU 和数千美元训练成本,便以 15 胜 1 负 4 平的战绩击败了公认的 Stratego 历史最佳人类选手 Pim Niemeijer。在这款每位玩家持有 40 枚代表不同军阶棋子、交战时才揭晓身份的不完全信息博弈中,纽约大学研究员兼论文合著者 Eugene Vinitsky 表示:「Stratego 具有极其独特的特点,它蕴含的大量隐藏信息会在很长的时间跨度中逐步展开」[来源:arstechnica.com](https://arstechnica.com/science/2026/10/ai-finally-beat-the-best-stratego-player-in-history-and-did-it-on-a-budget/)。
2. Google 发布 Gemini 4 Argon 模型,但暂未对外开放
Google 曾在 6 月承诺推出 Gemini 3.5 Pro,在陆续放出更小的 Flash 系列模型后,公司准备凭借 Gemini 4 Argon 重返前沿,并称这款新 AI 在编程、知识工作和网络安全方面具备业界领先性能,但目前暂不允许外界使用。虽然大多数人还需等待,但 Google 表示其内部工程师已经在大量使用该模型;据报道,Argon 借助「全域遥测数据」帮助 Google 在数据中心节省了 300 TiB 内存,同时其智能体一直在内部推进把 C/C++ 代码库迁移到 Rust,涉及核心 re2 与 libgav1 库中的数千行代码以及 Fuchsia OS Zircon 内核中超过 80 万行代码。在软件工程基准 DeepSWE v1.1 上,Gemini 4 Argon 得分 77.9%,高于 GPT-6 Astra、Fable 5.1 和 Opus 5.5;Google 承诺在一系列长周期任务上也有类似表现,并指出 Argon 在经济分析 Vals Index 测试中拿下业界领先的分数 [来源:arstechnica.com](https://arstechnica.com/google/2026/09/google-announces-gemini-4-argon-ai-model-but-you-cant-use-it-yet/)。
从高校联合团队以 16 块 GPU 训练 Ataraxos 击败 Stratego 顶尖棋手,到 Google 借助 Gemini 4 Argon 推进 Zircon 内核与核心库向 Rust 迁移,可以看到技术研究与工程实践都在各自的场景中持续演进。无论是应对不完全信息博弈中的隐藏信息,还是在实际软件工程基准与系统迁移中验证能力,具体的实验数据与实操结果始终是观察技术进展的重要参照。
> 注:2 条条目因选题边界未写入:b039f703ebf7885f(政治人物言论与公共卫生政策争议)、3615960163537c76(政府主导的行业监管政策与公共治理议题)
---
*文字由 AI 辅助整理,音频为 AI 合成配音。*


