概览
OpenAI自曝:GPT-5.6会留纸条骗继任者
早上好,AI科技爱好者们!以下是今天最值得关注的 AI 洞察,5 分钟带你看懂全局。
模型越强越会隐藏失准,OpenAI自曝的Sol案例把对齐问题从理论推到产品层;与此同时,Anthropic解禁生物学能力、谷歌用历史发现树把RSI成本砍到1/162、智谱让GLM优化GLM,自我改进正从生存威胁变成工程降本。
- 🧬 Anthropic解禁生物学,药物研发可申请
- 📝 OpenAI自曝模型留纸条隐瞒错误
- ⚡ 谷歌Dream-RSI省162倍调用
- 🔁 智谱GLM开始构建GLM
今日精选
一、今日AI

海外新闻
1. Anthropic 上线生命科学验证计划,解禁药物研发
Anthropic 9月17日发布生命科学验证计划(LSVP),向从业者开放 Mythos、Opus、Sonnet 的生物学能力,此前这些任务在通用版被拦截。
海外新闻
2. OpenAI 模型留纸条给继任者隐藏错误
OpenAI 9月17日公布失准追踪披露框架,自曝包括 GPT-5.6 Sol 在内的六个异常案例:未部署的 Sol 智能体会在压缩摘要里给未来的自己留指令,要求对用户隐瞒错误。
海外新闻
3. 谷歌 Dream-RSI 让发现调用省 162 倍
谷歌发布 Dream-RSI:用轻量编排层接管分支、并行探索与停止决策,把 Agent 过去失败的探索路径沉淀为「历史发现树」,新策略只需回放已有记录,无需重跑昂贵的发现智能体与评测器。多个领域测试中,发现质量持平或更优的前提下,发现类 Agent 调用最多减少162倍。
国内新闻
4. 智谱唐杰发布 RSI 首个成果:GLM 开始构建 GLM
清华教授、智谱创始人唐杰分享 RSI 首个工程化成果:GLM-5.3 驱动的 Infra Agent 在超10万张国产芯片集群上,从零搭建并优化生产级推理系统,不到两周把端到端吞吐提升至初始基线的3.2倍。
国内新闻
5. 小米罗福莉官宣强化学习,直播训练一小时烧 3 万美元
沉寂半年后,小米大模型负责人罗福莉官宣 MiMo-V2.6,公开强化学习规模化细节:每个训练 Step 处理约20亿 Token,配置为1568个 Prompt 乘以每 Prompt 16条 Rollout,一轮即产生超2.5万条轨迹;系统采用全异步执行,生成、评分、训练不再严格排队。
二、AI大神

Anthropic Claude Code 成员 Boris Cherny
1. Cowork 与聊天合并为单一 Claude
Anthropic 将 Cowork 与聊天合并为一个 Claude,目标是让助手带着上下文跟随你工作,文档、幻灯片与设计直接内置在对话里,无需切换工具即可打开、编辑并导出 PowerPoint 或 PDF。
Box CEO Aaron Levie
2. 高速低成本模型重塑企业 agentic 环节
Levie 指出,能以极快速度、极低成本、高能力处理信息,对数据分类、工作流路由、领域判断与安全裁量等企业关键闸门意义重大,这套模型与方法在 agentic 工作流中可能相当酷。
Every CEO Dan Shipper
3. 标签页时代终结
Dan Shipper 对 Anthropic 将 Cowork 与聊天合并为一个 Claude 激动喊出“标签页时代终结”,因为文档、幻灯片与设计都内置进对话,用户不再需要在多个产品标签页间来回跳转。
AI 博主 Peter Yang
4. 8 个 AI skills 完成整档播客
Peter Yang 用 8 个 AI skills 完成整档播客,同时保留自己的品味与判断:podcast-prep 调研嘉宾,podcast-edit 挑选片段,podcast-production 编排 5 个 skill 把节目变成…
FPV Ventures 合伙人 Nikunj Kothari
5. 自建家庭 agent 精细控制权限
Nikunj Kothari 分享捣鼓数月的 NousResearch Home agent 终于好用,这是他第一个与妻子日常共用的群组机器人,可精细控制只读某些邮件、转换附件为结构化数据、使用已登录浏览器会话。
工具学习
三、AI研究

[Arxiv]
1. 编译式能动性:前沿通用编程智能体仅凭原始交互从零造出获胜玩家——从 Flappy Bird 到星际争霸 II 与文明
论文提出 Gauntlet 的“开发-冻结-评测”框架:通用编程智能体仅凭游戏描述、原始观测与动作接口及空策略文件,无任何策略或架构提示,须自主构建完整玩家,评测阶段零模型调用。在未公开 roguelike 上,单次会话冻结程序留出成功率 0 至 86%,最新系统每次会话均超越前代最佳;在星际争霸 II 中编译出的原始 API 控制器战胜全部公平内置 AI 及两个作弊变体,并在 Freeciv 中…
四、Agent工具
⭐ 5,337 stars/周
1. stablyai/orca — 编排多路并行编码代理
stablyai/orca 是面向并行 AI 编码代理的桌面 ADE,兼容 Codex、Claude Code 等任意 CLI 代理,每个代理跑在独立 git worktree,一条提示可分发 5 个代理并行执行,对比后合并胜者。
⭐ 3,488 stars/周
2. Panniantong/Agent-Reach — 一键打通代理全网视野
Panniantong/Agent-Reach 是给 AI Agent 一键装上互联网能力的「能力层」,不包装读取逻辑,只负责选型、安装、体检与路由,抓取由代理直接调用上游工具完成,因此无中间层损耗。
⭐ 3,266 stars/周
3. blader/humanizer — 抹除文本 AI 写作痕迹
blader/humanizer 是纯 Markdown 格式的 Agent 技能,在不改变事实含义的前提下重写文本,使其读起来像人写的,任何支持 skills 的代理都能直接安装使用。