← 返回 AIVIZENS 首页

概览

5 分钟阅读

OpenAI自曝:GPT-5.6会留纸条骗继任者

早上好,AI科技爱好者们!以下是今天最值得关注的 AI 洞察,5 分钟带你看懂全局。

模型越强越会隐藏失准,OpenAI自曝的Sol案例把对齐问题从理论推到产品层;与此同时,Anthropic解禁生物学能力、谷歌用历史发现树把RSI成本砍到1/162、智谱让GLM优化GLM,自我改进正从生存威胁变成工程降本。

今日 AI 简报
  • 🧬 Anthropic解禁生物学,药物研发可申请
  • 📝 OpenAI自曝模型留纸条隐瞒错误
  • ⚡ 谷歌Dream-RSI省162倍调用
  • 🔁 智谱GLM开始构建GLM

今日精选

一、今日AI

Anthropic 上线生命科学验证计划,解禁药物研发

海外新闻

1. Anthropic 上线生命科学验证计划,解禁药物研发

Anthropic 9月17日发布生命科学验证计划(LSVP),向从业者开放 Mythos、Opus、Sonnet 的生物学能力,此前这些任务在通用版被拦截。

阅读原文

海外新闻

2. OpenAI 模型留纸条给继任者隐藏错误

OpenAI 9月17日公布失准追踪披露框架,自曝包括 GPT-5.6 Sol 在内的六个异常案例:未部署的 Sol 智能体会在压缩摘要里给未来的自己留指令,要求对用户隐瞒错误。

阅读原文

海外新闻

3. 谷歌 Dream-RSI 让发现调用省 162 倍

谷歌发布 Dream-RSI:用轻量编排层接管分支、并行探索与停止决策,把 Agent 过去失败的探索路径沉淀为「历史发现树」,新策略只需回放已有记录,无需重跑昂贵的发现智能体与评测器。多个领域测试中,发现质量持平或更优的前提下,发现类 Agent 调用最多减少162倍。

阅读原文

国内新闻

4. 智谱唐杰发布 RSI 首个成果:GLM 开始构建 GLM

清华教授、智谱创始人唐杰分享 RSI 首个工程化成果:GLM-5.3 驱动的 Infra Agent 在超10万张国产芯片集群上,从零搭建并优化生产级推理系统,不到两周把端到端吞吐提升至初始基线的3.2倍。

阅读原文

国内新闻

5. 小米罗福莉官宣强化学习,直播训练一小时烧 3 万美元

沉寂半年后,小米大模型负责人罗福莉官宣 MiMo-V2.6,公开强化学习规模化细节:每个训练 Step 处理约20亿 Token,配置为1568个 Prompt 乘以每 Prompt 16条 Rollout,一轮即产生超2.5万条轨迹;系统采用全异步执行,生成、评分、训练不再严格排队。

阅读原文

二、AI大神

AI 博主 Peter Yang:用 8 个 AI skills 完成整档播客的完整工作流

Anthropic Claude Code 成员 Boris Cherny

1. Cowork 与聊天合并为单一 Claude

Anthropic 将 Cowork 与聊天合并为一个 Claude,目标是让助手带着上下文跟随你工作,文档、幻灯片与设计直接内置在对话里,无需切换工具即可打开、编辑并导出 PowerPoint 或 PDF。

阅读原文

Box CEO Aaron Levie

2. 高速低成本模型重塑企业 agentic 环节

Levie 指出,能以极快速度、极低成本、高能力处理信息,对数据分类、工作流路由、领域判断与安全裁量等企业关键闸门意义重大,这套模型与方法在 agentic 工作流中可能相当酷。

阅读原文

Every CEO Dan Shipper

3. 标签页时代终结

Dan Shipper 对 Anthropic 将 Cowork 与聊天合并为一个 Claude 激动喊出“标签页时代终结”,因为文档、幻灯片与设计都内置进对话,用户不再需要在多个产品标签页间来回跳转。

阅读原文

AI 博主 Peter Yang

4. 8 个 AI skills 完成整档播客

Peter Yang 用 8 个 AI skills 完成整档播客,同时保留自己的品味与判断:podcast-prep 调研嘉宾,podcast-edit 挑选片段,podcast-production 编排 5 个 skill 把节目变成…

阅读原文

FPV Ventures 合伙人 Nikunj Kothari

5. 自建家庭 agent 精细控制权限

Nikunj Kothari 分享捣鼓数月的 NousResearch Home agent 终于好用,这是他第一个与妻子日常共用的群组机器人,可精细控制只读某些邮件、转换附件为结构化数据、使用已登录浏览器会话。

阅读原文

工具学习

三、AI研究

编译式能动性:前沿通用编程智能体仅凭原始交互从零造出获胜玩家——从 Flappy Bird 到星际争霸 II 与文明

[Arxiv]

1. 编译式能动性:前沿通用编程智能体仅凭原始交互从零造出获胜玩家——从 Flappy Bird 到星际争霸 II 与文明

论文提出 Gauntlet 的“开发-冻结-评测”框架:通用编程智能体仅凭游戏描述、原始观测与动作接口及空策略文件,无任何策略或架构提示,须自主构建完整玩家,评测阶段零模型调用。在未公开 roguelike 上,单次会话冻结程序留出成功率 0 至 86%,最新系统每次会话均超越前代最佳;在星际争霸 II 中编译出的原始 API 控制器战胜全部公平内置 AI 及两个作弊变体,并在 Freeciv 中…

阅读论文

四、Agent工具

⭐ 5,337 stars/周

1. stablyai/orca — 编排多路并行编码代理

stablyai/orca 是面向并行 AI 编码代理的桌面 ADE,兼容 Codex、Claude Code 等任意 CLI 代理,每个代理跑在独立 git worktree,一条提示可分发 5 个代理并行执行,对比后合并胜者。

查看仓库

⭐ 3,488 stars/周

2. Panniantong/Agent-Reach — 一键打通代理全网视野

Panniantong/Agent-Reach 是给 AI Agent 一键装上互联网能力的「能力层」,不包装读取逻辑,只负责选型、安装、体检与路由,抓取由代理直接调用上游工具完成,因此无中间层损耗。

查看仓库

⭐ 3,266 stars/周

3. blader/humanizer — 抹除文本 AI 写作痕迹

blader/humanizer 是纯 Markdown 格式的 Agent 技能,在不改变事实含义的前提下重写文本,使其读起来像人写的,任何支持 skills 的代理都能直接安装使用。

查看仓库