← 返回 AIVIZENS 首页

概览

6 分钟阅读

GPT-6 Astra 刷穿数学最后高墙

前沿模型在数学研究级评测上逼近饱和,Anthropic 却主动提出放缓节奏、引入第三方核验,安全与能力开始分道竞速。国内侧,Kimi 以百万上下文下放和上市冲刺抢占身位,机器人数据与自我进化模型成为新战场。

今日 AI 简报
  • 🧮 GPT-6 Astra 攻破 FrontierMath Tier 4
  • 🛡️ Anthropic 提配速前沿,Altman 马斯克呼应
  • 🤖 Mecka AI 估值逼近 5 亿美元

今日精选

一、今日AI

Mecka AI 逼近 5 亿美元估值,机器人训练数据成新争夺点

海外新闻

1. Anthropic 提「配速前沿」三策略,Altman 马斯克呼应放缓

Dario Amodei 9 月 12 日发博客提出放缓前沿 AI 三大策略,并宣布 Anthropic 单方面承诺其一:向第三方评估员(如 METR)开放工牌、工位及风控权限,核验节奏与安全承诺。另两策为协调民主国家共同安全标准、限制对华芯片与设备出口并打击蒸馏,以拉大美国 3-5 年领先优势。

阅读原文

海外新闻

2. GPT-6 Astra 刷穿 FrontierMath Tier 4,数学最后高墙倒塌

Epoch AI 宣布 FrontierMath Tier 4 饱和:GPT-6 Astra 攻破唯一从未被解出的题,修订后 43 道全部至少被解出一次,OpenAI 公布成绩 97.6%。

阅读原文

海外新闻

3. Mecka AI 逼近 5 亿美元估值,机器人训练数据成新争夺点

Mecka AI 正推进红杉资本领投的新一轮融资,估值约 5 亿美元,距其 6 月 6000 万美元融资仅三个月。公司付费请人佩戴身体传感器、用手机录制做咖啡、修车等日常动作,为通用机器人采集稀缺的物理世界数据,模式效仿 Scale AI。

阅读原文

国内新闻

4. Kimi 突发 K2.8:百万上下文全员开放,性能逼近 K3

月之暗面 9 月 11 日在 Kimi Code 与 Kimi Work 全量上线 K2.8 Preview,官方称综合性能接近旗舰 K3,Coding 与 Agent 能力提升,最实质变化是所有会员档位均可用 1M 上下文(此前需 199 元/月以上)。

阅读原文

国内新闻

5. 生数 Motus2 世界模型:机器人开始「自我进化」

生数科技发布 Motus2 世界模型,在单一模型内同时实现行动、预测、评估三棵技能树:WAM 生成动作、AC-WM 预测后果、VM 评估结果,形成闭环,初步探索递归自我改进(RSI)。

阅读原文

二、AI大神

Every CEO Dan Shipper: 榜单分数预测不了你的真实工作, 他们把vibe check升级成量化个人基准

Meta AI高级总监Madhu Guru

1. 企业AI失败三大根因与解法

Madhu Guru认为企业AI失败源于沿用旧产品剧本、低估eval、中央团队从外部造AI,导致与一线脱节。他建议招AI产品领导、把eval当一等公民、让AI builder嵌入业务部门。

阅读原文

Coinbase CEO Brian Armstrong

2. AI需要自己的银行账户与加密轨道

Brian Armstrong指出76%的agent交易额不足30美分,刷卡手续费吃掉利润,因此AI需要自托管账户和加密轨道。Coinbase已让agent一键开户、发币融资,并用Toshi沉淀团队大脑。

阅读原文

Every CEO Dan Shipper

3. 榜单分数预测不了真实工作

Dan Shipper认为benchmark分数不能说明模型在真实工作上的表现,因此Every坚持做vibe check,并搭建内部平台让每个人基于日常工作构建个人基准,从感觉走向可比较的数据。

阅读原文

Box CEO Aaron Levie

4. 把Box挂载到agent沙箱读写文件

Aaron Levie介绍可将Box挂载到agent沙箱,让agent像人一样读写文件。他认为AI agent执行关键工作流时需要文件系统访问、权限与内容上下文,而非在对话里搬运内容。

阅读原文

AI教程作者Peter Yang

5. 本地任务给Codex,云端迁Grok Bot

Peter Yang公布工具分工:本地定时任务用Codex,云端任务迁至Grok Bot。他对软件工厂泼冷水,认为AI还不足以在无人定义需求或验收下端到端自造新功能,错误假设会白烧token。

阅读原文

工具学习

三、AI研究

COBRA-Skills:用上下文老虎机引导智能体技能进化

[Arxiv]

1. COBRA-Skills:用上下文老虎机引导智能体技能进化

COBRA-Skills 把 LLM 智能体的技能优化重新表述为动态候选空间上的预算化序列优化,用上下文老虎机做优先级调度:神经奖励预测器配合 LinearUCB 探索奖励对候选技能排序,把有限评估预算优先分给最有潜力或信息量最大的候选,再依据执行反馈持续精炼技能种群。在 6 个异构智能体基准、3 个目标模型上平均表现最强,每个基准仅用 50 个优化样本,且目标模型自身即可完成技能生成与精炼。

阅读论文

四、Agent工具

⭐ 3,829 stars/周

1. obra/superpowers — 给编码智能体的完整开发方法论

obra/superpowers 是一套面向编码智能体的完整开发方法论,由 Jesse Vincent 出品,构建在可组合 Skills 之上。它解决智能体拿到需求就盲目写码的问题:先反问澄清、拆规格供人确认,再生成实施计划,最后以 subagent 逐任务执行并做两阶段评审。

查看仓库

⭐ 2,765 stars/周

2. coreyhaines31/marketingskills — 为 AI 智能体补营销技能包

marketingskills 是 Corey Haines 打造的 AI Agent 营销技能包,把转化优化、文案、SEO、分析、增长工程等动作封装成 Markdown 技能文件,兼容 Claude Code、Codex、Cursor 等支持 Agent Skills 规范的智能体。

查看仓库

⭐ 1,810 stars/周

3. mksglu/context-mode — 智能体会话上下文压缩一半再一半

context-mode 是一个解决上下文膨胀的 MCP 服务器,由 mksglu 开发。它针对每次工具调用把原始数据灌进窗口的问题,用沙箱工具把数据挡在窗口外,可将 315KB 压缩到 5.4KB,削减 98%。

查看仓库