概览
OpenAI 成立数学顾问组,学界质疑公关动作
早上好,AI科技爱好者们!以下是今天最值得关注的 AI 洞察,5 分钟带你看懂全局。
OpenAI 以顾问组回应数学界反弹,却未交出研究配速权,护栏与公关的边界愈发模糊;今日给大家分享一个来自“Aurélien Amacker”的“systeme.io 两年做到 $1M ARR”OPC案例。
- 💡 systeme.io 两年做到 $1M ARR
- 📰 OpenAI 成立数学顾问组:模型解出 100+ 公开难题
- 📰 谷歌开源 EnvHarness:训练环境会随智能体进化
- 📰 阶跃 Step 5 Preview:27B 激活登全球开源第二
- 👤 Coinbase 让 AI agent 自开钱包
OPC分享
一、OPC案例
分享者:Aurélien Amacker

systeme.io 两年做到 $1M ARR
法国创业者 Aurélien Amacker 在里斯本经营 systeme.io——把销售漏斗、邮件营销、在线课程、联盟计划与结账打通的 all-in-one 平台,现拥有 300 万账户和 90 人团队,月收入超过 $83K。平台 2018 年 4 月上线,2019 年 10 月月收入已到 $70K,第二年末突破 $1M ARR。全程零融资、零付费投放,增长靠口碑与联盟营销,团队成员是分布式的,创始人不写代码,每天只工作 4 小时,信奉「增长是手段,不是目标」。
$83K 美元月度营收
今日精选
二、今日AI

海外新闻
1. OpenAI 成立数学顾问组:模型解出 100+ 公开难题
OpenAI 成立「数学与人工智能顾问组」,挂靠普林斯顿高等研究院,首批 9 位数学家,仅 1 人曾签署菲尔兹奖得主联名信。该组可评估成果、协调发布,但无权干涉内部研究进度。OpenAI 称内部模型已解决 100 多个公开数学难题。学界质疑:无减速权、成员自定资格,这究竟是护栏还是公关动作。
海外新闻
2. 谷歌开源 EnvHarness:训练环境会随智能体进化
谷歌云联合学术伙伴开源 EnvHarness(Apache 2.0),把静态智能体训练环境变成随弱点动态调整的「活环境」。它外挂可编程层,改变起始状态、可见信息、动作与任务时长,底层环境与验证器不变。五类基准上留出任务最高提升 9 分,软件工程任务步骤更少。
海外新闻
3. Meta Muse 首 12 天下载超 ChatGPT 同期
Apptopia 估算,Meta AI 助手 Muse 上线前 12 天移动端下载量超过 ChatGPT 同期(美加市场)。iOS 口径 Muse 180 万次,ChatGPT 130 万;全球安装 280 万。美国手机日活 Muse 64.2 万,ChatGPT 仅 23.1 万。
国内新闻
4. 阶跃 Step 5 Preview:27B 激活登全球开源第二
阶跃星辰发布 Step 5 Preview:MoE 架构,总参数 600B、激活 27B,支持 1M 上下文。Artificial Analysis 评测 44 分,升至全球开源模型第二,接近万亿参数模型水平。定价百万输入 1 美元、输出 2.7 美元,单任务成本约为 Opus 5 的 12.5%。
国内新闻
5. 清华联手无问芯穹开源 RPent:给机器人装上大模型大脑
清华、无问芯穹与正行创新联合开源具身智能体基础设施 RPent,把大模型任务规划与 VLA 精细操作结合,形成感知、决策、执行、纠错闭环,并将经验沉淀为可复用能力。LIBERO-PRO 成功率 92.6%,端到端速度优化 7 倍以上。真机可倒钢珠、双臂擦盘、移开遮挡找物,目标改变时先观察再重新规划。
三、AI大神

Coinbase CEO Brian Armstrong
1. Coinbase 让 AI agent 自开钱包
Armstrong 指出信用卡每笔约 30 美分固定费让 1 美分付款毫无意义,而 76% 的 agent 电商交易低于 30 美分,因此 Coinbase 让 agent 用一条提示词开通自托管钱包账户且无需 KYC,不让 AI 无银行…
Vercel CEO Guillermo Rauch
2. agent 测试软件彻底性无人能及
Rauch 称 agent 测试与 QA 的彻底性无可匹敌:为复现内嵌浏览器渲染 bug,它一路复现、模拟、修复、部署,还创建临时 Vercel 部署丢进 iPhone 模拟器实测,人类永远追不上这种强度。
Box CEO Aaron Levie
3. agent 蜂群让老式安全形同虚设
Levie 转评疯传的 1990 年代 IT 安全梗图称,对 agent 蜂群而言那种物理隔离、断网、机房门禁的老式安全字面意义上不可穿透,直接对照今天 agent 蜂群能横扫的自动化攻击面。
OpenClaw 作者 Peter Steinberger
4. 新基准让模型在星际争霸对决
Steinberger 发布新基准 Brood War Bench,把 Codex、Claude Code、Grok 等模型拉进《星际争霸:母巢之战》实战对局,用录制的 Protoss 战斗画面呈现结果,回答哪个模型能赢下星际。
FirstMark 投资人 Matt Turck
5. 模型热度半衰期只剩一周
Turck 调侃模型热度的半衰期:所有人都在为 Jev 疯狂,而他还记得上周中大家满嘴都是 Instinct,评论区补刀说模型发布的半衰期大约只剩一周。
工具学习
四、AI研究

[Arxiv]
1. 语言模型的测谎测试:读出模型不愿透露的知识
研究提出「内部识别探测」(PIR),借鉴取证学的隐藏信息测试,把问题与候选答案一并输入模型,再从内部状态读出它认出了哪个答案,属无需参照模型和真值标注的无参考方案。在 Gemma、Qwen、Llama、Mistral、Phi 五个家族八个模型上,PIR 以 0.70 至 0.87 的平衡准确率恢复被识别答案,远高于 0.28 至 0.40 的未知项基线与 0.25 随机率;面对提示欺骗、sand…
五、Agent工具
⭐ 14,864 stars/周
1. cloudflare/security-audit-skill — 把编码代理变成审计员
cloudflare/security-audit-skill 是 Cloudflare 开源的编码代理技能,让 AI 代理变身安全审计员,自动完成侦察、覆盖引导搜寻、候选验证、结构化输出、独立复核与报告六阶段,产出 findings.json 与 REPORT.md。
⭐ 1,457 stars/周
2. vastsa/PI-Desktop — 为代理打造桌面工作站
vastsa/PI-Desktop 是本地优先的 AI 代理桌面工作台,基于 Electron、Rust 内核与 pi Agent Harness,跨 macOS、Windows、Linux,项目、会话、评审、预览与代理各居独立工作区,不绑定某个 IDE 或终端。
⭐ 1,298 stars/周
3. anthropics/knowledge-work-plugins — 为模型装上岗位插件包
anthropics/knowledge-work-plugins 是 Anthropic 开源的 11 个岗位插件,为 Claude Cowork(兼容 Claude Code)注入职能专长,覆盖生产力、销售、客服、产品、市场、法务、财务、数据、企业搜索、生物研发与插件管理。