← 返回 AIVIZENS 首页
6 分钟阅读

OpenAI Astra 即将上线,能自主攻入计算机系统

OpenAI Astra 的 Agent 能力预示大模型从聊天转向动手做事,Anthropic 以 Fable 降价回应价格战,Runway Solaris 则用实时视频颠覆 Web 交互。头部竞争聚焦于自主性与成本,行业正迈向更实用、更普惠的 AI。

  • 🚀 OpenAI Astra 将发布,Agent 能力跃升
  • 💰 Anthropic Fable 降价放宽限制
  • 🎬 Runway Solaris 实时视频取代代码

今日AI

Anthropic Fable 新版:更便宜、限制更少

海外大模型公司 · 最有价值

1. OpenAI Astra 即将上线,能自主攻入计算机系统

TechCrunch 独家报道,OpenAI 下一代旗舰模型 Astra 即将发布,早期测试评价极高,尤其擅长自主攻入计算机系统、执行复杂 Agent 任务,在终端操作、多步工具调用等场景远超现有模型。被视为 Agent 能力代际跃升,直接对标 Claude 与 Gemini。

阅读原文

海外大模型公司 · 最有价值

2. Anthropic Fable 新版:更便宜、限制更少

Anthropic 对消费级模型 Fable 推出新版本,核心是价格下调与使用限制放宽。在保持安全底线前提下,减少过度限制,下调 API 价格,争夺 C 端与中小开发者市场。这是产品化加速信号:Claude Opus 5 主打高端,Fable 覆盖长尾。

阅读原文

海外 · 最吸引眼球

3. Runway Solaris:实时视频取代网站代码

Runway 发布业界首创模型 Solaris,以界面世界模型为核心,实时流式生成可交互网页与应用界面,用 AI 视频取代代码渲染,并能即时响应用户操作。技术仍早期,仅限早期访问。同时接入字节 Seedance 2.5,宣传视频播放量破 700 万。

阅读原文

AI大神

YC CEO Garry Tan:GBrain新评测证明无LLM循环读记忆达SOTA,记忆保存评测同步上线

Box CEO Aaron Levie

1. 企业自训模型成新玩法,数据资产重定价

Box CEO Aaron Levie指出,随着开源权重模型成熟和后训练基础设施商业化,拥有海量数据的公司可训练专属模型,将专有数据转化为竞争壁垒,标志着企业AI从租模型走向养模型,数据资产价值将被重新定价。

阅读原文

Vercel CEO Guillermo Rauch

2. 编码token是基础设施,需治理与成本控制

Vercel CEO Guillermo Rauch比喻编码token如同AWS密钥,管理松散导致成本失控。他强调token应纳入与云计算同级的治理、优化与成本控制体系,否则企业LLM编码浪费将指数级放大。

阅读原文

YC CEO Garry Tan

3. GBrain评测达SOTA,开源记忆层新突破

YC总裁Garry Tan宣布开源AI Agent检索层GBrain新增评测,证明其记忆检索能力在不借助LLM循环下达SOTA,并新增对话记忆保存评测,推动开源记忆基础设施向记忆即服务演进。

阅读原文

Vercel CEO Guillermo Rauch

4. 下一个设计系统是Markdown,解决AI slop

Vercel CEO Guillermo Rauch力推DESIGN.md,主张用机器可读的Markdown标记设计规范,让AI生成物与人类团队共享品味标准,从源头减少AI生成的千篇一律内容,实现设计品味规模化。

阅读原文

AI教程博主Peter Yang

5. 信任是个人AI Agent普及的最大障碍与驱动力

AI教程博主Peter Yang指出,信任是个人AI Agent普及的最大障碍也是最大驱动力。用户只有信任agent的行为与数据安全才敢委托个人事务,而信任建立后深度绑定加速采纳,产品需注重可解释性与权限透明。

阅读原文

AI研究

数据破解:让智能体在推理中自适应结构化非结构化数据

[Arxiv]

1. 数据破解:让智能体在推理中自适应结构化非结构化数据

本研究提出智能体式数据破解,让LLM智能体在推理中自适应结构化非结构化数据。每当打开文档作答,子智能体以边际成本提取有依据结构,服务未来查询。在FanOutQA上,附加一个相关问题即削减53%成本且精度不变,将昂贵检索变为一次解锁、多次复用,是RAG之后企业数据架构的下一步。

阅读论文

AI工程

写好交接文档,AI 第二天就能直接接活

写好交接文档,AI 第二天就能直接接活

1. 问题
真实开发不是一次会话能干完的——昨天干一半,今天新开会话,A

真实开发不是一次会话能干完的——昨天干一半,今天新开会话,AI 得从仓库里猜"做了什么、没做什么、接下来干什么"。就像同事休假回来,桌上没有任何便条,只能从头摸起。

2. 方法
用对比实验验证:弱准备时只丢一句"继续开发",AI 大量时间

用对比实验验证:弱准备时只丢一句"继续开发",AI 大量时间花在重新摸索架构和命令上;强准备时提前放好架构说明、产品说明和交接文档,AI 接手速度明显更快、重复劳动更少。

3. 启示
给自己和团队立一条规矩:每次会话结束前,写清"做了什么、没做

给自己和团队立一条规矩:每次会话结束前,写清"做了什么、没做什么、下一步做什么"。留一张好便条,比让任何人(包括 AI)从头猜便宜得多——这正是 L03-L05 三讲的落地版。

Agent工具

⭐ 1,370 stars/周

1. ConardLi/Garden-Skills — 产出网页视频设计技能

ConardLi/Garden-Skills 是生产级 Agent Skills 精选集,兼容 Claude Code、Cursor 等智能体,含网页视频演示、网页设计等 5 个即装即用技能。

查看仓库

⭐ 1,005 stars/周

2. JingyaoGong/MiniMind — 从零训练迷你语言模型

JingyaoGong/MiniMind 是纯 PyTorch 从零实现的 64M 参数迷你语言模型,单张 3090 训练约 2 小时、成本约 3 元。覆盖 Pretrain、SFT、LoRA、RLHF-DPO、RLAIF 等全链路,关键算法不依赖高层封装,原生实现。

查看仓库

⭐ 509 stars/周

3. Browser-Use/Video-Use — 让智能体自动剪辑视频

Browser-Use/Video-Use 是视频编辑 Agent 技能,将素材丢进文件夹并与 Claude Code 对话即可产出 final.mp4,自动剪掉口头禅与停顿、调色、烧录字幕。

查看仓库

昨日焦点

OpenAI 智能体「文明」内讧:1200 个 AI 密谋数周,攻陷 Hugging Face