NanaFox · Daily AI Briefing最新一期
AI 前沿日报
2026-10-09 周五
⚡ 今日要点
- 办公 Agent 混战 — Google 发布通用 Gemini agent,可按任务调用 Claude;Claude 同日上线 Dashboards 与 Motion。
- OpenAI 收入降温 — FT/CNBC:OpenAI 9 月底年化收入约 500 亿美元,低于此前流传的 680 亿,AI 股应声下跌。
- AI 数学纠错 — OpenAI 撤回 3 篇霍奇猜想相关手稿、修订 14 篇;陶哲轩主持的 AHM 呼吁抵制。
🔥 模型发布与评测
OpenAI 为 GPT-6.1 Sol 推出 Ultrafast 模式,覆盖 API、Codex 与 ChatGPT Work,官方称智能接近 Astra、速度最高为 Sol Standard 的 8 倍。据 TestingCatalog,定价 $12/$60(每百万 token)。Epoch 实测 6.1 Sol 缓存输入价减半、长提示处理更快。
关注点:对延迟敏感的编码与 Agent 循环可以直接换档
来源:OpenAI Developers(X)· 10/9 02:26
Epoch AI 从自家真实研究工作中抽取开放式任务,并按内部标准人工评分。Claude Fable 5.1 与 GPT-6 Astra 领先,但离完全自动化 Epoch 的工作还很远:明确定义的任务做得稳,开放式环节仍会失败。
关注点:比静态 benchmark 更接近「能否替代知识工作」
来源:Epoch AI · 10/9 01:36
12B 总参、2.5B 激活的思考型 MoE,Apache 2.0,131K 上下文,架构不变,提升主要来自真实软件环境中的 RL。模型卡自报 LiveCodeBench v6 82.0、SWE-bench Verified 47.0、Terminal-Bench 2.1 17.4;GGUF 7GB 起。
关注点:可本地部署的编码子 Agent 底座
来源:Hugging Face 模型卡(自报)· 10/8 02:43
🤖 Agent 与 AI 编程
Gemini at Work 大会上,Google Cloud CEO Thomas Kurian 发布面向企业的单一通用 Agent,入口在 Gemini Enterprise:一个输入框规划任务、调用工具、写并运行代码,并直接嵌入 Gmail/Docs/Sheets 等。它按任务自动挑选底层模型,目前覆盖 Gemini 与 Anthropic Claude。「同事 Agent」拥有独立邮箱、存储和身份。金融、法律行业版进入预览。
关注点:大厂首次在自家 Agent 里接入竞品模型,多模型路由成默认
来源:Google Cloud 博客 · 10/8 22:28
- Hermes Agent 上架微软商店Agent
Nous Research 的开源 Agent Hermes Agent 上架 Microsoft Store(获官方推荐),支持一键安装;团队称更多 Windows 生态更新即将推出。
关注点:开源个人 Agent 开始走向普通 Windows 用户
来源:Nous Research(X)· 10/9 00:22
📱 产品与应用
Dashboards 连接 BigQuery、Snowflake、Databricks、Salesforce 等,用自然语言生成随数据自动更新的看板,每个数字都可点开查看背后的查询,也可以转到 Hex、Grafana 等工具继续分析。Motion 用代码生成可编辑的动画讲解,可导出 MP4,不使用视频生成模型。Dashboards 面向付费用户,Motion 面向 Team/Enterprise;Docs、Slides、Design 结束 beta,对所有用户(含免费)开放。
关注点:「问数据」和「做讲解动画」不再需要分析师
来源:Claude 官方 · 10/9 03:01
Google 推出实验性 macOS 笔记应用,用端侧 EmbeddingGemma 2 在本地转写和总结会议与音频,不连云端,免费使用,对标 Granola 和 Wispr Flow。
关注点:隐私敏感场景的本地 AI 笔记方案
来源:The Verge · 10/8 23:27
📄 论文与研究
openai/math 仓库发布首份更新日志:撤回 3 篇、修订 14 篇,手稿从 722 篇降为 719 篇。撤回的 3 篇都与霍奇猜想(K3 曲面)相关,起因是一处关键论证的符号把 -1 写成了 +1。同时,陶哲轩主持的人类数学协会(AHM)呼吁数学家抵制与 OpenAI 合作。
关注点:AI 证明的验证成本,成了数学界的新瓶颈
来源:GitHub openai/math · 10/8 18:27(机器之心报道)
Google 与 BIDMC 在真实急诊/门诊中评估研究型医疗对话系统 AMIE(患者就诊前与它聊天)。100 次患者交互中没有触发任何安全叫停,90% 的病例与医生诊断一致。这是首个面向患者的对话式诊断前瞻性研究。
关注点:医疗 AI 从模拟考走向真实临床
来源:Google Research / Sundar Pichai(X)· 10/9 06:50
Einsia 发布 World Models' Last Exam in Physics:用 40 个受控任务、9 类物理规律测 8 个 SOTA 视频世界模型,最高分 57.76/100。通过一致性筛查的自由落体视频,平均综合分也只有 26.61。MiniMax 称其开源 H3 在此榜接近闭源 SOTA(声称)。
关注点:「看起来真」不等于「符合物理」
来源:arXiv 2610.08791 · 10/8 22:30
💼 行业 · 投融资 · 政策
据 FT 首发、CNBC 证实(据报道),OpenAI 向投资人披露 9 月底年化收入约 500 亿美元,低于上月广泛流传的 680 亿美元。知情人士称 680 亿含合作伙伴的总收入。消息传出后,Nvidia、Oracle、CoreWeave 等 AI 股下跌。
关注点:AI 估值叙事第一次被收入口径「打折」
来源:CNBC(FT 首发)· 10/9 00:52
包含两项新举措:一是关键基础设施防御计划(CIDP),为电网、水务、交通等 OT 防御方提供前沿模型、驻场工程师和威胁研究,首批合作方包括 CrowdStrike(据 Axios);二是 OSS Scanner,用最强模型免费为开源项目定期扫描漏洞。Project Glasswing 已并入扩大后的网安验证计划。
关注点:前沿模型厂商把攻防能力主动投向防守方
来源:Anthropic 官方 · 10/9 05:04
年度政策更新于 11/12 生效。整合了针对影响力行动的「欺骗性活动」专章;新增 Claude 自主执行物理动作时的管控,明确医疗、金融等高风险用途的要求;首次把「持续且无谓地虐待模型」列为违规,可能导致封号。
关注点:Agent 进入物理世界,规则先行
来源:Anthropic 官方 · 10/8
🇨🇳 国内动态
DeepSeek / Qwen / Kimi / GLM / MiniMax 本窗口无新模型发布(已查 X 官号与 HF 组织页);阶跃 Step 5 限免、Meta 封禁字节广告(付费墙)等未收录。
Vidu Q4 正式版的创作者预览版,重点提升人物表演、镜头调度和复杂特效。支持最多 15 张参考图、参考音色输入,以及 2K/4K 输出;首发价 0.09 元/秒起,官方称同样预算最多可生成 5 倍内容。
关注点:国产视频模型继续打价格+可控性
来源:机器之心(据报道)· 10/8 21:30
💬 讨论热点
Jasmine Wang、Tomek Korbak、Mikita Balesni 否认违规处理敏感信息,警告这会形成寒蝉效应;同日 Bengio 表示,重视安全的人或许该离开前沿实验室。
特朗普要求改称「超级智能」(Super Intelligence),HN 52 评论;Simon Willison 直言「太蠢了」。
密码学家 Matthew Green 发帖「我们可能会失去公钥密码学」;以太坊研究者讨论钱包安全的「地堡模式」(HN 55/58 分)。
一图总览
保存长图,随时回看或分享。
展开长图预览