AI资讯日报 · 2026年10月9日(星期五)
今日速览:OpenAI 与 Anthropic 本周正面交锋——GPT-6 全面免费开放并带来会"长出界面"的 Intelligent UI,Claude Haiku 5.5 则以约 1/10 的价格对标,同日 OpenAI 自曝年化营收约 500 亿美元、低于此前传闻的 680 亿,算力链股价应声齐跌。数学圈被 OpenAI"722 篇手稿"搅翻天:3 天内撤回 3 篇,陶哲轩公开喊话减速,25 位菲尔兹奖得主联名上书,而新基准 PaperBenchX 显示最强模型完整复现论文的概率仅 13.98%。就业与产业侧,美国暂停微软等大厂的绿卡担保资格,Manus 携超 5 亿美元融资重返北京,Docker 正式下场 Agent 基础设施。
🏫 高校教育者必知
GPT-6 全面免费开放,同步公布青少年专项安全评测
- 摘要:OpenAI 宣布 GPT-6 向全员推送:付费用户 10 月 7 日起用 GPT-6 Sol,免费和 Go 用户 10 月 8 日起用 GPT-6 Luna;聊天新增 Intelligent UI,能按问题生成可点击的图示、对比表甚至计算器小游戏。同日发布的 24 页部署安全报告含 18 岁以下用户专项评测,"情感依赖"指标从 GPT-5.6 Luna 的 0.927 降至 GPT-6 Luna 的 0.734。
- 关注点:学生端主力工具一夜之间全体升级且免费,课堂演示、作业辅导场景立刻变了;报告中的青少年情感依赖、多轮越狱防线数据,是和学生讨论"AI 使用边界"的现成素材。
- 来源:OpenAI 官方 | 量子位
陶哲轩"倒戈"AI 减速派,25 位菲尔兹奖得主联名公开信
- 摘要:曾在 IPAM 会议上称数学 AI 已"ready for primetime"的陶哲轩,在 SAIR 最新演讲中调转方向,公开喊话模型公司"必须慢下来、别解数学问题";陶哲轩、邓煜等 25 位菲尔兹奖得主联名公开信,肯定 LLM 数学能力的跃升,但明确反对把"解决数学问题"当作基准测试,认为这对数学科学和共同体有害。
- 关注点:"AI 能解题 ≠ 学生学会了",直接关系数学/编程类课程的评价设计与作业改革;顶尖数学家对 AI 评价标准的反弹,也是研究生组会讨论科研价值观的好案例。
- 来源:量子位·陶哲轩演讲 | 量子位·公开信
PaperBenchX:最强模型端到端复现论文的完整率仅 13.98%
- 摘要:UniPat AI 发布 PaperBenchX 基准——93 个真实论文复现任务,覆盖电磁、化学、材料、生物、机器人等 12 个方向、3168 条专家校验评分项;表现最强的 GPT-6 Astra 完整复现率只有 13.98%。背景是 OpenAI 上月刚宣布其模型 88 小时"攻克"千禧难题 N-S 方程。
- 关注点:指导学生用 AI 做科研时的核心提醒——会"解难题"不等于能可靠地做完一项研究;复现、验证、可检验性应写进研究生科研训练和学术诚信教育。
- 来源:量子位
OpenAI 开源 722 篇数学手稿,三天后撤回 3 篇
- 摘要:10 月 7 日 OpenAI 把内部未发布模型产出的 722 篇数学手稿(372 组结果,涉及准黎曼猜想、BSD、霍奇猜想等)连同代码、Lean 证明传上 GitHub;同日在历史页记录因一个符号错误撤回 3 篇 K3 曲面/Hodge 相关论文、修订 14 篇,顶级结论的 Lean 形式化率约 42%(300/719)。三位菲尔兹奖得主强调"这不代表认可"。
- 关注点:这是"AI 科研质量"的绝佳一手教学案例库——从发布、撤稿到修正的全过程都公开可查;也再次凸显 Lean 等形式化验证在数学/CS 教学中的地位。
- 来源:OpenAI math 仓库历史记录 | 量子位
Anthropic 承诺 1.5 亿美元支持美国"Genesis Mission"AI 科研计划
- 摘要:10 月 8 日,Anthropic 宣布三年投入 1.5 亿美元,把 Claude 提供给 NASA、NIH、NSF 等 15 个以上联邦机构,用于 AI 加速科学发现;该承诺在白宫科技政策办公室"Science: A New Golden Age"峰会上宣布。
- 关注点:政府级"AI for Science"投入正式落地,NSF/NIH 体系内 AI+学科交叉的资助风向明显,对国内科研管理和课题布局都有参照意义。
- 来源:Anthropic 官方
💻 从业者必跟
Claude Haiku 5.5 发布:小模型价格战再升级
- 摘要:Anthropic 10 月 7 日发布 Haiku 5.5,官方定位"最快、最便宜、最能打的小模型":跑分超越 GPT-6 Luna、DeepSeek V4.1 Flash 和 GLM-5.3-Flash;10 万 token 以内的请求输入输出降价 90%,是首个支持 effort 五档调节的 Haiku。OSWorld 2.1 上 Low 档准确率 42%(单次 $0.07)、Max 档 72.4%($0.61)。注意换了新 tokenizer,同任务 token 消耗会增加。
- 关注点:高并发、批处理场景(题库批改、日志分析、RAG 离线评测)的性价比新选;但 Terminal-Bench 4.0 仅 39.2%(Sonnet 5.5 为 70.6%),复杂 Agent 编码仍请用 Sonnet/Opus 5.5。
- 来源:Anthropic 官方 | 量子位
开发者热议 DeepSeek 4.1 Flash:"行业为什么不慌?"
- 摘要:博客文章《Why Isn't The Industry Freaking Out About DeepSeek 4.1 Flash?》登上 HN 热榜(350+ 分):作者重度使用一个月后认为体验接近 Opus 而价格低几个数量级——OpenRouter 标价输入 $0.3/百万 token、输出 $1.2/百万;"够用"正在改变开发者的工作方式。
- 关注点:低成本模型 + 高频调用的开发范式值得实测(批量标注、探索性测试);国产小模型在海外开发者社区的口碑变化,是技术选型的重要风向标。
- 来源:dgt.is 博客 | OpenRouter 定价
阶跃星辰 Step 5 Preview 登陆 OpenRouter:1M 上下文 MoE
- 摘要:StepFun Step 5 Preview 现身 OpenRouter,100 万 token 上下文(API 实测确认),定价输入 $1/百万、输出 $2.7/百万;阶跃终端同时宣布 10 月 13 日在上海发布首款"大模型原生智能体手机" STEPX Neo。
- 关注点:长文档问答、代码库级 RAG 又多一个 1M 档可选项,可在 OpenRouter 直接试用;10 月 13 日发布会可蹲一下"智能体原生手机"这个新形态。
- 来源:OpenRouter | 量子位·STEPX Neo
OpenAI 披露年化营收约 500 亿美元,算力链股价齐跌
- 摘要:10 月 8 日 CNBC 证实,OpenAI 告知投资者 9 月底年化营收约 500 亿美元,明显低于此前广泛报道的 680 亿(后者把合作伙伴总收入计入);Q3 整体 run-rate 增速 77%、企业业务 107%。英伟达跌 3%、甲骨文近 6%、CoreWeave 近 8%、AMD/博通跌 4%、英特尔跌 5%。
- 关注点:头部实验室"真实收入 vs 基建投入"的剪刀差是行业最大风险变量;做算力预算、长期 API 采购决策前,先看清这条基本面。
- 来源:CNBC
Docker 官方下场:开源 Agent Builder 与运行时
- 摘要:docker/docker-agent 仓库("AI Agent Builder and Runtime by Docker Engineering")10 月 7 日冲上 HN 热榜(294 分),累计 4.2k 星,Docker 正式进军 Agent 基础设施。
- 关注点:用容器标准化 Agent 运行时(沙箱隔离、依赖管理、权限控制)正成为工程标配;自建 Agent 平台前可先评估 Docker 方案。
- 来源:GitHub
Anthropic 成立"Cyber Mission",长期押注 AI 安全防御
- 摘要:10 月 8 日 Anthropic 启动 Anthropic Cyber Mission,为关键基础设施防守方和开源社区提供工具、研究与资源(首批含 Project Glasswing 成果),直面前沿模型被滥用于漏洞利用的风险。
- 关注点:大模型厂商深度介入安全领域,AI 安全类横向课题、校企合作和竞赛方向会持续升温。
- 来源:Anthropic 官方
Anthropic 年度使用政策更新,11 月 12 日生效
- 摘要:10 月 8 日发布新版 Usage Policy:补充影响操作、武器开发、监控等新滥用模式,明确健康、金融等高风险场景要求,新增对"Claude 自主执行物理动作"的管控,并禁止对模型的辱虐行为。
- 关注点:正在做 Claude 相关应用(Agent、自动批改、校园助手)的团队请对照新条款自查,特别是自主物理动作与健康金融边界。
- 来源:Anthropic 官方 | The Verge
🌍 新产品·大事件
美国暂停微软等大厂绿卡担保资格
- 摘要:10 月 8 日,特朗普政府宣布暂停微软等科技公司通过 H-1B 通道为员工担保绿卡的资格,副总统万斯表态"要雇美国工人";NYT、WSJ、Politico、AP 多家媒体确认。
- 关注点:科技行业雇佣与移民政策同时收紧,直接影响毕业生留美求职路径——学生咨询和就业指导的高频问题。
- 来源:NYT | Politico
Manus 携超 5 亿美元融资重返北京
- 摘要:10 月 8 日消息,Manus 母公司蝴蝶效应完成超 5 亿美元新融资(博裕、IDG 领投,腾讯、红杉中国、真格跟投),重启北京办公室,开放 17 个岗位(Agent Harness、Agent 评测、LLM 算法等),开发面向国内市场的 Agent 产品;此前公司经历了迁往新加坡、裁撤中国团队、Meta 收购被叫停等一波三折。
- 关注点:国产 Agent 赛道资本回暖的标志性事件;Agent 评测、Harness 工程等新岗位名称,值得写进就业指导材料。
- 来源:量子位
OpenAI"疯狂 28 天"进行中:日更改进或全量重置,还要加广告
- 摘要:Codex 负责人 Tibo 承诺连续 28 天"每天要么交付一项明显改进、要么全额重置额度",10 月 6 日首日交出 GPT-6 Astra/6.1 Sol 默认推理提速 50%;同一时间 OpenAI 确认将在 ChatGPT 中引入广告。
- 关注点:免费用户持续白嫖新模型 + 额度重置,是学生目前最实惠的高级 AI 通道;而"广告进 AI 对话"是行业变现模式的拐点,课堂讨论、视频选题都很带话题度。
- 来源:量子位·疯狂28天 | 量子位·28天承诺
独立 AI 影视公司的视频模型冲上全球第二
- 摘要:Artificial Analysis 最新文生视频盲测榜:阿里 Wan 3.0 居首,独立 AI 原生影视公司 Utopai Studios 的 Utopai X 以 1150 分拿下第二(仅差 7 分);据福布斯估算公司估值已达约 10 亿美元,CEO 是曾在 Google X 工作的 00 后华裔创业者 Cecilia Shen。
- 关注点:"影视公司自研视频模型"路线跑通,AI 影视是大众传播和内容创作的热门富矿选题。
- 来源:量子位
Anthropic 明令禁止"辱虐"Claude,AI 福利争议再起
- 摘要:The Verge 报道,Anthropic 在年度使用政策更新中新增条款,禁止用户对 Claude 实施"辱虐或残忍行为",AI 福利(model welfare)话题再度升温。
- 关注点:天然的破圈话题——"该不该对 AI 礼貌"适合做短视频互动选题,也可引出人机交互课程中的伦理讨论。
- 来源:The Verge
AI 数学进展惊动加密圈:Vitalik 支持"掩体模式"
- 摘要:10 月 8 日 Cointelegraph 报道,以太坊创始人 Vitalik Buterin 等人支持加密行业进入"bunker mode"——因 OpenAI 数学能力快速进展(722 篇手稿涉及大量数论结果),业界担忧钱包密码学安全可能在数月内受到威胁。
- 关注点:"AI 数学突破 → 现实安全焦虑"的传导链极具传播性,也是和学生聊密码学、AI 长期风险的绝佳切口。
- 来源:Cointelegraph
📌 今日一句话
AI 一夜能写出 722 篇数学论文,完整复现一篇旧论文的概率却只有 13.98%——会解题不等于会做研究,这句话请转给每一个用 AI 写作业的学生。