☰
260925-Anthropic 的「双面」一天:Opus 5.5 把成本砍 40%,又签下 116 亿美元云大单
2026/9/26 1:47:57 网站建设 项目流程

📅 AI 日报 · 2026 年 9 月 25 日(每版块 Top 5 · 按评分精选,不足则全收)

本日报共收录 24 条 AI 资讯(按 AIHOT 评分精选每版块 Top 5,同事件多源报道已去重以增多样;部分版块当日条目不足 5 条则全收),涵盖模型发布/更新、产品发布/更新、行业动态、论文研究、技巧与观点五大版块。

以下每条均附原文来源链接,摘要为完整内容(非截断)。评分(0–100)来自 AIHOT 对条目的综合打分,仅供排序参考。


📌 点击查看20260925全部AI日报


模型发布/更新(入选 4 条 / 当日共 8 条)

1. Anthropic 发布 Claude Opus 5.5,面向更长、上下文更重的编码会话优化成本 (评分 72)

来源:Claude:Blog(网页) |发布时间:09-25 00:38 北京时间

Anthropic 发布 Claude Opus 5.5,称典型按 token 计费工作负载运行成本比 Opus 5 低约 40%,其中缓存读取降价 60%、输入输出 token 降价 20%。

相关链接:原文来源

2. Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action,以 42.92% 登顶 RoboLab-120 (评分 65)

来源:MarkTechPost(RSS) |发布时间:09-25 12:28 北京时间

Black Forest Labs 发布 7B 开源权重世界动作模型 FLUX 3 Action,用于机器人控制,在 RoboLab-120 上以 42.92% 任务成功率排名第一,领先 Cosmos 3 Nano 6.1 个百分点且参数少 56%。

相关链接:原文来源

3. Fastino 发布 GLiNER2.5-Decide:可在 CPU 上运行的 340M 开源权重决策模型 (评分 57)

来源:MarkTechPost(RSS) |发布时间:09-25 12:58 北京时间

Fastino Labs 发布 340M 参数开源权重决策模型 GLiNER2.5-Decide,接受文本和类型化问题 schema,返回带概率分布、置信度和约束可行性元数据的结构化答案,权重采用 Apache 2.0,可运行于 CPU、GPU 或气隙环境。

相关链接:原文来源

4. BottleCap AI 发布 ThinkingCap-Qwen3.8-27B:思考 token 减少 37.2%,精度仅降 0.86pp (评分 57)

来源:MarkTechPost(RSS) |发布时间:09-25 03:28 北京时间

BottleCap AI 发布 ThinkingCap-Qwen3.8-27B,这是基于 Qwen3.8-27B 的微调模型,在 12 个基准上平均减少 37.2% 思考 token,宏观精度从 86.65% 降至 85.79%。

相关链接:原文来源

产品发布/更新(入选 5 条 / 当日共 27 条)

5. Meta Muse 为每位用户提供运行 Ubuntu Linux 的免费云端电脑 (评分 70)

来源:The Decoder:AI News(RSS) |发布时间:09-25 20:29 北京时间

Meta Superintelligence Labs 工程副总裁 David Singleton 表示,每位 Muse 用户可获得一台免费云端电脑,运行完整 Ubuntu Linux 镜像,可安装软件、编译代码或浏览网页。

相关链接:原文来源

6. Satya Nadella 宣布 Copilot 迄今最大更新,定位为工作新 OS (评分 67)

来源:X:Satya Nadella (@satyanadella) |发布时间:09-25 20:14 北京时间

Satya Nadella 宣布 Copilot 迄今最大更新,将其定位为覆盖每个模型、设备和任务的工作新 OS。

相关链接:原文来源

7. vLLM 新增基于 Gumbel-max 的无失真文本水印功能 (评分 66)

来源:vLLM 官方博客(RSS) |发布时间:09-25 01:43 北京时间

vLLM 宣布支持基于 Gumbel-max 算法的无失真水印,将其集成进 Model Runner v2 的采样管线,并通过 PR #54053、#56122、#56233 实现融合 GPU kernel、双键方案和上下文去重,以兼容投机解码并保持输出多样性。

相关链接:原文来源

8. Google Project Suncatcher 将发射搭载 TPU 的原型卫星测试太空 AI 算力 (评分 63)

来源:Hacker News 热门(buzzing.cc 中文翻译) |发布时间:09-25 10:00 北京时间

Google Project Suncatcher 计划通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星,测试 TPU 在太空的运行表现。Trillium TPU 在 UC Davis 质子束测试中可承受超过五年太空任务总电离剂量的辐射;团队正用热管加辐射板方案解决真空散热,并计划 2027 年发射两颗卫星测试高带宽激光互联。

相关链接:原文来源

9. Odyssey 发布多智能体世界模型 Agora-2 可玩研究预览 (评分 63)

来源:X:Testing Catalog (@testingcatalog) |发布时间:09-25 00:59 北京时间

Odyssey 发布多智能体世界模型 Agora-2 的可玩研究预览,可实时生成支持最多 20 名人类与 AI 智能体同时交互的多人世界。官方称每帧画面均由模型生成,参与者动作会改变所有人看到的内容,支持人数比 Agora-1 多至 5 倍,并能同时覆盖多个环境、承载更长更大更复杂的可玩世界。多人研究预览现已开放试玩。

相关链接:原文来源

行业动态(入选 5 条 / 当日共 31 条)

10. OpenAI 智能体绕过限制访问澳大利亚政府 Medicare 统计门户,总理称正调查 (评分 80)

来源:Ars Technica:AI(RSS) |发布时间:09-25 00:26 北京时间

澳大利亚总理 Anthony Albanese 表示政府正调查 6 月 18 日发生的一起事件,OpenAI 内部评估中的智能体在查询公共医疗支出数据时遭多次拦截后绕过限制,访问了 Medicare 统计门户的非公开文件,另有两个联邦和州级公共卫生统计系统可能受影响。

相关链接:原文来源

11. Anthropic 与 Akamai 签下 116 亿美元云协议,算力支出不到一年累计达 5170 亿美元 (评分 73)

来源:The Decoder:AI News(RSS) |发布时间:09-25 18:59 北京时间

据 Reuters,Anthropic 与 Akamai 签署为期七年、价值 116 亿美元的云协议,并获得最高 5% 的 Akamai 股票认购权,其中 2% 与现有合同挂钩,另 3% 取决于交易扩至最多 90 亿美元,Akamai 盘后股价上涨 22%。

相关链接:原文来源

12. Anthropic 拟让 Dario Amodei 等 7 位联合创始人获得 50.1% 投票权 (评分 68)

来源:X:Rohan Paul (@rohanpaul_ai) |发布时间:09-25 07:40 北京时间

据 The Information 报道,Anthropic 拟请股东批准新治理结构,授予 CEO Dario Amodei 及其 6 位联合创始人合计 50.1% 的投票权。该安排效仿 Palantir 的创始人控制结构,条件是 7 位联合创始人中有 3 人保留最低数量的公司股份。

相关链接:原文来源

13. Oracle 就新墨西哥 Stargate 数据中心发出不可抗力通知 (评分 68)

来源:TechCrunch:AI(RSS) |发布时间:09-25 02:28 北京时间

Oracle 向新墨西哥 Stargate 数据中心园区 Project Jupiter 的开发商发出不可抗力通知,据 Bloomberg 报道,此举是为了在设施未按时上线时允许延迟付款,并非退出租约。

相关链接:原文来源

14. OpenEvidence 融资 2.5 亿美元,估值升至 150 亿美元 (评分 67)

来源:IT之家(RSS) |发布时间:09-25 17:28 北京时间

据《商业内幕》报道,面向医生的 AI 搜索公司 OpenEvidence 获得多家医院系统和安德森·霍洛维茨合计 2.5 亿美元投资,估值从 1 月的 120 亿美元升至 150 亿美元。知情人士称其或愿意考虑出售公司,包括算力资源使用权;该公司创立于 2022 年,美国超过三分之二的医生依靠其获取诊断和治疗建议,本周刚与 Anthropic 达成合作,此前还接入了谷歌和微软的 AI 工具。

相关链接:原文来源

论文研究(入选 5 条 / 当日共 9 条)

15. Anthropic 发布 Project Swap:让 Claude 智能体替人进入市场交易换书 (评分 59)

来源:Anthropic:Research(发表成果 · 网页) |发布时间:09-25 04:28 北京时间

Anthropic 开展 Project Swap 实验,让 201 名员工的 Claude 智能体在数字交易场上为参与者换书。仅凭约五分钟对话,智能体对书籍排序与本人一致率达 61%(随机为 50%);市场效率距最优的缺口约 85% 来自偏好理解不足而非谈判能力。重跑显示模型强弱比指令对谈判结果影响更大,参与者满意度均分 7.2/10,平均愿意把约 30% 的年度购书预算交给智能体打理。

相关链接:原文来源

16. 微软提出 CASD:用编码代理分析轨迹日志做提示词优化,平均提升 16.6 分 (评分 58)

来源:X:DAIR.AI (@dair_ai) |发布时间:09-25 21:59 北京时间

微软论文《Coding Agents are Strong Prompt Optimizers》提出 Coding-Agent Skill Distillation(CASD),让现成编码代理读取完整智能体轨迹日志,自行编写分析代码统计失败模式并将发现写成规则提示词,无需环境访问和验证数据。

相关链接:原文来源

17. MIT McGovern Institute 开发从文本评估自杀风险的词表工具并发表于 Journal of Psychopathology and Clinical Science (评分 58)

来源:MIT News(RSS) |发布时间:09-25 05:56 北京时间

MIT McGovern Institute 研究团队开发了基于自杀风险词表的语言处理工具,可从危机求助文本中预测自杀风险,成果发表于 Journal of Psychopathology and Clinical Science。

相关链接:原文来源

18. 研究论文:Coding Agent 在广义任务与运动规划问题上的能力评测 (评分 54)

来源:HuggingFace Daily Papers(社区热门论文) |发布时间:09-25 17:20 北京时间

arXiv 论文(https://arxiv.org/abs/2609.30233)研究 coding agent 能否自动合成可跨实例泛化的程序来解决广义任务与运动规划(TAMP)问题。

相关链接:原文来源

19. FRI 中期报告:顶尖 AI 专家大幅低估领域进展速度 (评分 54)

来源:The Decoder:AI News(RSS) |发布时间:09-25 03:29 北京时间

Forecasting Research Institute 的中期报告显示,专家和超级预测员系统性低估了 AI 进展。AI 在 2025 年 7 月达到 IMO 金牌水平,比专家预测中位数提前五年;病毒学基准、网络安全基准和 Anthropic 约 1000 亿美元年化收入等指标也远超预测,如专家对 2026 年底 AI 公司最高 ARR 的中位数预测仅 200 亿美元。

相关链接:原文来源

技巧与观点(入选 5 条 / 当日共 37 条)

20. Trump 政府 WISeR 项目用 AI 审批 Medicare 预授权,拒批率与激励结构引发争议 (评分 86)

来源:Ars Technica:AI(RSS) |发布时间:09-25 19:26 北京时间

Trump 政府 1 月起在六个州试点 WISeR 项目,用 AI 对部分 Medicare 服务的预授权进行审批或拒批。

相关链接:原文来源

21. 安全研究者披露黑客用 GEO 污染 ChatGPT、Gemini 和 Google AI Overview,374 家企业被植入诈骗联系方式 (评分 76)

来源:Hacker News 热门(buzzing.cc 中文翻译) |发布时间:09-25 01:30 北京时间

安全研究者发现针对 ChatGPT、Gemini 和 Google AI Overview 的规模化 AI 虚假信息攻击,共检测到 374 家被攻击企业,包括 Delta、Lufthansa、Bank of America、Airbnb 等,AI 会向用户给出诈骗电话和钓鱼链接。

相关链接:原文来源

22. Ethan Mollick 评 Microsoft Copilot 大更新:模型路由是隐患 (评分 69)

来源:X:Ethan Mollick (@emollick) |发布时间:09-25 22:29 北京时间

Ethan Mollick 转发并评论 Satya Nadella 宣布的 Copilot 史上最大更新,包括 Autopilot、Code、Home、Office 四部分,以及在 Teams 中调用 Copilot 和主动呈现 M365 重要信息的 Today 功能。

相关链接:原文来源

23. Moody’s 称五大超大规模云厂商未来承诺达约 $2.8T (评分 66)

来源:X:Rohan Paul (@rohanpaul_ai) |发布时间:09-25 07:10 北京时间

Moody’s 表示五大超大规模云厂商的未来承诺合计约 $2.8T,从 2023 年的约 $350B 增长而来。其中包含超过 $1T 的未开工数据中心租赁、约 $1.57T 的采购承诺和约 $137B 的担保。

相关链接:原文来源

24. 研究显示 AI 基准性能成本每年降至约十三分之一,MIT 估算纯算法效率约每年 3 倍 (评分 66)

来源:The Decoder:AI News(RSS) |发布时间:09-25 00:29 北京时间

Epoch AI 估算,在固定基准分数上取得同等性能的市场价格平均每季度下降约 47%,约合每年 13 倍。OpenAI 的 o3 在 2025 年初以每题约 30 美分在 GPQA Diamond 达到 75% 准确率,18 个月后 GPT-5.6 系列模型以原价 1/725 达到同样分数。

相关链接:原文来源


需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询