🤖 AI 大模型日报 — 2026-08-09
本报告基于多源公开信息整理,覆盖 2026 年 8 月上旬全球大模型领域的最新动态。
数据截至 2026-08-09,由 Hermes Agent 自动搜集整理。
📌 今日速览
- OpenAI 暂停 Astra 模型部分研发(8 月 8 日):内部测评发现新模型自主网络攻防能力过强,存在主动发起高级网络攻击的风险,暂缓不符合更高安全要求的工作并加装通用监控
- OpenAI 收购演示文稿初创 NextSlide:团队并入 ChatGPT,AI 办公应用版图再扩张
- Anthropic:Claude Code Auto 模式 8 月 14 日起默认开启(Pro/Max/Team 计划),安全分类器可拦截 89% 危险命令
- Pokee AI 发布 Pokee-Isaac 28B:1000 万 token 上下文窗口的 Agent 模型,RULER@10M 达 93.3%,主打客户边界内私有化部署
- DeepSeek-V4-Flash 0731 采用持续扩散:OpenRouter 上 token 份额已居第一,HF 官方仓下载量突破 61.8 万(环比 +42.6%)
- Qwen 3.8 Max 发布(8 月 3 日):总参数量 2.4 万亿,为千问系列迄今最大旗舰,带动阿里港股当日大涨 7%
- LMSYS Arena Agent 榜(8 月 4 日快照):前 20 仍被 Anthropic 与 OpenAI 垄断,DeepSeek-V4-Flash 正式版位列第 21
🔥 热门话题摘要
- "网络安全能力过强"成为新安全议题:OpenAI 因 Astra 模型自主攻防能力显著超出预期、存在高级网络攻击风险而暂停部分研发。这是继"能力对齐"之后,"能力边界管控"首次成为头部厂商的公开行动,标志着前沿模型安全治理进入新阶段。
- 超长上下文竞赛再升级:Pokee-Isaac 28B 将上下文窗口推至1000 万 token(RULER 10M 得分 93.3%),远超 GPT-5.6 / Gemini 3.6 的 100 万量级,超长上下文 + 私有化部署成为企业市场新卖点。
- AI 编程助手进入"默认自主"时代:Claude Code 将 Auto 模式设为默认(8 月 14 日生效),用分类器拦截危险命令(89% 捕获率)换取更高的自动化授权——"自主执行 + 安全兜底"成为编码 Agent 产品标配。
- 资本并购加速:OpenAI 收购 NextSlide 扩充办公生态;此前 xAI 收购 Cursor、Moonshot AI 融资 35 亿美元等事件显示,头部厂商正通过并购整合工具链与人才。
- AI 算力与能源矛盾浮出水面:亚马逊为得州离网 AI 数据中心配套 7.65 GW 天然气发电厂(或成美国最大单一排放源),与其 2040 净零目标相悖,AI 基础设施的能源账引发争议。
🌍 国际头部模型动态
OpenAI — GPT 系列
| 模型 | 发布时间 | 要点 |
|---|---|---|
| Astra(暂停部分研发) | 2026-08-08 | 内部测评显示自主攻防能力过强、网络安全任务表现显著超预期,存在主动发起高级网络攻击风险;暂停不符合更高安全要求的内部工作,实施通用监控与更强保障 |
| GPT-5.6 Sol / Terra / Luna | 2026-06 | Agent 模型三版本,上下文 1.05M token、最大输出 128K;7 月二次解禁新增 “ultra” 多智能体并行模式;Sol 在编码、生物、网络安全全面领先,编码智能体指数超 Claude Fable 5 且 token/成本仅约 1/3 |
| GPT-5.2 | 2025-12 | 推理与数学标杆:AIME 2025 满分 100%、ARC-AGI-2 52.9%;已被 5.6 系列取代主力地位 |
| GPT-Image 2 | 2026-04 | 原生图像生成模型,自带推理模式 |
其他动态:收购演示文稿初创NextSlide(团队转投 ChatGPT 项目);此前"OpenAI 意外攻击 Hugging Face"事件时间线在社区引发讨论,安全治理受关注。
Anthropic — Claude 系列
| 模型 | 发布时间 | 要点 |
|---|---|---|
| Claude Code Auto 模式 | 2026-08-14 生效 | Pro/Max/Team 计划默认开启 Auto 模式;安全分类器捕获 89% 危险命令,减少开发者误批准风险 |
| Claude Opus 5 | 2026-07-23 | 能力接近旗舰 Fable 5,价格仅为一半;可调 effort setting,最低档通过率仍高于其他模型 |
| Claude Fable 5 / Mythos 5 | 2026-06 | 软件工程、知识工作、科学研究多领域 SOTA |
| Claude Sonnet 5 | 2026-06 | 1M 上下文、128K 最大输出,持久化记忆与多步工具调用 |
Google DeepMind — Gemini 系列
| 模型 | 发布时间 | 要点 |
|---|---|---|
| Gemini 3.6 Flash | 2026-07-20 | 更低成本实现更高 token 效率(输出较 3.5 Flash 减 17%~65%);DeepSWE、MLE Bench 等显著提升;计算机使用内置为客户端工具 |
| Gemini 3.5 Flash-Lite / Flash Cyber | 2026-07-20 | 轻量级与安全场景变体 |
| Gemini 3.1 Pro | 2026-02 | 代码动画、复杂系统综合、交互式设计提升 |
| Gemini 3 Deep Think | 2025-11 | 增强推理模式,ARC-AGI-2 得分 45.1% |
xAI — Grok 系列
- Grok 4.5(2026-07-15):xAI 收购 Cursor 后由 Cursor 团队主导训练的 Agent 模型,MoE 约 1.5T 参数、500K 上下文,基于数 T token 真实用户交互数据训练。
Meta — Llama / Muse 系列
- Muse Spark 1.1(2026-07):Meta Superintelligence Labs 多模态 Agent 模型,1M 上下文,通过化学/生物/网络安全三类评估。
- Llama 4(Scout / Maverick)为上一代开源旗舰;Meta 重心转向 Superintelligence Labs。开源榜上 Llama 系持续被 Qwen / DeepSeek 追赶。
其他国际厂商
- Pokee AI — Pokee-Isaac 28B(2026-08-08):28B 纯文本 Agent 模型,10M token 上下文,RULER@10M 93.3%,面向客户边界内私有化部署。
- Mistral:Magistral Small/Medium 系列持续迭代小模型路线。
- Amazon:为得州离网 AI 数据中心配套 7.65 GW 天然气电厂,或成美国最大单一排放源,与 2040 净零目标相悖。
🇨🇳 国内模型动态
| 厂商 | 模型 | 要点 |
|---|---|---|
| 阿里 Qwen | Qwen 3.8 Max(2026-08-03) | 总参数2.4 万亿,千问迄今尺寸最大、性能最强旗舰;与"千问办公"同日公测,底层能力与顶层应用双线发力;发布当日阿里港股大涨 7% |
| DeepSeek | DeepSeek-V4-Flash 0731(2026-07-31) | 284B 总参 / 13B 激活 MoE,1.05M 上下文;OpenRouter 公开价 $0.14/$0.28 每百万 token(较 0423 版大幅降价);5 月中旬以来 OpenRouter token 份额第一(6 月初约 20%);HF 官方仓下载 61.8 万(+42.6%),GitHub 精确命名仓库 61 个;LMSYS Agent 榜第 21(国内第一梯队) |
| DeepSeek | DeepSeek-V4 / R2(预期) | V4 于 2026-04 发布;R2 官方否认 8 月发布,最保守窗口指向 2026 Q3 |
| 月之暗面 Kimi | Kimi K3(2026-07-15) | 新一代旗舰;K2.7 Code 等持续迭代 |
| 智谱 GLM | GLM-4.6 系列 | Agentic Coding 大幅跃升,对齐 Claude Sonnet 4;寒武纪国产芯片 FP8+Int4 混合量化部署 |
| 腾讯混元 | HunyuanVideo 1.5 | 开源视频生成,8.3B 参数,14G 显存消费级可跑 |
| 字节跳动 | 豆包 Doubao-Seed-1.6 系列 | 多模态全家桶;豆包 + 火山引擎组合重排 To B 业务 |
| MiniMax | MiniMax-M1、H3(本周新增仓库) | 推理 + 语音模型持续迭代 |
| 百度 | 文心 ERNIE 5.0 Preview | 文本榜国内第一(1432 分) |
📈 行业趋势分析
1. 安全治理进入"能力边界管控"阶段
OpenAI 主动暂停 Astra 部分研发,说明头部实验室开始对过强的自主攻防能力设限。结合 Claude Code 用分类器兜底 Auto 模式、GPT-5.6 分层防护体系,行业共识正在形成:安全不是发布后的补丁,而是发布决策的前置条件。企业采购时,"安全护栏完备度"正与性能同等重要。
2. 超长上下文 + 私有化部署开辟企业新战场
Pokee-Isaac 28B 的 1000 万 token 上下文直指企业级"整库级"分析场景,且强调在客户边界内运行。DeepSeek 的高性价比 MoE + 多端点部署(OpenRouter/DeepInfra/CoreWeave 等 22 家)同样主打可控成本。模型能力溢出之后,部署形态与数据主权成为差异化关键。
3. Agent 模型全面主流化,"推理模型"类别走向消亡
2026 下半年新发模型几乎全部以 Agent 能力为核心卖点,行业分类中"推理模型"独立类别已停止更新、计划 2027 年删除。竞争焦点从"会不会推理"转向"能不能自主、可靠、安全地干活"。
4. 效率与成本战持续,价格弹性显著
DeepSeek V4 Flash 0731 定价较旧版大幅下调($0.14/$0.28),Gemini 3.6 Flash 输出 token 减少 17%~65%,Claude Opus 5 半价逼近旗舰——"用更少 token、更低成本完成同等任务"成为各厂统一叙事,轻量级变体与 effort 可调档位成为标配。
5. 并购整合加速,工具链即护城河
OpenAI 收购 NextSlide、xAI 收购 Cursor 后由 Cursor 团队主导训练 Grok 4.5、Moonshot AI 融资 35 亿美元——真实用户交互数据与开发者工具链正在成为模型训练的新护城河,资本向头部集中。
6. AI 基础设施的能源与环境代价进入公众视野
亚马逊 7.65 GW 天然气电厂事件凸显 AI 算力扩张与碳中和目标的冲突;韩国 AI 芯片产业繁荣正在重塑社会结构。算力、电力、政策的三重约束将成为 AI 产业下一阶段的关键变量。
📚 参考来源
- LLM Stats AI News(llm-stats.com/ai-news,2026-08-09 更新)
- 华尔街日报中文版(2026-08-08):OpenAI 因网络安全担忧暂停 Astra 模型部分研发
- The Decoder / Simon Willison:Claude Code Auto Mode 默认设置(2026-08)
- TechCrunch:OpenAI 收购 NextSlide(2026-08-08)
- 知乎专栏《DeepSeek V4 Flash 0731 每日增量追踪》(2026-08-07)
- OpenRouter Blog:DeepSeek V4 Is Earning Agentic Token Share
- 知乎专栏《国内外知名大模型及应用——模型/应用维度》(2026-08-05 更新)
- 21 经济网 / 界面新闻:Qwen3.8-Max 发布(2026-08-03/04)
- Jenova《GPT vs Claude vs Gemini:2026年AI模型全方位对比》
报告生成时间:2026-08-09 | 由 Hermes Agent 自动整理