AI 日报 2026-09-03:同价新模型正在用更多 token 换 Agent 能力
show/hide tags
覆盖 2026-09-02 07:00 至 2026-09-03 07:00(Asia/Shanghai),run
20260903T151731+0800。 自动抓取 142 条、去重 2 条;人工检查 25 个 adapter-required 源。GitHub Releases API 的 9 个源返回 403,BAIR blog 超时,reddit-machine-learning返回 429;GitHub 官方 Atom 与 Hugging Face 20 个官方组织已另行补查。今天的共同主线是:token 单价没有上涨,不等于一次 Agent 任务没有变贵。 Gemini 3.8 Flash 与 Muse Spark 1.3 都把新增能力放在更长推理、更多工具调用或更高 reasoning 档位里;与此同时,EarlyEval、Declarative Attention、投机解码 co-design 和 PyTorch 2.14 都在试图把这些新增计算重新省回来。
本期事实以 Google Gemini 3.8 发布、Meta Muse Spark 1.3、Qwen 官方 changelog、PyTorch 2.14及论文原文为底座;Artificial Analysis 只承担独立评测,AINews、smol.ai、Hacker News 与 Reddit 只用于发现和覆盖审计。
今日重点关注
- Gemini 3.8 Flash 在年底前维持 3.7 的 token 单价,但更愿意“多想”。 Google 明说它可能采取更多推理步骤、工具调用并消耗更多 token;Artificial Analysis 的独立 Agent 评测里,高档每任务成本从 0.40 美元升到 0.58 美元,约增 40%。
- Muse Spark 1.3 同时出现“更省调用”和“更贵任务”两个结果。 Meta 的内部 coding 对照报告约少 20% 工具调用、少 25% token;但 Artificial Analysis在另一套 Agent 评测中测到 xhigh 每任务 0.55 美元,高于 Spark 1.2 的 0.40 美元。harness 和 reasoning 档位决定了哪个结论适用。
- Qwen3.8-Max-0902 补齐原生视觉与协作 Agent。 官方更新记录称这个快照增强 coding、多工具调用与协作式 Agent,同时保留 1M context、thinking 和 tool use;发布页没有给出可独立复核的每任务成本。
- Repo-To-Skill 把 1,000 个 GitHub 仓库蒸馏成 5,000 多个已验证 skill。 论文在固定 GPT-5.5 backbone、harness 与预算下报告 MLE-bench 提升 134.3%、PaperBench 提升 34.4%,把“先读仓库再做任务”变成可复用的外部能力层。
- EarlyEval 选择在已经大概率失败时提前停。 论文用中间轨迹训练成功/失败分类器,在三类 Agent benchmark 上减少 13–26% 步数、最多减少 44.1% 输入 token,平均解决率变化控制在约 1–2 个百分点。
- PyTorch 2.14 把 MoE dispatch/combine、NVFP4 和更多分片规则纳入同一版。 这些接口里有不少仍标为 private 或 unstable,但已经把 Agent 任务背后的低精度、collective 与 expert routing 变成框架级能力。
一、模型与能力
本节并排看 Gemini 3.8 Flash、Muse Spark 1.3和 Qwen3.8-Max-0902:三者都在扩展 Agent 能力,但只看每百万 token 标价会漏掉运行时的真实工作量。
Gemini 3.8 Flash 保持单价,任务账单却未必保持
Google 把 Gemini 3.8 Flash 的重点放在复杂推理、coding、工具使用和多语言上。发布方报告 Humanity’s Last Exam Verified 为 54.9%,内部 20 种语言 benchmark 超过 70%;这些数值都受 Google 自己的模型配置和评测环境影响,本文不把它们当成跨厂商统一排名。
更值得注意的是计费合同。3.8 Flash 在 2026 年 12 月 31 日前沿用 3.7 Flash 的 introductory price:每百万输入 token 0.75 美元、输出 token 3.75 美元;从 2027 年 1 月 1 日起分别变为 1.50 与 7.50 美元。Google 同时提醒,3.8 会执行额外推理步骤和工具调用,可能使用更多 token;若目标是低延迟或高效率,可降低 reasoning effort 或继续用 3.7。
Artificial Analysis给了“同价不等于同账单”的独立样本:其高档 Intelligence Index 为 59,比 3.7 高 3 分;每任务成本却从 0.40 美元升至 0.58 美元,平均输出约 48K token,较 3.7 多约 30%,Agent turn 也更多。medium 与 low 档分别约为 0.41 与 0.24 美元。该结果只适用于其 Agentic Index harness,但它明确说明了为什么采购表里的 token 单价无法直接代表任务总成本。
Gemini Cyber 把更宽松的能力留在受控通道
同一发布还带来 Gemini 3.8 Flash Cyber。Google 称它在 CWE-Bench 上为 47.2%,与其引用的领先 frontier 结果 47.8% 接近;在 Chrome 自动修复内部实验里,正确 patch 数为更大商业模型最佳结果的 2.6 倍。这些仍是发布方与合作方口径,不能替代公开可复现评测。
产品边界比单个分数更关键:公开 Flash 使用更强 safeguard,Cyber 版本更少拒绝高风险网络任务,只通过 Fairwind向可信防御团队提供。Fairwind 要求参与者属于政府、企业或关键基础设施的内部网络、事件响应或渗透测试团队,并设置 MFA 与操作控制;计划已经有 650 多个伙伴。Google 还把 Gemini Cyber 与 CodeMender harness、总额 1 亿美元的 Google.org 网络安全资助放在同一框架里。这里发布的是能力、准入和资助组合,不是“模型已经安全”的证明。
Muse Spark 1.3 的省与贵取决于运行档位
Meta把 Muse Spark 1.3 定位为 coding 与通用 Agent 模型,支持文本、图像、视频输入和 1M context。Meta 的内部 coding 对照称,相比 1.2,1.3 完成任务时约少 20% 工具调用、少 25% token;模型在 Muse Code 和 Meta Model API 上可用,最强的 max reasoning 档仍处于受限预览,并继续做安全测试。
独立评测揭示了另一面。Artificial Analysis测得 xhigh Intelligence Index 为 61、max 为 62;Tau3 Banking 从 35 提到 47,TerminalBench 从 80 提到 85。与此同时,xhigh 每任务成本从 Spark 1.2 的 0.40 美元升至 0.55 美元,Agent 评测平均输入 token 约多 57%、输出约多 8%;max 在 GDPval 上又比 xhigh 多 62% reasoning token。
这两组结果并不矛盾。Meta 测的是自己的 coding 工作负载与 harness,Artificial Analysis 测的是统一的多项 Agent 评测;“每次调用更有效率”和“整项任务使用更多推理”可以同时成立。团队要记录的不是一个静态模型价,而是 模型 × reasoning 档位 × harness × task 的完整成本。
Qwen3.8-Max-0902 把视觉放进 Max 路径
QwenCloud 官方 changelog记录,9 月 2 日的 qwen3.8-max-0902 是 Qwen3.8-Max 的升级快照:加强 coding、协作式 Agent 与多工具调用,并新增原生视觉理解;仍支持 1M context、thinking 与工具使用。
公开变更日志没有给出独立可复现 benchmark,也没有披露新增视觉和更长 Agent 运行对每任务 token 的影响。本期因此只确认功能合同,不沿用 AINews 或社区转发里的榜单数字。
二、Agent 系统与评测
本节看两个相反方向:Repo-To-Skill在运行前把仓库知识压成可复用 skill,EarlyEval则在运行中识别已经不值得继续烧 token 的轨迹。
Repo-To-Skill 把仓库理解从 prompt 变成外部能力层
Repo-To-Skill 的 DisCo pipeline 从 1,000 个机器学习仓库抽取、验证并组织出 5,000 多个 skill,覆盖 20 个领域与 178 个方法家族。Agent 在任务前检索并加载相关 skill,而不是每次重新遍历整个仓库;作者还让 skill 经过可执行验证,减少只会复述 README 的无效知识卡。
在固定 GPT-5.5 backbone、Agent harness 和预算下,论文报告 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%,并在 PassNet 上提高 14 个百分点。这个设计把增益更干净地归因给外部 skill 层,但 5,000 多个条目都来自机器学习仓库,尚不能证明相同方法会无损迁移到普通业务代码、安全敏感仓库或快速漂移的依赖生态。
真正可复用的工程合同是:skill 必须保留来源、版本和可执行验证;检索命中只是候选证据,不应让过期 skill 覆盖当前仓库事实。
EarlyEval 不预测最终答案,而是预测这条轨迹还值不值得跑
EarlyEval从 Agent 运行的中间行为、状态与任务特征训练 LightGBM 成功/失败分类器;当失败概率超过阈值时提前终止。它没有降低单步模型成本,而是砍掉高概率失败轨迹尾部。
在 SWE-bench Verified、TerminalBench 与 Toolathlon 上,作者报告减少 13–26% Agent step;输入 token 最多减少 44.1%,输出 token 最多减少 29.4%,预测准确率为 89–97%,平均解决率扰动约 1–2 个百分点。这个交换并非免费:阈值太激进会提前杀死后程反转的任务,分类器也可能随模型、harness 和题型漂移。更稳妥的部署方式是把 early stop 当成带预算的 policy,并持续记录误杀、节省与分布变化。
VibeVoice 把说话人归因塞进流式 ASR
VibeVoice-ASR-Streaming是一套 7B 流式、带说话人归因的语音识别模型。输入由固定长度音频、短 lookahead 和先前文本组成,团队同时开放 1.5B 与 7B 权重;论文报告在五个 ASR 数据集上取得最低 WER/CER,并在 13 组说话人归因对照中 12 组最佳或并列最佳。
这些都是作者报告的技术报告结果,尚需真实噪声、重叠说话和长会话上的独立复现;但它说明流式系统不一定要把 transcript 和 diarization 拆成两个完全独立的后处理阶段。
三、AI Infra
本节把 PyTorch 2.14、Declarative Attention和 NVIDIA 的投机解码 co-design连起来:模型多用掉的计算,正在由框架、KV 可见范围和硬件对齐共同追回。
PyTorch 2.14 把 expert routing 变成 collective 接口
PyTorch 2.14包含 2,995 个 commit、487 位贡献者。NVGEMM 后端加入 epilogue fusion、scaled 与 NVFP4 路径,并能和 Triton、ATen 实现一起 autotune;其中 NVFP4 路径依赖 Blackwell,不能外推到所有 CUDA GPU。
分布式侧新增 nccl2 后端,带 fault-tolerant reconfiguration 与 one-sided RMA。框架还加入 private TokenSwitch API,把 MoE 的 dispatch/combine 直接映射到 NCCL 2.30,并在不传 out 时支持 autograd。它已经指向 embedding/weight transfer 与 expert routing 的统一通信路径,但 private 标签意味着接口和兼容性仍可能改变。
AMD RDNA3 上的 FlexAttention tile 配置在低几百 token 的场景报告约 2–8 倍 latency 改善;MPS 修复单 token F.linear 后,发布方称 M5 上 prefill 提升 2–4 倍。2.14 还把 DTensor 的算子分片规则从 2026 年 1 月的 585 个扩到 1,239 个。所有数字都来自 release blog,应在目标硬件与 workload 上重测。
Declarative Attention 让模型自己标出哪些 KV 还值得看
Language Models Can Control Their Own Attention让模型输出 <global>、<focus> 和 <local> 等控制标记,推理引擎据此限制后续 token 可见的 KV 区间。和只能按固定窗口裁剪不同,模型在生成时声明哪段上下文需要继续全局可见。
作者在 Gemma4 31B 和 Qwen3.6 27B 上报告,总 attended token 分别减少 52.0% 与 31.1%,准确率分别下降 1.27 与 2.75 个百分点。它省的是 attention 读取与计算,不会自动减少 MLP、tool call 或模型输出;控制标记若判断错误,也可能把后面才需要的证据过早藏掉。它更像一份可学习的 KV visibility policy,而不是无损压缩。
投机解码的 N 必须和 GEMM tile 一起设计
NVIDIA把 speculation length D、draft 宽度 G 与 GPU tile 放在同一个设计空间。文章给出的近似关系是:当 decode 的 attention 占主导时,D ≈ 128/G - 1,从而让 G(1+D) 靠近 128 的整数倍;对 6144×6144 expert GEMM,D=7 时达到 compute-bound 所需 batch 约为无投机路径的八分之一。
这不是一个可照抄到所有模型的最优 N。文章比较外部 draft、EAGLE3、MTP、DFlash、DSpark 与 n-gram,不同路径的 draft 成本、接受率和 kernel shape 都不同。可复用结论是先测 target workload 的接受长度与并发,再让模型结构和 kernel tile 对齐,而不是只把 proposal length 调大。
GitHub API 受限时,本期还用官方 Atom 补查了 9 个 release 源。llama.cpp b10766在窗口内修正 DeepSeek4 的 vision input 支持;vLLM 的 CUTLASS MoE permutation 修复和 Ollama RC 只保留在取舍账本,没有被包装成重大发布。
四、产品与治理
模型路由权逐渐进入企业设置后,默认模型和不能被读取的内容需要在同一个控制面里定义。
Copilot 的内容排除开始覆盖 app 与 CLI
GitHub宣布 Copilot app 与 CLI 已正式遵循 enterprise、organization 和 repository 层的 content exclusion。管理员可以阻止受限文件进入 Copilot 的上下文;这条边界如果只在 IDE 生效、在 CLI 或 app 失效,就会形成策略旁路,因此跨入口一致性比新增一个开关更重要。
同日的 managed default model让 enterprise 和 team 为 Copilot app、CLI 与 VS Code 指定任意默认模型,并允许配置可被用户覆盖的映射。两项更新合在一起,构成了最小企业 policy:哪些上下文永远不可读、默认把任务路由到哪个模型、用户何时可以偏离默认值。
默认模型不应只按 token 单价选择。本期 Gemini 和 Muse 的独立评测都表明,同一标价下 reasoning effort、turn 数和 harness 会改变每任务成本;管理面需要记录实际 task spend、成功率和越权命中,而不是只显示 provider price table。
五、安全与访问边界
Gemini 3.8 的公开版与 Cyber 版再次说明,frontier capability 的产品形态越来越像“模型 + safeguard + 准入 + 监控”。
更少拒绝必须配上更窄的使用者集合
Google 把 Gemini Cyber 描述为更强、也更少拒绝防御性网络任务的配置,但没有把它直接放进公共 API。通过 Fairwind申请的团队必须证明组织身份和防御职责,并接受 MFA 与操作控制;公开 3.8 Flash 则保留更严格 safeguard。
这套设计和昨天 Anthropic 的 Fable/Mythos 分流属于同一趋势,但本期不借昨天的事实填充今天的正文。今天能从一手发布确认的是:Google 承认 Cyber 更 permissive,并把访问范围缩到受信任防御者。尚未公开的是完整 system card、受限版误用测试覆盖和真实部署中的监控效果,因此不能把“受控准入”写成“风险已经消失”。
模型设置和内容排除也是安全控制
Copilot 的 content exclusion 控制输入边界,managed default model控制执行默认值;二者都可能被层级继承与用户 override 改变。上线前至少应验证三件事:策略是否在 app、CLI、IDE 一致生效;override 是否留下可审计记录;被排除文件的派生摘要、缓存和 tool output 是否同样受限。
GitHub 本次只宣布产品能力,没有给出上述全部实现细节。正文因此把它们列为需要验证的 deployment contract,而不是替 GitHub 声明已经完成端到端隔离。
六、今天该怎么读这些数字
今天最容易误读的,是把模型发布页的“同价”和 benchmark 的“更强”相乘,直接得出“性价比一定更高”。实际系统至少有四层量:token 单价、每轮 token、每任务轮数、成功后是否还需要复核或重跑。
Gemini 3.8 Flash 的独立结果显示单价相同但每任务约贵 40%;Muse Spark 1.3 则在 Meta 自家 coding 任务里少用调用和 token,却在另一套 Agent harness 上每任务更贵。二者共同支持的不是“新模型更浪费”,而是成本评测必须固定 effort、harness、停止条件和成功定义。
系统侧的三种节省也不能互相替代:EarlyEval 提前砍掉失败轨迹;Declarative Attention 减少已保留轨迹中的 KV attention;speculative decoding 通过草稿接受减少 target decode 次数;PyTorch collective 与低精度 kernel 再降低每一步的执行成本。只有把它们放进同一条端到端 trace,才能知道省下的计算有没有被更长 reasoning 再次吃掉。
深度阅读
- **Repo-To-Skill**|约 45 分钟 适合构建 coding agent、skill registry 与仓库级验证的读者。重点看 5,000 多个 skill 如何抽取和验证,以及固定 backbone/harness 后的增益还能否迁移到非 ML 仓库。digest 建议:yes。
- **PyTorch 2.14 Release Blog**|约 28 分钟 适合做 MoE training、distributed collective 和 GPU kernel 的读者。优先区分 stable、unstable 与 private 接口,再核对 NVFP4、RDNA3 和 MPS 数字的硬件边界。digest 建议:yes。
- **Language Models Can Control Their Own Attention**|约 30 分钟 适合做长上下文、KV cache 与推理引擎的读者。重点看 control token 的训练方式、attention token 口径和准确率退化,而不是只记 52% 的最大降幅。digest 建议:yes。
- **EarlyEval**|约 25 分钟 适合做 Agent eval、预算调度和线上停止策略的读者。分类器本身并不昂贵,真正难题是不同模型与任务分布下的误杀校准。digest 建议:yes。
来源与口径
- immutable run 为
20260903T151731+0800,窗口严格覆盖 2026-09-02 07:00 至 2026-09-03 07:00(Asia/Shanghai)。自动抓取 142 条、去重 2 条;BAIR blog 超时,reddit-machine-learning返回 429,失败没有被改写成“没有更新”。 - GitHub Releases API 的 vLLM、SGLang、Transformers、llama.cpp、Ollama、PyTorch、TRL、verl 与 MCP spec 九个源均返回 403。随后逐一检查官方
releases.atom:窗口内只有 vLLM 的 CUTLASS MoE 修复、llama.cpp 的 DeepSeek4 vision 修复与 Ollama 0.18.5 RC;只有 llama.cpp b10766作为短讯进入正文。 hf-org-releases在主抓取中按 skill 的已知挂起规避路径显式跳过,随后查询配置内 20 个 Hugging Face 官方组织,20 个均成功;窗口内没有同时满足发布时间与 3 likes 阈值的新仓库。- 25 个 adapter-required 源均已记录结果。DeepSeek、Z.ai、StepFun、混元、MiMo、UK AISI、LMArena 与 AI Frontiers 的入口缺少可稳定按本窗口审计的列表或依赖客户端渲染,不能据此断言“没有更新”。Meta、Qwen、Cohere、LongCat 与 Artificial Analysis 找到窗口内新内容;Cohere 与 LongCat 经通读后因复用旧材料或仅为商业后台变更,留在取舍账本。
- 已通读 smol.ai 当前完整归档的 Twitter 与 Reddit 两节;它覆盖 8 月 31 日至 9 月 1 日,早于本期窗口。Latent Space 当期 AINews同样只记为
coverage_only。Twitter 中的 Qwen 与 Meta 线索已回到官方原文,Reddit recap 没有接受为本窗口正文事实的新条目,也没有恢复固定 Twitter/Reddit 栏目。 - 本期没有
longform: true新条目,因此没有触发 longform-scout;正文不需要论证图,未触发 PicGo。所有社区线索若未能回到一手原文,均未进入正文。
Author ByteDance
Publish September 3, 2026
LastMod September 3, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。