覆盖 2026-08-24 07:00 至 2026-08-25 07:00(Asia/Shanghai),run 20260825T120142+0800。 自动抓取 147 条,人工检查 25 个 adapter-required 源。GitHub Releases API 的 7 个源受 403 限流,已逐一改查官方发布页;reddit-machine-learning 返回 429。Hugging Face 组织聚合器因已知的串行卡住风险被显式跳过,随后直查 source.yaml 中 20 个官方组织,全部成功,窗口内没有满足创建时间与 3 likes 阈值的新仓库。

今天的共同主线是:Agent 推理不能再用一个短 prompt 加固定输出长度来代表。 SemiAnalysis 发布的 AgentX 1.0把多轮、长上下文、高前缀复用、子代理突发、工具调用间隙与失败恢复压进同一套可重放 workload;同一天,Prime Agent、Apodex 与 LangChain 的 trace judge 又从 harness、协作和评测三侧补上“工作是否持续、可恢复、可验证”的边界。真正要测的已经不是一次 decode 有多快,而是一段会话能否正确地把缓存、调度和工具状态带到终点。

今日要点

  • AgentX 把真实 coding-agent 会话变成了开放推理 workload。 数据底座超过 8,000 个 session、340 万次 request 和 6,100 亿 token;公开转换保留请求长度、时序和 context 增长,同时把内容替换成 session 内链式 hash。它刻画的是长尾会话形状,不是公开用户原文。(SemiAnalysisInferenceX
  • 长上下文 benchmark 首先会找出 correctness bug。 一处共享 127,500-token 前缀的回归测试最初只有 2/128 个 needle 命中;修复 scheduler、KV cache 与 prefix-sharing 路径后恢复到 128/128。吞吐排名必须建立在逐请求输出正确之上。(AgentX
  • NVIDIA 把同一 workload 推到了整机功耗口径。 厂商报告 Vera Rubin 在其 AgentX 配置中可达 GB300 的最高 30 倍 throughput/MW;这不是独立的通用倍数,必须连同模型、并发、缓存和平台一起读。(NVIDIA
  • Prime Agent 把“持续工作”落到可检查的 harness 状态。 persistent IPython REPL 负责程序化处理 context,Continual Harness 保存历史、memory、skill、prompt 与 subagent specification;会话可后台运行、恢复和被人类检查,但项目也明确提醒它并不是安全 sandbox。(论文代码
  • 评测本身也开始域内蒸馏。 LangChain 用带 human/panel label 的真实 trace 微调 Qwen-3.5-35B judge;域内 SFT 在 chat-langchain 集上达到 96.1% accuracy,但“最高 100 倍更便宜”取决于作者的模型和调用量成本假设。(LangChain

二、研究与评测

Import AI 470本期全文审计后,真正落在本期研究主线上的不是编辑评论,而是环境生成与 GPU kernel 优化两项工作。正文只采用能回到原始论文或项目页的技术事实;同一期提到的机器权利文章、窗口外矩阵乘法结果和 08-14 METR note 都没有被改写成当日新事实。

SPADE 让训练环境与推理 agent 交替进化

SPADE不是静态生成一批题再训练,而是在 Environment Designer 与 Reasoning Agent 之间交替:前者围绕当前能力边界构造可执行环境,后者在这些环境里学习;下一轮再用新的失败分布调整任务。作者报告 30B-A3B 模型在 8 个 held-out benchmark 上平均提升 5.3 个百分点,其中 BFCL-v4 multi-turn 提升 5.7,ACEBench-Agent 提升 13.9。代码已在 spade-rl/spade开放。

这些数字仍是作者在自有训练和评测管线中的报告。更值得保留的工程含义是:环境生成器本身也必须接受难度、可验证性和覆盖率约束,否则“更多合成任务”只会放大已有解题分布。它与 AgentX 的会话重放形成互补——前者扩训练环境,后者固定真实 serving 形状;两者都在把 agent 的外部环境从背景变量变成显式数据。

Hawkeye 把硬件条件送进 kernel agent

Hawkeye给 kernel 优化 agent 加入硬件描述、10 个起始单测和错误 taxonomy,并跨 NVIDIA Ampere、Hopper、Blackwell 与 AMD MI350、不同 precision 做搜索。作者报告在一组新算子变体上,相对专家 Triton FLA implementation 的 geometric mean 加速为 18.9 倍;迁移到 Blackwell 为 1.22 倍、MI350 为 1.00 倍。代码在页面上仍标为 coming soon,因此目前只能把结果视作论文作者声明,不能做仓库级复现。

同一份 RAG corpus,重复跑也会换答案

Same Agent, Different Answers在 400 道 Natural Questions 上重复评估 RAG agent,把 accuracy 与 answer churn 分开。论文报告 exact-match accuracy 下降 1.50 个百分点时,超过 accuracy 变化能够解释的 churn 仍有 6.44 个百分点;按 semantic equivalence 计为 10.25 个百分点。独立 replication 又观察到 8.75 个百分点的 semantic churn,而 exact accuracy 反而提高 3 个百分点。

这不是说 RAG 一定变差,而是 aggregate score 会掩盖“同一个问题这次答 A、下次答 B”。对 trace judge、回归测试和长期 agent,稳定性应成为独立指标:既要问平均分有没有升,也要问哪些样本在无意中发生了状态切换。

ReWorld 用固定缓存做流式世界记忆

ReWorld用按 head 混合的 local/global attention、随机 head routing、pose-indexed landmark bank 与固定 12-chunk cache,把交互式 world model 的记忆预算锁定。作者以 4-step distilled LoRA 流式生成 704×1280 画面,并展示 64 秒、384 个 latent 后回到起点的轨迹。这里能确认的是一种有界缓存设计及其作者演示,不是任意场景都能长期保持几何一致的结论。

三、AI Infra

AgentX / InferenceXv3 的完整说明把 2025 年以来 coding agent 的 workload 变化压成四个系统变量:输入随轮次持续增长,output length 是长尾分布,共享 system/repo prefix 很大,tool gap 与 subagent burst 让请求到达呈现间歇和突发。以 DeepSeek V4 Pro trace 为例,input length 的 p50/p90/p95/p99 分别约为 88K、272K、404K、675K token;output length 分别约为 413、2.2K、3.7K、8.6K。拿 8K input、1K output 的固定合成请求去外推这种流量,会同时错估 KV 占用、batch 组成和 prefill/decode 比例。

开放数据保留“形状”,不保留原文

数据来自超过 300 万美元的真实 agent trace;完整测量覆盖 8,000 多个 session、340 万 request、6,100 亿 token,公开的是代表性 subset。转换会把内容映射成 64-token、session-scoped 的 chained hash,同时保留每次请求的大小、顺序、时间间隔与 context growth,因此实现可以重放缓存压力,却不能从公开 workload 恢复用户代码或对话。一个已知限制是模型侧隐藏 reasoning 无法完整保留。

这套处理让 benchmark 比“随机 token 近似长度”更接近实际 prefix reuse,也把 privacy boundary 写清了:它验证 serving system 如何处理形状相同的会话,不验证模型在原任务上的语义质量。项目以 Apache 2.0 开放,benchmark dashboard、trace schema 和实现入口在 InferenceX 仓库在线榜单中。

DRAM cache 只有在长尾 context 下才显出价值

AgentX 的公开结果里,B300 上 vLLM 以 DEP8、concurrency 384 和 3TB DRAM 运行时,报告约 91% HBM cache hit,另有 1.36% 落到 DRAM;B200、concurrency 196 时 HBM hit 约 73%,DRAM 接住约 20%。这组数字不能简化成“DRAM 总能提高 20%”:它反映的是特定模型、并发和 trace 下,被 HBM 淘汰但仍可复用的 prefix 有多大。固定短 prompt 很可能根本测不出这一层的收益。

更关键的是 correctness。共享 127,500-token prefix 的 needle test 从 2/128 修到 128/128,说明 scheduler、block ownership、prefix hash 与回收路径中的一个边界错误,就能让高 cache-hit 看起来很漂亮、输出却不可用。项目称这轮工作向上游提交了 70 多个 PR;在把 throughput 放进对比表前,应先固定 exact request replay 与结果校验。

Vera、Groq 3 LPX 与 AgentX 的数字要按厂商配置读

NVIDIA 对 Vera CPU 的说明引用 163,594 个 session 的 telemetry,其中超过 97% 是唯一轨迹,并把 session length 与 subagent width 作为 CPU orchestration 和网络突发的输入。文中称 Vera 单核性能最高可达 AMD Venice 的 1.5 倍;对比来自 NVIDIA 2026 年 7 月内部测试,因此这里只记录其测试口径,不当作第三方结论。

Groq 3 LPX 的长上下文文章披露 256 个 LPU、合计 128GB SRAM 与每芯片 96 条 112Gbps chip-to-chip link。NVIDIA 报告 Gemma 4 31B 在 100K context 时输出 3,431 tok/s,对照其公开 endpoint 为 870 tok/s;10K 时为 3,382 对 1,402 tok/s。SPEEDBench 的 median 为 4,767、P80 为 5,520 tok/s,并称由 Artificial Analysis 验证。即使有第三方执行,结论仍绑定该模型、平台、batch 与输出定义,不能外推成任意 agent 的墙钟加速。

Vera Rubin 与 Blackwell 的整机文章进一步报告 Vera Rubin 在所测 AgentX 配置中最高达到 GB300 的 30 倍 throughput/MW,GB300 在 Kimi K3 配置中最高达到 H200 的 80 倍。它把 CPU orchestration、GPU/LPU decode、KV cache 与电力预算放进同一张系统表,这是有用的测试方向;具体倍数仍是厂商在披露配置中的结果,不是跨 workload 的代际常数。

llama.cpp 一天六个版本主要在补边界

GitHub API 403 后,本期直接核对了 llama.cpp 官方 Releases。窗口内 b10604 到 b10612 的变化包括 DeepSeek 4 tensor split 与 shared-expert all-reduce 路径、Mamba2 projection 从 GEMV 合并为 GEMM、数值 clamp、视频 moov 位于文件尾部和 SIGPIPE、device naming,以及 WebGPU 测试开关等。可逐个回到 b10604b10605b10606b10608b10610b10612。这些是实现与兼容性更新,release notes 没有提供一组可外推的端到端性能提升。

四、Agent 系统与 Harness

Prime Agent把长程 agent 拆成模型策略与执行 membrane:persistent IPython REPL 让模型用程序处理 context 和 test-time compute;Continual Harness 把 history、memory、skill、prompt 与 subagent specification 保存为跨 trajectory 状态;daemon-backed session 可以断线后继续,Agents View 则给人类检查和管理入口。论文报告 ARC-AGI-3 RHAE Best@1 从 30% 提升到 95.5%,以及多类 long-context coding 和 GPU kernel 任务的结果,这些仍属于作者评测。

开源 prime-agent 仓库还补了一条比 benchmark 更实用的限制:它运行模型生成的 Python 与项目命令,权限继承自用户;worker 和 kernel 的生命周期隔离并不等于 security sandbox。持久 memory、自动 compaction、后台任务与 subagent communication 延长了工作半径,也同步放大了凭据、文件和错误指令的影响半径。可恢复与可审计不能替代权限隔离。

Apodex 1.1从训练侧做了相似拆分:Environment Scaling 扩充可执行的文件、搜索和代码环境,Agentic Coordination Scaling 训练任务分解、并行委派、异步结果整合与 replanning;共享 execution harness 和 AgentOS 维护工具与 agent 的状态、provenance。作者称 35B Apodex 1.1 Mini 在本地部署形态仍保留较强 working capability,但摘要没有给出足够的逐 benchmark 数字支持跨模型排行,因此这里只保留训练维度和系统结构。

Trace judge 的降本来自域内数据,不是换一个便宜模型

LangChain 与 Fireworks 的实验先用 model panel 加 human review 建立 perceived-error label:chat-langchain 与 Fleet 数据中 positive 比例分别为 24% 和 18%。他们只用 chat-langchain 数据对 Qwen-3.5-35B 做 LoRA SFT,再跨域测 Fleet。base Qwen 在两集 accuracy 为 90.5%/83.2%;chat-langchain SFT 后为 96.1%/90.8%;Claude Opus 为 91.6%/90.2%,GPT-5.5 为 98.9%/89.1%。

这里最有用的结果不是标题里的 100 倍,而是域内监督没有把跨域结果拖垮:Fleet 上从 83.2% 到 90.8%。成本下降 10–100 倍取决于调用量、托管方式和所选 frontier judge;评估任务也只是作者定义的 perceived error。实际部署前仍应保留人审抽样、阈值校准与数据漂移监控。

Kiro 用模型档位把成本变成产品参数

OpenAI 与 Kiro把 GPT-5.6 Sol、Terra 与 Luna 接进同一开发环境。公告称 Terra 在 Kiro 的 Terminal-Bench 2.1 测试中可把成本降低约 82%。这是双方产品配置下的厂商结果,页面没有提供足够方法让它成为独立 model ranking;更稳妥的解读是,coding-agent 产品正在把模型档位、任务难度和预算路由做成显式控制面。

五、产品与商业

Epoch AI 对美国 GDP 统计的分析估计,NVIDIA 这类 fabless company 在美国生成、但因制造环节跨境而没有被现有核算完整捕捉的 value added,使当前美国实际 GDP 增速可能被低估约 0.3 个百分点。文章称团队逐项检查了可归入的统计账户,并与 BEA 沟通确认这一缺口。

作者进一步推演,如果 NVIDIA 增长趋势延续,缺口到 2028 年可能接近每年 2 个百分点。前一个数字是其对当前核算的估计,后一个是依赖高增长延续的情景外推,两者不应混写成同一确定事实。这一问题的 AI 含义不在模型榜单,而在宏观指标可能低估美国境内芯片设计、软件与知识产权产生的价值。

深度阅读

  • **AgentX - InferenceXv3**|约 45 分钟 适合 inference、scheduler、KV cache、benchmark 与 agent-platform 工程师。建议先看真实 session 的 input/output 分布,再看 prefix reuse、DRAM cache、correctness case 与功耗矩阵;不要只摘排行榜。建议 digest:yes。
  • **Prime Agent: A Self-Improving RLM Harness**|约 25 分钟 适合做长程 coding agent、persistent memory 与 subagent orchestration 的读者。建议把论文的 RLM/Continual Harness 结构与 仓库安全说明一起读:恢复能力、人工可见性和 sandbox 是三条不同边界。建议 digest:yes。

来源与口径

  • 证据窗口为 2026-08-24 07:00 至 2026-08-25 07:00(Asia/Shanghai),immutable run 为 20260825T120142+0800。自动抓取 147 条、0 重复;25 个 adapter-required 源均已记录 no_updateblockedunreachablenew_items
  • 自动抓取错误为 7 个 GitHub Releases 源的 HTTP 403 与 reddit-machine-learning 的 HTTP 429。vLLM、SGLang、Transformers、llama.cpp、Ollama、PyTorch、verl 均已改查官方 release 页面;只有 llama.cpp 在窗口内检出新版本。HF 聚合器显式跳过后,补查配置内 20 个官方组织 API,全部可达,窗口内没有满足时间与 likes 阈值的新仓库;响应保存在本 run 的 raw/hf-org-audit/
  • Qwen、MiniMax、MiMo、SGLang、Artificial Analysis 与 LMArena 的页面没有暴露可完整审计的日期列表;DeepSeek、Z.ai、StepFun、LongCat、混元与 The Batch 无法访问或超时。这些缺口都没有改写成“没有更新”。
  • Import AI 470 已全文逐节审计;只把 SPADE、Hawkeye 等条目回链到一手页面。METR 研究 note 日期为 08-14,只作为 Import AI 的审计记录,没有冒充本窗口新研究。AI Frontiers 的新文是政策建议而非新实证,因此记为 low_signal,没有进入正文。
  • smol.ai 最新完整一期仍覆盖 08-20–08-21,早于本期窗口;Twitter/Reddit 两节已全文检查,但仅记为 coverage_only,不建立固定 recap 栏目,也不挪用旧帖。本期没有 longform: true 新文,因此未触发 longform-scout;无需论证图,未使用 PicGo。
  • discovery-only 来源只承担发现与覆盖审计。正文中的论文结论回到 arXiv 或作者项目页;厂商数字保留平台、模型、并发或测量主体限制,不外推成普遍结果。