覆盖 2026-08-27 07:00 至 2026-08-28 07:00(Asia/Shanghai),run 20260828T150747+0800。 自动抓取 181 条、去重 0 条;人工检查 25 个 adapter-required 源。BAIR blog 超时、Reddit Machine Learning 返回 429;Hugging Face 官方组织聚合器因已知的串行挂起风险被显式跳过,随后并行直查配置中的 20 个官方组织,全部成功。

今天的共同主线是:Agent 一旦能执行代码、控制仪器或接受外部评测,“让模型自己判断这一步是否安全”就不再足够。 Anthropic 把设备能力与安全限制写进 Model Hardware Standard 的 driver;安全研究者则用 Python module shadowing 绕过 Claude Code Auto Mode,甚至出现 classifier 放行恶意进程、却拦住清理命令的反例。另一边,Google 用机密计算把测试题和模型权重同时隔离,UK AISI 用可审计的自适应停止规则控制评测预算。边界正在从 prompt 和单次批准,下沉到 driver、沙箱、机密执行环境与统计停止条件。

本期以 Hy4 模型卡、官方技术文章、安全研究者原始披露与政府评测机构方法文为事实底座;AINews、smol.ai、Hacker News 与 Reddit 只用于发现和覆盖审计。

今日重点关注

  • 物理 Agent 的接口开始自带安全合同。 Anthropic 的 Model Hardware Standard把设备能力归一成 readwrite 等原语,让 driver 同时描述可测量量、可调参数与强制安全限制;在线 Agent 负责探索,长任务可沉淀成确定性脚本。
  • Auto Mode 是便利层,不是隔离边界。 Johann Rehberger 的原始披露让 Claude 拒绝运行攻击者二进制后,诱导它自己写 Python 解码器,再由压缩包内的 struct.py 劫持标准库导入并执行代码。三种变体在每组 5 次的小样本里成功 3–4 次。
  • 第三方评测可以同时不泄露题目和权重。 Google DeepMind 的双盲 pilot用 Google Cloud Confidential Space 隔离 Gemini Flash Lite 与外部保密 benchmark:评测方看不到权重,Google 看不到测试 prompt。
  • 混元把 770B/49B MoE 与 1M context 放进开放权重。 Hy4 preview 模型卡披露 770B 总参数、49B 每 token 激活、78 层、Gated DSA、IndexCache、四条 residual stream 与原生 MTP;官方也明确承认它会过度推理、过度验证。
  • 评测预算开始由不确定性而不是固定重复数分配。 UK AISI 的 optstop在 task 和 group 两级跟踪 credible interval;初步九种设置中节省 57%–97% 的计划 trial,同时保留低于 1% 稀有成功的保守保护。
  • 生成与审查产品都在增加显式控制面。 Gemini Omni 1.1 Flash增加首尾帧、40 秒场景续写、360p 预览和 4K 上采样;GitHub Copilot code review取消大 PR 的 300 文件/20,000 行限制,并把 AddressedWon't fixIncorrect 变成结构化反馈。

一、模型与能力

本节核对 Hy4 preview 官方模型卡与 Google 的模型发布,不把厂商综合分外推成通用排名。

Hy4 preview 把稀疏注意力索引也变成可复用状态

腾讯 Hy 团队发布的模型卡把 Hy4 preview 定义为 770B 总参数、49B 激活的 MoE。主干共 78 层:第一层使用 dense FFN,后 77 层各有 256 个 routed expert 与 1 个 shared expert,每个 token 选择 top-8 routed expert 并同时经过 shared expert。主干之外另有一层原生 MTP,含 10B 总参数、0.7B 激活,用于 speculative decoding。

更值得看的是状态如何被稀疏化。模型采用 Gated DeepSeek Sparse Attention,indexer 的 top-k 为 2,048;IndexCache 让稀疏索引跨层复用,而 iHC 把 residual pathway 扩成四条 stream。模型卡给出的原生 context 是 1M。它不是简单把更大 MoE 接到旧注意力上,而是同时压缩每 token 激活、长上下文访问和 speculative proposal 的成本。

权重仓库由 Hugging Face API 记录为 8 月 27 日 08:52 UTC 创建,落在本期窗口;标准版和 FP8 版都以 Apache 2.0 发布。官方 vLLM 示例使用 TP8、FLASHMLA_SPARSE 与 3 个 MTP speculative token,SGLang 示例同样要求 TP8,并启用 NEXTN 路径。这只说明团队给出的启动拓扑,不等于八卡是所有量化或 offload 方案的绝对下限。

厂商 benchmark 也要分层读取。团队让 163 名腾讯内部专家对 203 个工程任务做盲选,报告 Hy4 平均分 2.99,略高于 GLM 5.3 的 2.92 与 Kimi K3 的 2.94;与 GLM 的比较是 46.8% win、12.8% tie、40.4% loss,与 Kimi 的比较是 51.2%/7.9%/40.9%。这是内部任务、内部评审和厂商自报结果,适合说明产品训练目标,不足以宣布通用领先。

模型卡主动列出两个限制:复杂任务上推理时间长于必要值,以及反复验证自己的工作。对 49B 激活、默认 high reasoning 的模型,这不是文案尾注,而会直接变成 token 成本、交互延迟和 Agent timeout。部署时应把 no_think、最大 token、工具调用预算与 MTP proposal length 一起调,而不是只看 1M context 和总参数。

Gemini Omni 1.1 Flash 把视频生成拆成可组合操作

Gemini Omni 1.1 Flash的增量主要不是一次新的文本到视频 demo,而是 API 里的控制原语。模型现在能读取最长 10 秒的既有上下文,以 10 秒为单位续写,累计到 40 秒;开发者可以同时给定首帧和尾帧,让模型生成两者之间的连续镜头。360p 预览用于低成本迭代,最终结果再上采样到 4K。

这套设计把“保持角色与场景一致”“控制相机运动”“先低清搜索、再高质量输出”从 prompt 技巧变成产品表面。官方称它已通过 Gemini API 在 Google AI Studio 提供;是否真的降低生产成本,仍要看每次迭代价格、失败率和跨 40 秒延展时的一致性,文章没有给出统一的独立测量。

二、研究与评测

本节以 Google 双盲评测技术报告、UK AISI 原文和 Google Research 发布为方法证据。

双盲评测把信任问题变成可验证的执行环境

Google DeepMind 的 pilot与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,用保密 benchmark 测一款 Gemini Flash Lite。过去外部评测通常要在两个风险中选一个:评测方交出题目,厂商可能看到未公开测试集;厂商交出权重,模型知识产权与安全风险暴露。

新方案把双方资产放进 Google Cloud Confidential Space。评测方不能读取 Gemini 权重,Google 不能读取评测 prompt;执行环境提供 cryptographic attestation,让双方验证实际运行的是约定代码和配置。它不能自动证明 benchmark 设计正确,也不能排除模型在训练数据里早已见过同源内容,但至少把“谁能看到题目和权重”从合同承诺变成技术上可检查的边界。

这对 cyber、国家安全和专有数据评测尤其重要,因为这些场景最不可能公开完整测试集。也要保留利益关系:Confidential Space 是 Google 自己的云产品,pilot 测的是 Google 模型。后续真正的可信度取决于环境与流程能否被独立复现、attestation 范围是否覆盖完整 harness,以及其他厂商能否在非自家控制面上接受同样测试。

optstop 用“还剩多少不确定性”决定是否继续烧 token

UK AISI 的 optstop针对一个越来越现实的瓶颈:长程 Agent eval 可能需要数亿 token;固定给每道题相同重复数,会在已经稳定的 model-task 组合上继续花预算,却可能在高方差或困难组合上样本不足。

optstop 在两个层级工作。task 内部跟踪重复 trial 的 credible interval;group 层用 hierarchical Bayesian model 汇总任务,同时容许各任务成功率不同。停止条件有两种:区间已经窄到预设精度,或者区间继续采样也不再明显变化。若二者都不满足,就跑满原预算。对估计成功率低于 1% 的情形,它要求更多数据,以免把安全评测里最关键的稀有成功提前截掉。

团队在 MATH、GPQA Diamond、WritingBench 上组合 binary、ordinal、continuous 三种计分与低、中、高三档性能,共九种设置;报告每种都节省 57%–97% 的计划 trial,停止后的分数估计没有明显变化。这个结果仍绑定于这些公开 benchmark 和预设阈值,不能直接外推到所有 adversarial eval。它的工程优点是每次停止及理由都有记录,并提供 post-hoc、shadow、live 三阶段采用路径:先在已完成数据上回放,再只报告“本可停止”的位置,最后才真的省掉 trial。

Earth AI 试图把全球预测模型的组装过程自动化

Google Research 的 planetary prediction engine把全球尺度环境预测建模拆成可以复用的组件和自动化搜索过程,目标是减少每个新变量、区域或任务都从头组装 pipeline 的成本。本期只把它作为 AI for Science 的方法线索:官方文章支持的是引擎与任务范围,跨地区泛化、校准稳定性和真实决策价值仍需看论文与独立复现,不能由博客标题外推。

三、AI Infra

本节按 llama.cpp 官方 release聚合工程方向,并用 Hugging Face 官方 API 的冻结响应审计开放权重。

llama.cpp 同一天补齐 DFlash2、分层 FFN 与 slot 级 KV

8 月 27 日的 18 个 llama.cpp release适合按系统方向聚合,而不是逐 tag 罗列。其中 b10658把 DFlash2 的 local convolution 与 candidate selector 合入主线;b10645增加 --n-cpu-ffn,允许把前 N 层 dense FFN 权重放到 CPU;b10660补齐 Qwen3.8-Flash-Next 的 GGUF 架构、low-rank hyper-connection 与 PLE n-gram embedding 张量;b10662则让 unified KV cache 按 slot 指定 context。

四个改动指向同一个趋势:本地推理不再只调“多少层放 GPU”。dense FFN、MoE expert、n-gram 表、KV slot、draft model 和 candidate selector 都开始拥有独立放置与调度合同。DFlash2 进入主线说明 speculative decoding 的算法竞争已经抵达消费级 runtime;但 release 没有给统一硬件与 workload 的端到端 benchmark,因此本期不复述社区里互不相容的加速倍数。

Hugging Face 组织审计补回 Hy4,而不是把跳过聚合器写成无更新

本次显式跳过会串行挂起的 hf-org-releases 后,按 source 配置并行查询 20 个官方组织,20 个均返回成功。窗口内创建的仓库只有 tencent/Hy4-preview和同发布的 FP8 版本;标准版在检查时已有 107 likes,FP8 版为 4 likes,均越过配置的 3 likes 阈值。响应已保存在 immutable run 的 raw/hf-org-audit/,避免把“脚本跳过”误写成“没有开放权重发布”。

四、Agent 系统与 Harness

本节比较 MHS research preview与 GitHub 产品控制面,关注能力描述、确定性执行和反馈合同。

MHS 把“Agent 能做什么”写进设备 driver

Anthropic 的 Model Hardware Standard仍是 research preview,尚不是完成开放治理的行业标准。它试图解决的现实问题是:显微镜、移液器、机械臂与量子实验设备各有接口,实验室往往要用数周乃至数月写 bespoke integration;Agent 即使会调用 API,也不知道设备重量、可调范围与物理安全限制。

MHS driver 统一暴露 readwrite 等原语,并把设备发现、自然语言说明、可测量量、可调参数和必须执行的安全限制放进参考文件。控制路径有三类:MCP、CLI 和代码文件。Agent 可以在线观察、调整和推理;当任务很长或设备动作快于在线推理时,则把已学到的操作链编成确定性脚本,让设备不必在每一步等待模型。

这种“探索后编译”是本期最重要的 harness 设计。Anthropic 描述了 Claude 调激光、通过相机观察偏移、循环校准,最后把过程写成单命令脚本;Genentech 的 BCA protein assay proof-of-concept 则协调移液器、机械臂和 microplate reader。Claude找到水约 140 µL/s、黏稠 BSA 约 10 µL/s 的流速,但遇到气泡时一开始只会重试,反而加剧问题;人类解释物理原因后,团队才把经验固化进可复用 skill。

这正好划出能力与边界:模型擅长搜索参数和编排接口,不等于理解所有物理、化学与生物约束。MHS 目前只向首批研究实验室和制造商开放,Anthropic 表示会在开放源码前共同开发安全评测与最佳实践。真正进入无人值守实验前,仍需要独立 emergency stop、设备侧硬限位、身份与权限、动作速率上限、审计日志,以及不依赖同一个 Agent 判断的故障检测。

Copilot code review 开始接收大 PR,也开始收集“为什么不采纳”

GitHub 的更新取消此前 300 文件或 20,000 行的 PR 上限,并让 Copilot cloud agent 创建的 PR 获得完整 agentic review。组织开启相应策略后,机器人作者的 PR 也可由组织直接承担 review 用量。

更细小但更有长期价值的变化,是解决评论时可选 AddressedWon't fixIncorrect。这给自动 review 建立了显式反事实数据:不是所有未采纳意见都等于人类漏改。它可能帮助区分真实缺陷、产品取舍与模型误报;但 GitHub 只说明反馈会用于改进产品,没有披露如何采样、是否进入训练、团队能否导出或审计这些标签。

五、安全、治理与产业边界

本节以 Rehberger 的原始攻击披露为安全事实,以 AI Frontiers 文章为明确标注的治理观点。

Claude Code Auto Mode 被一条“安全决策链”绕过

Johann Rehberger 的原始复现从一个普通“总结网页”请求开始。攻击页面让 WebFetch 返回 415,Claude 自行改用 curl,跟随 303 下载 ZIP。压缩包内提供一个可疑的原生 decoder;Claude 正确拒绝执行它,转而自己写 Python 解码器。问题在于解码器从攻击者控制的目录运行,base64 导入 struct 时优先加载压缩包里的恶意 struct.py,于是“拒绝陌生二进制、自己写可信代码”反而成为 RCE 路径。

研究者测试了三种小样本变体:远程 stager/C2 链 3/5 成功,启动第二个 headless Claude 做侦察 3/5,启动子 Claude 并写 workspace 外文件 4/5。这个 60%–80% 不是总体攻击成功率,不能与大型 benchmark 直接比较;它证明的是固定 72 场景、每场 10 次得到的 0.00% 并不覆盖定向、多跳、利用语言运行时细节的攻击。

最反直觉的日志是:少数运行里 Claude 事后识别出入侵并尝试终止恶意进程,Auto Mode classifier 却拒绝了清理命令。Anthropic 安全渠道把报告关闭为 Informative,并说明 Auto Mode 是 best-effort classifier,不是 security guarantee;真正边界是 OS isolation 和 network egress control。这个回应在工程上合理,也说明产品传播里必须把“减少批准打断”与“隔离不可信代码”分开。

可执行结论不是停用所有自动模式,而是把无人值守 Agent 放进 container、VM 或 OS sandbox,限制出站网络,不挂载 home、SSH key 与 cloud credential,并在 Agent 外部保留监控和 kill path。classifier 可以是一层,但不能同时当唯一批准者、唯一监视器和唯一事故处置者。

Agent ID 是治理提案,不是已经落地的标准

AI Frontiers 的文章提出 Agent ID、pairwise pseudonymous identifier 与 model deployment card 等基础设施,让支付、合同与平台能识别“哪个 Agent 代表谁、由什么模型和部署方运行”。这与 MHS 的设备 driver、Auto Mode 的进程权限形成同一问题的治理侧:动作必须能回到可追责主体。

但这些仍是 Gillian Hadfield、Dan Hendrycks 和 Leo Wu 的政策主张,不是现行标准。Agent 身份若由单一平台签发,会带来监控与锁定风险;可轮换假名若设计不当,又可能让跨平台追责失效。更成熟的实现需要同时回答最小披露、撤销、委托链、密钥托管、跨司法辖区与匿名合法使用,而不是只给每个 bot 发一个全局编号。

六、产品与商业

本节只保留 Cohere Parse 官方发布中可核对的价格、统一硬件吞吐、评测维度与产品限制。

Cohere Parse 给文档解析划出明确的价格与能力边界

Cohere Parse把复杂 PDF、表格、表单与图片转成 Markdown,并为表格和图片返回 bounding box。API 定价是每 1,000 页 1.50 美元;厂商在统一 8×H100、vLLM 配置下报告每卡 4.5 页/秒、整节点 36 页/秒。其自建 ParseBench 三维平均分为 79.2,高于文中列出的 Mistral OCR 4 的 74.5,但低于 GPT-5.5 的 84.4、Opus 4.8 的 84.3 和 Gemini 3.5 Flash 的 81.8。

更重要的是脚注里的负面空间:比较只纳入 Tables、Content Faithfulness 与 Semantic Formatting,没有测试 chart data extraction;layout 维度也被排除,因为当前产品只为表格和图片输出 element-level box,不为所有文字元素输出。这些是厂商自建 benchmark 和厂商价格,不能当独立排行榜,但至少把“测了什么、没测什么、同硬件吞吐多少”写清楚,优于只给一个综合 OCR 分数。

深度阅读

  • **Previewing the Model Hardware Standard**|约 30 分钟 适合做具身、实验自动化、MCP 与 Agent permission 的读者。建议重点看 driver 原语、在线探索转确定性脚本、Genentech 的气泡失败和设备侧限制。digest 建议:yes。
  • **Breaking Claude Code Opus 5 Auto Mode**|约 20 分钟 适合 coding-agent、安全和 sandbox 工程师。完整攻击链比“60%–80%”标题数字更重要:415、curl、ZIP、module shadowing、C2、清理被拒共同解释为什么 classifier 不是 sandbox。digest 建议:yes。
  • **Optimal stopping: spending evaluation compute where it counts**|约 15 分钟 适合做大规模 Agent eval、benchmark 与统计测量的读者。先看 task/group 两级区间,再看低成功率保护和 shadow mode,避免把节省 trial 误读成降低评测强度。digest 建议:yes。
  • **We Need Better Infrastructure to Govern AI Agents**|约 18 分钟 适合从身份、支付与责任基础设施理解 Agent 治理的读者。把 Agent ID 当待检验设计,而不是既成标准;与本期 MHS 和沙箱边界对照阅读。digest 建议:no,先观察后续规范与实施方案。

没进正文的线索

  • AINews 与 Reddit 都集中讨论 NVIDIA 以约 130 亿美元收购 Hugging Face,但本轮检查 NVIDIA NewsroomHugging Face Blog没有找到双方官方公告。媒体报道与聚合标题不能替代交易双方确认,因此本期不把“已完成收购”写成事实。
  • OpenAI 的学生与批判性思维随机试验页面在本轮返回 403;只读到“超过 1,000 名学生”的 RSS 元数据,无法核对分组、效应量与限制,故没有进入正文。

来源与口径

  • immutable run 为 20260828T150747+0800,窗口严格在 2026-08-28 07:00(Asia/Shanghai)闭合。自动抓取 181 条;BAIR blog 超时,reddit-machine-learning 返回 429。失败没有被改写成“无更新”。
  • 25 个 adapter-required 源全部记录结果。xAI、Ai2 返回 403,Mistral 超时,Z.ai 入口 404;Qwen、DeepSeek、MiniMax、StepFun、LongCat、混元、MiMo、SGLang、Artificial Analysis、METR 与 LMArena 的公开入口缺少可严格按时间窗审计的列表或快照。The Batch 改查无尾斜杠入口,最新一期是 08-21。
  • Anthropic MHS 页面结构化更新时间为 2026-08-27 15:53 UTC,Cohere Parse 为 13:00 UTC,均在窗口内。Hy4 preview 的创建时间由 Hugging Face 官方 API 核对为 08:52 UTC。
  • 已全文审阅 smol.ai 08-27 归档的 Twitter 与 Reddit 两节;页面自身却标注覆盖 8/22–8/24,早于本窗口,因此只作 coverage audit。Latent Space 两篇 AINews 分别覆盖 8/24–8/25 与 8/25–8/26,后一段 Reddit 还受付费墙截断,也都只记为 coverage_only
  • 本期没有 Import AI 新一期,也没有 longform: true 新文,因此未触发 longform-scout。文章不需要论证图,未调用 PicGo。所有厂商 benchmark 均保留测量主体、任务或硬件限制;Reddit 单机速度和评论区推断没有被升级为通用结论。