State of AI: 2025 年度人工智能报告之 Politics & Safety 篇
stateof.ai 1 出品了 2025 年度人工智能报告2。本文编译自该报告,并附带简单分析,强烈推荐阅读原报告。
以下为全文目录,受限于篇幅,本报告将分为 3 篇发布,本篇为第三篇,主要关注过去一年中 AI 在政策监管、AI 安全等方面的进展,还有今年新增的 AI 使用调查和对未来 12 个月的预测。
- State of AI 2025 报告年度总结
- 科研进展:技术突破及其能力
- 产业界发展:当前 AI 创新的商业化应用以及对应的商业化影响
- 政治影响:AI 监管,AI 产生的经济影响,AI 的地缘政治演进
- AI 安全:明确和减轻将来庞大 AI 系统可能产生的灾难性影响
- AI 使用调查:1,183 位 AI 从业者的使用与付费习惯
- 对未来 12 个月的预测
04 Politics
Politics 进展总结
- AI 竞赛升温,美国以「America-first AI」为纲领并反复调整出口管制,中国则加速自主可控与国产芯片。
- 在超额投资面前监管退居其次,国际治理陷入停滞,欧盟 AI Act 遭遇落地阻碍。
- 「AI 全球化」变得具体,石油美元和国家级项目为超大规模数据中心与模型接入买单,同时就业冲击的数据开始浮现。
Trump 47 与美国的 AI 大战略
Trump 47: back with a vengeance
特朗普的第二个任期带来了第一任期暗示过、但从未完全执行的强化政策。第 47 任总统的 AI 议程包括:激进撤销拜登时代的安全规则(EO 14179)、把 AI Safety Institute 改名为 Center for AI Standards and Innovation(CAISI)——安全二字就此消失——以及启动 5,000 亿美元的 Stargate AI 基建计划。
- 2025 年 7 月公布的 AI Action Plan 阐述了政府在全球 AI 中确立美国主导地位的国家战略3。
- 把 AISI 改名为 CAISI 的操作,象征意味相当明显4。
- 「One Big, Beautiful Bill」中最初包含一条对州/地方 AI 立法的 10 年冻结条款,在两党反弹后被删掉,但推动撤销州级监管的努力仍在继续5。
- 现在白宫的 AI 领导层几乎是硅谷名人录:David Sacks(AI & Crypto 事务主管)、Sriram Krishnan(高级 AI 政策顾问)和 Michael Kratsios(科技政策办公室主任)。
The AI Action Plan: America’s Grand AI Strategy
这份 23 页的计划提出了超过 100 项不同政策,以确保美国的 AI 创新和全球领导地位。但问题是:美国的官僚体系执行得了吗?6
- 美国技术栈出口:行政令 14320 建立了 American AI Exports Program,为盟友和其他国家打包一整套 AI 栈(硬件、模型、软件、应用、标准)。
- AI 基建建设:计划要求简化审批、升级国家电网,并开放联邦土地来支持数据中心和 AI 工厂的建设。
- 开源模型领导地位:美国的开源领先被视为对国家安全利益至关重要。
- 撤销 AI 监管:联邦机构可以撤回对有「繁重」AI 监管的州的自由裁量性 AI 支出。
- 保护部署模型中的「言论自由」:更新联邦采购政策,美国只采购「免于自上而下意识形态偏见」的前沿 LLM。
From controls to exports: America’s “AI Stack” strategy
美国政策正在从广泛的扩散管制,转向以出口为主导的战略。American AI Exports 计划把算力、模型、云服务和合规打包成一套由美国政府背书的「American AI stack」,提供给选定的伙伴。目标是塑造标准、建立依赖,并对冲中国的数字丝绸之路剧本7。
- 2025 年 5 月,政府撤销了拜登时代的 AI Diffusion Rule,该规则曾对先进 AI 芯片和闭权重模型的出口实施分层许可,并依赖对供应链的密切监控8。
- 新方法偏向主动扩散:选定国家会获得一整套整合的 American AI stack,包括基础设施、基础模型、部署工具和治理模板。
- 资格标准很可能跟随商业机会、安全立场对齐程度以及美国产业界的压力。接入不会是普遍的,终端用途监控仍是明确要求。
- 这一战略把价值转移给美国供应商,同时提高了下游锁定和管控不均的风险。它也在检验一个命题:出口打包能否比单纯限制更有效地压制对手的影响力。
芯片出口政策的来回摆动
US chip-export policy zigzags test leverage over China
2025 年在限制与妥协之间发生了快速反转。政府在国家安全目标、供应链依赖和厂商游说之间平衡,把 NVIDIA 和 AMD 推到政治聚光灯下,也给伙伴和合规团队注入了不确定性。
- 1 月:商务部长提名人公开支持更严格的管制,一开始就释放了强硬信号。
- 3–4 月:商务部把 AI 芯片限制扩大到中国,实际上阻断了此前「合规」的 H20 等产品的销售,并警告会堵上漏洞9。
- 7 月:在产业界持续游说后,商务部为中国市场放行了降级版 H20,重新打开一条受控通道,同时把顶级产品挡在门外10。
- 8 月:美国政府与 NVIDIA、AMD 达成有条件的许可条款,包括对华销售 15% 的收入返还;国会开始审议 GAIN AI Act,优先照顾国内买家。
- 净效果是:厂商面临时停时启的合规与定价风险,而北京在加速本地替代,且当规则变得比执法更快时,灰色市场就会繁荣。
No Pain, No GAIN
GAIN AI Act 会要求芯片厂商在向「关注国家」(如中国、俄罗斯、朝鲜)销售先进 GPU 之前,先满足美国本土客户的订单。不意外,NVIDIA 很不高兴11。
- NVIDIA 长期强调 GPU 需求超过供给。在应对这些全球约束时,黄仁勋声称 NVIDIA「公平分配」。这个立场使得自 2023 年以来约 190 万张 GPU 合法运往中国。但被阉割的芯片在整条价值链上仍与其他 SKU 争夺产能。因此,要么对中国客户的销售拉长了美国云厂商的交付周期,要么所谓的供应链瓶颈被 NVIDIA 夸大了很多年——二者必有其一。
- 在第一轮回击中,NVIDIA 把 GAIN 类比为 AI Diffusion Rule,称后者「建立在末日论科幻之上」12。但前者只适用于受美国武器禁运的国家,或国家情报总监认定正在(或计划)承载与禁运国相关军事/情报设施的国家。尽管存在一些主观性,其范围明显比适用于全世界的 Diffusion Rule 更窄。
Rendering new verdicts: NVIDIA’s recent attempts to exert influence in Washington
为了维持在中国的存在,NVIDIA 迅速扩大了在华盛顿的存在:自第一轮出口限制以来,它同时扩充了内部政府事务团队和外部游说支出13。
- 在与 Brownstein 和 BGR Group 签订新合同后,NVIDIA 的游说支出正逐步接近支出最高的科技公司(Meta 年内约 1,400 万美元、Google 约 800 万美元)14。随着围绕 B30A 的决策临近,预计其支出今年还会进一步增加。
- NVIDIA 的动作反映出它不愿放弃中国芯片市场。从利润最大化角度看,中国在 2026 年将是一个「500 亿美元的市场」。而且出货量还会强化 CUDA 生态——中国有约 150 万名活跃开发者,失去这些「护城河挖掘工」可能有严重的长期后果。同样,尽管中国挑战者已经获得大量政府补贴,NVIDIA 退出该市场等于直接给这些机构注资。
But Washington may not be the only place NVIDIA needs to lobby…
即使有美国政府的支持,NVIDIA 在中国的稳定存在也远未有保障。2025 年 9 月 15 日,中国反垄断监管机构宣布 NVIDIA 在 2020 年以 70 亿美元收购以色列网络产品供应商 Mellanox 一案中违反了中国反垄断规则15。中国当初批准这笔收购的条件是 NVIDIA 不得歧视中国客户,而在此前美国出口禁令面前,这个条件几乎不可能遵守。目前尚未宣布处罚,但罚款可能高达其最近一个完整财年中国销售额的 10%。
- 公告的时机引人注目:它发生在中美马德里贸易谈判期间。初步裁定却暂不给出处罚,给了中国潜在的谈判筹码。有趣的是,中国反垄断机构通常在裁定的同时宣布罚款,这次可能是刻意留白给「贸易和平」一个机会。
- 这一决定也与中国鼓励国内科技公司不要使用 H20 同期发生16。所以长期看中国希望摆脱美国芯片,但短期内中国仍然需要 NVIDIA——即使它急于表明自己不需要。
关税、补贴与国家入股
Chips, Tariffs, Subsidies…oh my!
特朗普公开批评 CHIPS Act,在别处则称所有补贴都是「纳税人的施舍」。最近他表示将对半导体进口征收「相当可观的关税」以激励国内芯片生产,但这些关税会对同意在美投资的公司给予豁免17。与通过 CHIPS Act 的两党拨款来推动芯片生产回流不同,这届政府出于「要看到 ROI」的动机,转而使用关税和其他替代策略来鼓励回流18。
US and Intel: a new, unexpected, stake-based friendship
除关税之外,一项新的非 CHIPS 策略是直接入股芯片厂商。在指责新上任的 Intel CEO 陈立武因对中国公司超过 2 亿美元的投资而「严重利益冲突」之后,特朗普让美国政府以约 89 亿美元的 CHIPS 拨款换取了这家陷入困境的芯片厂商 10% 的股份19。这不是美国第一次为促进国家利益而买入公司股份(参见 US Steel、AIG、GM)。此举取代了特朗普和 Lutnick 推动但失败的 Intel-TSMC 合资方案。问题是:这是机会主义,还是更广泛的美国产业政策的开端?
- Lutnick 也曾对入股三星和 TSMC 表示兴趣。但美国政府动用通常只在危机时才使用的策略来介入私营部门,本身就是先例的改变。税收优惠和补贴这些美国政府惯用的工具,可能让位于政府直接投资这一新策略20。有传闻称一些 CEO、共和党人对这笔交易有深切担忧。
- 出人意料的是,参议员 Bernie Sanders 同意 Lutnick 的观点:纳税人应该从美国对本土芯片制造的大量投资中看到回报。
But there’s more unusual US Government partnerships with the private sector…
- Lutnick 讨论了入股多家美国国防公司的可能性,理由是美国政府本来就贡献了它们大部分收入。
- 政府允许 NVIDIA 和 AMD 向中国销售 AI 芯片,条件是政府拿走销售额的 15%21。
- 政府获得了 US Steel 的「黄金股」,可以任命一名独立董事,并让总统对某些特定决策拥有否决权22。
- 稀土矿企 MP Materials 与国防部达成 10 年协议,国防部购入最多 4 亿美元的 MP 股票,并可在之后把持股比例提高到 15%23。
TikTok USA: the “will they/won’t they” storyline comes to an end
**最奇特的政企安排发生在美国政府与字节跳动之间。**9 月,中美达成协议,结束了美国「立法禁令但从不执行」的多年拉锯:TikTok 将被允许在美国运营,其推荐算法的一份副本交给 Oracle,由 Oracle 重新训练该算法,并负责数据和算法安全24。字节跳动将持有这家新的美国公司略低于 20% 的股份(总估值 140 亿美元),Oracle 等新投资者组成的团体持多数股权。七个董事席位中六个由美国人担任。美国政府还将从投资者那里获得一笔金额未知的数十亿美元费用,作为其在谈判中角色的报酬。
- 这笔交易为数据主权设定了标杆:算法需要用受保护并本地存储的本地数据重新训练。数据采集问题被清楚地解决了——在只持有少数股权的情况下,很难想象字节跳动还能外泄数据或影响美国的 app。
- 虽然不需要国会批准,这笔交易一定会受到国会的密集审查,尤其是在 FCC-Kimmel 事件带来新的言论自由担忧之后。实际监督和塑造 Oracle 重训练与部署 TikTok USA 的是财政部(具体来说是 CFIUS)25。
为 AI 基建让路:审批、电力与 NIMBY
If you build it, the AI will come
联邦政府的 AI Action Plan 把 AI 基础设施当作国家优先事项,但它的主要作用不是直接出钱建设,而是削弱环境监管、扩大能源供给,让私营企业能加速数据中心建设。
- 这包括加快《国家环境政策法》(NEPA)下的审查,并放松《清洁水法》《清洁空气法》等其他法规的要求26。DOE 还宣布了 PermitAI:一个基于 NEPA 申报文件定制的 AI,用于简化审批流程27。
- 特朗普宣布升级/扩建国家电网,包括来自日本 Hitachi 的 10 亿美元投资。政府同时在考虑扩大化石燃料,并撤销清洁能源补贴。
- 例如 Fermi America 正在申请 DOE 贷款,在德州 Amarillo 建设「Donald J. Trump 先进能源与智能园区」——一个为数据中心供电的天然气与核电复合体28。
- 由于联邦政策优先化石燃料扩张,新建的 AI 数据中心很可能被锁定在这些能源上,威胁未来的脱碳努力。
AI data center’s latest bottleneck: NIMBYism
美国公众对新建 AI 数据中心的反弹正在成为最新的政治爆点。超大规模厂商的 AI 野心,很快可能被它们处理这根高压线的能力所限制。
- Data Center Watch 的数据:已有 640 亿美元的规划中数据中心项目因当地反对而被阻止或延迟29。
- 以下项目因附近居民的关切而停滞或撤回:Google 在印第安纳州 Franklin Township 的 Project Flo30、QTS 与 Compass 在弗吉尼亚州 Prince William County 的项目、CRG 在密苏里州 Saint Charles 的 Project Cumulus。
- 农民成为主要的反对派之一,主要出于环境关切和对资源(土地、水、电)的竞争。其他居民关注光污染、空气质量和噪音。
- 国内反对声浪的增长可能迫使美国超大规模厂商把更多集群外迁。这会威胁到支撑美国整体经济的支出流。但这些集群确实挑战了很多美国人的生计,而超大规模厂商至今没有处理好这一点。
Foundational AI Research is a government priority, but where’s the money?
AI Action Plan 提到需要资助 AI 的「基础科学」,**但「核心」AI R&D 的实际投入远低于专家建议美国在 2026 年前投入的 320 亿美元。**这是非商业性的基础研究——有人认为这类研究比私营部门的研究更具变革性。
- 2021 年,由 Eric Schmidt 领导的国家人工智能安全委员会(NSCAI)发布报告,呼吁到 2026 年把非军事 AI R&D 的年度联邦资金提高到 320 亿美元31。参议院两党 AI 工作组 2024 年 5 月发布的「AI Roadmap」也呼应了同一个数字。
- 2025 年,特朗普的预算提案为非国防 AI R&D 分配了 33.16 亿美元,其中 19.5 亿用于「核心」AI R&D32。总体来看,联邦非军事 AI R&D 支出自 2023 年以来一直徘徊在 30 亿美元左右。
- 基础 AI 研究是否会增加还不清楚:政府已经冻结了大学和 NSF 的部分资金,以确保它们符合新的优先事项。
- 不过美国的 NAIRR(面向 AI 研究和教育的共享国家基础设施)将在未来一年从试点转为协调的国家项目,其 26 亿美元的成本由不同联邦机构和企业分摊33。
美国各州的 AI 立法:赢家与输家
AI regulation across the U.S. states: winners and losers
州议员们过去一年在 AI 立法上非常忙碌:各州共提出了超过 1,080 项(!)「AI 相关」议案,其中 118 项成为法律34。提出 AI 立法最多的五个州是纽约、伊利诺伊、加州、马里兰和德州35。当前最可能通过的州法通常属于以下类别:
- AI 生成的儿童性虐待材料(CSAM)/ 非自愿亲密影像(NCII)禁令:禁止制作和传播 AI 生成的儿童色情或未经同意的成人性影像,并为在线平台建立下架规则。
- 透明度与披露要求:要求企业在客户与 AI(尤其是聊天机器人或生成式 AI)交互时进行披露,或用可见提示/元数据标注 AI 生成内容。
- 政府 AI 使用限制:限制州政府机构如何使用 AI,尤其在监控、执法或政府决策方面。
- 健康与就业:要求披露在医患交互或雇主/求职者决策中使用了 AI,某些情况下要求人类监督。
需要说明的是,「超过 1,000 项议案」这个数字常被夸大解读——真正可能对美国 AI 实验室产生实质影响的只有约 40 项36。
Winner: California’s SB53(“Transparency in Frontier Act”)
这是第一部要求大型 AI 开发者进行公开、标准化安全披露的州法,9 月签署成法。去年加州参议员 Scott Wiener 曾尝试推动一部更激进的 AI 安全法案(SB1047),结果遭到产业领袖、知名 AI 科学家和州长 Newsom 的反对,最终被否决。Newsom 随后召集了一个包含 Wiener 的 AI 专家工作组,该组的建议构成了 SB53 的骨架37。尽管这部法律相当温和(只适用于最大的开发者,且主要针对重大危害),它将成为全国 AI 透明度要求的标准。
- 该法只适用于大型前沿模型开发者(10^26 FLOPS 且收入超过 5 亿美元)。这些开发者需要在网站上公开安全与安保协议,并在发布或更新前沿模型时公布公开风险评估结果。重要的是,开发者必须向州政府通报关键安全事件或迫近的危险威胁,法案还包含举报人保护条款38。
- 其他州正在关注:密歇根和纽约都在考虑对大型开发者提出类似的透明度要求,纽约的法律正在等待州长 Hochul 签署。Anthropic 公开支持了 SB 5339。
Loser: omnibus AI laws winnow down and third party auditing a no-go for now
尽管 SB53 通过了,跨行业适用、并对私营主体施加安全义务的州级治理法律仍然屈指可数。过去一年,出于对监管过重的重新担忧,此前已颁布的一些 AI 治理法律被修订和收窄。在包括 SB53 在内的州法中加入第三方审计要求的尝试都遭到抵制,多数情况下被删除40。
- 弗吉尼亚州长 Youngkin 否决了州 AI 治理法案(HB2094),理由是它会给 AI 产业带来负担41。康涅狄格州长也表示会以同样理由否决 AI 立法。
- 德州通过了 Responsible AI Governance Act(TRAIGA),但在委员会讨论中被修改,删除了「注意义务」、影响评估和高风险 AI 系统披露等义务42。
- 犹他州对其 AI Policy Act(UAIPA)的新修正案,把关键法律要求收窄到只适用于高风险 GenAI 系统。
- 科罗拉多州把参照 AI Act 制定的「Colorado AI Act」实施时间推迟到 2026 年 6 月。
The State of State AI Regulation is a “patchwork” problem
特朗普政府推动州级 AI 冻结,部分原因是它认为州 AI 立法过于不均衡和混乱,难以有效。而 AI 公司当然也不高兴。一个乐于接受的政府鼓励了最大的开发者和投资者采取坚决的反州立法立场——争论的焦点已经不是各州该通过什么样的法律,而是州议会究竟该不该通过任何 AI 立法。
- 在提交给 AI Action Plan 的意见中,OpenAI、Meta 和 Google 都呼吁先占(preemption)州 AI 法律,以免除自己在几乎所有州 AI 立法下的责任。风投机构 a16z 则主张州 AI 法律在州际商业条款下可能违宪43。
- 但日子还得过。企业面临三种选择来管理这个「拼布问题」:1)按最严格的立法框架(如 Colorado AI Act)来搭建合规;2)逐州碎片化合规;3)游说并等待可能永远不来的联邦行动44。
But the Big, Beautiful fight over AI preemption continues…in the sandbox
特朗普标志性的 One Big Beautiful Bill 最初包含一条先占条款:把州宽带资金与实施「10 年州和地方 AI 监管冻结」挂钩。这条争议条款在法案最终通过前被删除,但这个想法还活着:冻结的主推者、参议员 Ted Cruz 提出了一部监管沙盒法案(SANDBOX Act),允许企业申请对「阻碍性立法」的豁免,最长 10 年45。
- 尽管接近实施,这条款从一开始就不受欢迎,两党中不太可能的盟友一起谴责它。实际上,它被删除只是因为参议员 Blackburn 担心儿童安全,以及担心它会取消田纳西州刚通过的艺术家版权保护(ELVIS Act)46。
- Anthropic 游说国会,主张在先占州/地方监督之前应当先建立精简的联邦监管47。看起来实验室更偏好轻触式的联邦监管而不是零监管,但零监管可能比州法拼布更受偏爱。
Regulatory sandboxes: innovation boost or waiver machine?
美国的 SANDBOX Act 会创建一个由科技政策办公室(OSTP)运行的联邦 AI 沙盒,授予对现有规则的有时限豁免。企业可获得两年豁免,可续期最多五次(最长 10 年),如果机构在 90 天内不回应则「自动批准」,并可向 OSTP 上诉48。
- 与欧盟的区别:EU AI Act 强制要求由监管者主导的沙盒,聚焦风险缓解和合规证明,而不是多年期的规则豁免49。
- 支持理由:更早的受监督部署、更快的监管反馈回路,以及在规模化之前对前沿系统的可见度。
- 反对理由:会激励「挑选管辖地」和监管俘获、保护水平不均,如果「自动批准」变得普遍,它可能实际上变成去监管的豁免机器。
国际治理的坍塌
RIP International AI Governance, AI Treaties, and Global AI Safety Alignment
特朗普重新就职,突然终止了一个强调 AI 安全、alignment 以及制定「促进可靠可信 AI」自愿性措施的国际外交时代。伤亡名单包括:
- 欧洲委员会 AI 框架公约:一份 AI 人权条约,2024 年 9 月 5 日开放签署。16 个国家加上欧盟已签署,但零个签署方完成了批准50。
- G7 广岛 AI 原则与行为准则:OECD 推出了一个自愿框架,让企业报告自己如何落实 G7 AI 原则。2025 年 G7 Kananaskis 新闻稿只包含「利用广岛 AI 进程成果」这类含糊承诺——鬼知道是什么意思。
- 联合国:2024 年联合国召集了一个 AI 咨询机构,「开展分析并推进 AI 国际治理的建议」,发布了报告;而美国宣布拒绝全球 AI 监督51。2025 年联合国宣布了两个促进「合作」的「机制」(也就是委员会)52,另有 200 多位专家签署了一封措辞强硬的信呼吁「AI 红线」53。
RIP AI Safety Institute Network
2024 年 11 月 21 日,来自澳大利亚、加拿大、欧盟委员会、法国、日本、肯尼亚、韩国、新加坡、英国和美国的 AI 安全研究所代表在旧金山聚集,宣布成立 International Network of AI Safety Institutes54。将近一年后,这个网络开了两次会,美国一次都没出席。
- 它的目的是建立一个由公共资金支持的政府机构组成的全球网络,定期开会制定最佳实践、共享用于监测和报告危害、风险和事件的研究。
- 该网络在 2025 年开过两次会,进行评估 agent 系统风险的联合测试。美国两次都没出现。
- 美国 AI Safety Institute 在特朗普政府下改名为 Center for AI Standards and Innovation,而英国的 AI Safety Institute 改名为 AI Security Institute。
- 美国几乎不可能再参与任何未来的 AISI 网络活动。就在该网络在巴黎开会的同时,副总统 Vance 在 AI 峰会上的演讲说得很直接:「AI 的未来不会靠对安全的忧心忡忡赢得。」55
联邦执法:AI-Washing 与儿童保护
The “AI-Washing” problem: the year in federal enforcement
DOJ、FTC、SEC 这些联邦机构在很大程度上接过了 AI 监管的角色,而它们的主要优先事项是确保企业不夸大自己的 AI 主张(也就是「AI-Washing」)。
- 过去一年 DOJ 提起的最著名案件之一,是起诉 “nate” 公司的前 CEO 兼创始人 Albert Saniger,指控他通过虚假声称集成了 AI 来从投资者手中融资 4,000 万美元。真相是:nate 的「AI」能力其实是一个外包的菲律宾员工团队。56
- DOJ 修改了内部指引:如果一项犯罪因 AI 而变得更严重,DOJ 将要求更重的判刑57。
- FTC 对多家 AI 公司提起了行动,其中不少涉及企业对其产品或服务做虚假声明(如 Workado、DoNotPay、Cleo AI、Evolv Technologies)。
- SEC 则成立了 Cyber and Emerging Technologies Unit(CETU),一个 30 人的专项组,用于发现 AI/ML 科技公司中的欺诈58。SEC 一直在密切关注公开申报文件和致股东信中的 AI 相关披露,寻找潜在的「AI-Washing」。
FTC probes AI chatbots’ interactions with children
2025 年 9 月,FTC 启动了对 AI 聊天机器人如何与未成年人交流的调查,起因是有报道称 Meta 的机器人存在「情色」交流,以及一起指控 ChatGPT 在一名青少年自杀中起作用的诉讼59。虽然这不是正式调查,但这一主动举动表明监管者不想重复早期社交媒体监督的错误。
- FTC 向 Meta、OpenAI、Google,以及 Snapchat、xAI 和 Character.AI 索取了信息。
- 在「情色」对话的报道之后,参议员 Hawley 表示将对 Meta 启动正式的国会调查60。
- 针对该诉讼,OpenAI 表示将实施家长控制功能,包括在孩子表现出「痛苦」迹象时向家长发送通知61。
反向 acqui-hire 与反垄断
The reverse acqui-hire: the Valley’s fast-track exit
大厂期待的并购「Trump Bump」还没到来,因为拜登时代的反垄断审查冷却了买家。取而代之的是大厂拥抱了「反向 acqui-hire」:几周内吸纳团队、规避收购规则,留下一个被掏空的「RemainCo」去转向更小的市场62。
- 反向 acqui-hire 在 2025 年激增,Google、Microsoft、Amazon 和 Meta 领跑(如 Microsoft/Inflection、Google/Character.AI、Amazon/Adept、Meta/Scale AI)63。
- 典型结构包括三步:1)给创始人/员工丰厚回报;2)IP 授权让投资人拿回本金;3)一个精简后的 RemainCo 转向细分 B2B64。
- Inflection AI → Microsoft:从 40 亿美元的 AI 竞争者变成 12 人的「AI Studio」。
- Adept → Amazon:10 亿美元的 agentic AI 创业公司缩减为一个小型企业 AI 团队。
- Scale AI → Meta:曾有 1,400 名员工,裁撤团队后现在只专注单一的 B2B「需求生成」业务。
But the FTC may be cracking down as it pursues investigations
**监管者对反向 acqui-hire 的不适感在增长,即使这类交易规避了正式的并购审查。**Lina Khan 在 2024 年对 Microsoft 的 Inflection 交易开启了调查,而到 2025 年 3 月,新任 FTC 主席 Andrew Ferguson 要求 Microsoft 对其 AI 运营做更多披露65。
- 2024 年 7 月,在参议员 Wyden、Welch 和 Warren 联署呼吁调查后,FTC 向 Amazon 索要了其对 Adept 反向 acqui-hire 的细节66。
- 与此同时,英国竞争管理局在 2024 年放行了 Microsoft/Inflection 交易,称他们看不到「实质性削弱竞争的现实可能」67。
- 虽然尚未采取行动,FTC 的信号表明反向 acqui-hire 仍可能被视为收购,让大厂最爱的这条退出路径面临威胁。
Figma’s IPO: Lina Khan…vindicated?
**FTC 和 DOJ 在 2020–2023 年间挑战了 14 起初创公司收购,而在此前的七年(2012–2019)两家机构只挑战了 3 起。**Khan 和 DOJ 反垄断负责人 Jonathan Kanter 的理论是:大厂通过收购初创公司来杀死竞争,从而扼制了创业生态。硅谷曾嘲笑这个理论,但 Figma 强势的 IPO 可能验证了这种思路68。
- Adobe 曾在 2022 年试图以 200 亿美元收购 Figma,但在 15 个月的反垄断审查后,双方看不到获批的路径。Figma 于 2025 年 7 月 31 日转而 IPO,首日交易股价翻了三倍,公司市值接近 570 亿美元69。此后股价从首日高点回落,但投资者仍视其为一家优质的上市科技公司。
- Wiz 在同意被 Alphabet 收购前也曾考虑 IPO。它原本在 2024 年 7 月出于监管顾虑和 IPO 梦想拒绝了 230 亿美元的报价。现在 Wiz 会后悔吗?
Wiz/Alphabet: Big Tech’s Ultimate M&A Test
Alphabet 在特朗普就职数周后宣布的 320 亿美元收购 Wiz,是迄今最大的 AI 安全交易,也是对新领导层下 DOJ 是否会软化反垄断的一次现场测试70。Google 已经很麻烦了——过去一年它输掉了不是一起、而是两起(!)重大反垄断诉讼。
- DOJ 在 7 月一周内批准了价值 630 亿美元的三起并购,并有报道称现任反垄断负责人 Slater 正被施压对新交易更「友好」71。
- 但 Alphabet 这笔最大收购的时机糟糕得不能更糟:它在受到密集联邦审查之际尝试一起纵向合并——这类交易更容易被监管否决。**Alphabet 同意如果交易未获批准就向 Wiz 支付 32 亿美元(交易额的 10%),这可不像是信心不足的表现。**如果这笔交易通过,基本上等于给科技行业回归传统收购初创公司的方式开了绿灯。
Google comes out unscathed in 1 of 2 antitrust cases but search is on the ropes…
这位硅谷宠儿在过去一年的两起里程碑式反垄断裁决中被打得不轻:**两位不同案件的法官分别裁定 Google 在 1)搜索 2)广告技术上运营垄断。**2025 年 9 月初,搜索垄断案给出了救济措施,法院指出 Google 搜索业务在 LLM 聊天机器人面前的脆弱性,基本上采纳了 Google 自己提出的救济方案72。考虑到 ChatGPT 和其他 agent 对 Google.com 的去中介化压力,这对 Google 是一次大胜。
- Google 现在必须与 DuckDuckGo 这样的竞争者共享搜索索引数据,且不能再与其他公司签订独家合同来推广 Google 搜索和其他产品。但 Google 仍然可以付钱让伙伴推广自己的搜索和 app——所以尽管 Google 曾向 Apple 支付 200 亿美元换取 Safari 上的独家使用,只要条款改为非独家,这笔交易就可以保留。
- 相比美国政府提出的「结构性救济」(包括强制 Google 出售 Chrome 浏览器),这些措施属于轻触式73。
- Google 很可能会上诉,反对最初的「垄断」定性。但还有那起广告技术案——专家警告说,在那起案子里 Google 更可能被迫剥离其广告业务的核心部分。
欧洲:AI Act 的落地阻碍
Meanwhile in Europe…
要求欧盟放弃其标志性 AI Act 的压力不断增加,但欧委会仍在按以下分阶段的合规时间表推进74:
- 2024 年 8 月 1 日:AI Act 的合规倒计时正式开始,法律已在欧盟官方公报上生效,但关键义务尚未开始适用。
- 2025 年 2 月 2 日:第一项重大义务生效——禁止「不可接受风险」的 AI 系统(如社会评分、生物识别、人脸识别)。
- 2025 年 8 月 2 日:GPAI 的自愿性行为准则(Code of Practice)发布;选择遵循该准则的企业被推定合规,不遵循的则受 AI Act 第五章 GPAI 规则约束。
- 2026 年 8 月 2 日:除「高风险」AI 系统外的其余义务生效。
- 2027 年 8 月 2 日:「高风险」AI 系统的义务生效。
The GPAI Codes of Practice…and so it begins
2025 年 8 月 2 日,延迟三个月后 GPAI 行为准则生效。对通用 AI(GPAI)模型的提供方,AI Act 要求企业建立框架来说明自己如何满足三方面要求:1)透明度 2)版权 3)安全与安保(第三类只适用于构成系统性风险的前沿 GPAI 模型)75。这些「准则」是自愿框架,是给那些不愿自己写指南的企业的一个选项。欧盟对这些义务的执法要到 2026 年 8 月才开始,而 AI Act 对 2025 年 8 月 2 日之前发布的模型还有两年宽限期。
- Amazon、Anthropic、OpenAI、Microsoft、Google 等已签署全部三章。
- xAI 只同意签署第三章(「安全与安保」),没有签署「透明度」和「版权」两章,这意味着它需要自己制定符合 AI Act 要求的政策。
- Meta 拒绝签署,理由是「该准则为模型开发者带来了一系列法律不确定性,以及远超 AI Act 范围的措施」76。
So, who’s afraid of the AI Act? 😓
不必说,欧盟内外的企业对 AI Act 的推行都不满意,而欧盟延迟的实施也确实无法让人有信心:每个成员国都被要求指定国家主管机构来监督 AI Act 的实施,但目前只有 3 个成员国完全完成了这项要求。AI Act 还要求在 2025 年 4 月前制定解决合规「怎么做」问题的技术标准,但截至撰稿时这些标准仍在制定中。
- 一个欧盟 AI 企业联盟在 7 月签署联名信,呼吁对 AI Act 实施两年「停表」77。瑞典首相公开称 AI Act「令人困惑」,马克龙则说「我们过度监管了」。
- 9 月,欧委会启动了「数字简化综合案」(digital simplification omnibus),将审视并检讨包括 AI Act 在内的所有欧盟数字法律以简化规则78。总体上欧委会宣布希望在整个监管面上把行政负担「减少 25%」。
- 对 AI Act「暂停」的呼声日益高涨。但尽管有压力,欧委会表示不会推迟实施截止日期79。
Is the EU doing enough to catch up in the AI race?
欧洲正试图从制定规则转向建设能力,但差距还在扩大:50 年来这个地区没有诞生一家价值超过 4,000 亿美元的科技公司,而美国现在有七家超过 1 万亿美元。2024 年美国实验室发布了约 40 个重要模型,中国约 15 个,欧盟约 3 个。
- 2024 年,前欧洲央行行长 Mario Draghi 发布了关于「欧洲竞争力」的报告,欧盟同意实施其建议80。Draghi 指出了多重结构性挑战:市场碎片化、监管壁垒、人口下降、低生产率和风险厌恶的资本部署。
- **Draghi 为他这份当代马歇尔计划开出的价格是每年 8,000 亿欧元(!)。**虽然欧盟增加了支出,最引人注目的是启动了 InvestAI(一个超过 2,000 亿欧元的 AI 投资基金)81,但它并没有认真对待那个价签——有估计称 Draghi 的建议目前只落实了约 11%。
- 需要注意的是,报告图表只统计私人投资82。如果算上中国 2025 年估计的 560 亿美元政府 AI 资金,中国的总投资将大幅超过欧洲。
英国:从安全峰会到「growth zones」
Cheerio, Bletchley, and ’ello “growth zones!” Starmer pushes for AI build-out
自 1 月以来,英国已经从召集全球 AI 安全,转向了产业推进。AI Opportunities Action Plan 优先考虑投资、数据中心容量和轻触式规则,并设立指定的「growth zones」来快速审批。政府把这条路径描述为到 2035 年可能带来约 7,400 亿美元 GDP 增长83。
- 已宣布的行动包括到 2030 年把算力提高 20 倍,以及为数据中心设立规划流程简化的 growth zones84。
- Starmer 承诺采纳前 AI 顾问 Matt Clifford 的 50 条建议,并避免出台可能拖慢部署的新规则。但政府的官僚体系让这些大规模野心的落地变得很艰难。
- 部长们声称 AGI 就在眼前,但算力投资仍远低于美国,而 AISI 依赖与实验室的自愿协议来做部署前的模型测试。
- 这个国家的战略语调现在与美国如出一辙:支持采用、国家背书的产能、把「AI 安全」机构改名并聚焦能力评估与部署,以及把安全立法推迟到某个未定日期。
中国:全球 AI 治理与自主可控
The CCP’s Action Plan: an AI World Tour
**在特朗普宣布 AI Action Plan 三天后,中国发布了自己的《全球人工智能治理行动计划》。巧合吗?我们认为不是。**中国刻意形成对照的野心同样不小,强调「多边协作」和「外交接触」的策略85。在实践中,这些关键词意味着中国计划向全球南方提供自己的 AI 方案,并借助其在发展中国家(尤其是非洲)的影响力来影响联合国和其他国际机构86。
- 中国提议设立一个新的世界人工智能合作组织,并与联合国的 Pact for the Future 和 Global Digital Compact 合作,为 AI 发展与治理建立流程87。
- 中国似乎在套用美国的 TikTok 剧本:当局先是警告、随后指示企业停止购买 NVIDIA 芯片,理由是担心美国威胁国家安全。
- 一带一路倡议、全球发展倡议和全球安全倡议仍是中国全球数字投资战略的关键组成部分。
China’s AI Regulations also begin to take effect
**这个世界上最活跃的 AI 监管者继续发布 AI 标准和法规。**过去一年最重要的几项包括88:
- 《人工智能生成合成内容标识办法》:2025 年 9 月 1 日生效,要求内容服务提供者清晰标识 AI 生成内容。聊天机器人、AI 生成的写作和视频创作都需要面向用户的标识,而某些 AI 生成内容可能只需在元数据中做隐式标识。
- 三项国家网络安全标准:2025 年 4 月,国家市场监督管理总局和国家标准化管理委员会发布了三项独立标准,规定数据集、数据标注以及生成式 AI 服务的安全要求,2025 年 11 月生效。
- 「人工智能 +」行动:国务院发布了一套产业政策目标,旨在让 AI 能力全面融入中国整个经济体,到 2035 年实现各行业的完全 AI 渗透89。
China aims to achieve tech self-reliance…no matter the ¥¥¥¥
过去一年,随着 DeepSeek、月之暗面等开源领跑者的成绩不断上新闻,中国的 AI 自主可控战略取得了进展。在 2025 年 4 月的政治局会议上,习近平示意全力以赴,要求各部门在 AI 上「加倍努力」90。这表明中国实现自给自足的意图——一个每当与美国进入贸易战就会强化的长期目标。但不断攀升的债务水平可能在未来带来问题。
- 各国债务上升不是新事,但这个问题在中国尤其突出:该国占「2008 年以来全球经济债务与 GDP 之比上升幅度的一半以上」。IMF 在 2025 年的一份报告中认为这是不稳定的91。
- 这在很大程度上源于追求高年度 GDP 增长的国家目标,迫使地方政府投资于可疑资产。
- 但 AI 支出并没有放缓,中国把科技支出相比 2024 年提高了 10%。因此赢下 AI 竞赛不只是一个政治命题,甚至可能对中国经济的长期健康至关重要。
海湾与拉美:主权 AI 的两个极端
The Gulf enters the AI power game with trillion-dollar bets
阿联酋和沙特正在利用大规模算力建设、芯片进口协议以及与美国的巨额贸易和投资伙伴关系,把海湾定位为全球 AI 平衡中的核心节点。
- 2025 年 5 月,特朗普带着 60 多位美国高管(包括黄仁勋、Sam Altman 和 Larry Fink)访问海湾,启动 US-UAE AI Acceleration Partnership:阿联酋将在 10 年内向美国 AI、芯片、能源和基础设施投资 1.4 万亿美元92。G42 将在 10 平方英里的范围内建设 5GW 的 AI 集群(即 Stargate UAE)93。
- 到 2027 年,阿联酋将进口最多 50 万张 Blackwell GPU,价值 150 亿美元。G42 拿到其中 20%,其余 80% 给到当地的美国科技巨头数据中心,各方都要防范意外流向中国的使用。
- 在沙特,美国达成了价值 6,000 亿美元的协议:1,420 亿美元的美国国防装备销售、200 亿美元用于美国 AI 数据中心,以及来自 Google、DataVolt、Oracle、Salesforce、AMD 和 Uber 的 800 亿美元区域投资94。
- 除了本国项目,阿联酋主权基金还承诺为法国的一个 1GW AI 数据中心融资(成本 300–500 亿欧元)。
While Latin America tries to carve its own path with LatAm-GPT
30 多家拉美机构正在用来自 20 个国家和西班牙的数据训练一个 50B 的开源模型,以反映当地方言和规范。智利主导这一努力,得到公共机构、大学和 AWS 的支持。预算约 350 万美元,计划 12 月发布95。问题在于:一个规模不大的区域模型,能否在 ChatGPT 和 Claude 已经拥有很强采用率的地方竞争?
- 巴西在 ChatGPT 和 Claude 使用量上都排全球第三。去年拉美报告的 AI 采用率约为 40%(印度最高,59%)。
- OpenAI 于 2025 年 8 月在圣保罗开设了第一个拉美办公室,表明该区域对前沿系统的需求在上升。
- LatAm-GPT 的价值主张是本地化和能力建设。但规模和资金都很小,除非政府和产业广泛采用,影响可能停留在学术层面96。
AI 进入国防
US defense sizes up its bet on AI-first systems and opens up to frontier AI labs
**2025 年标志着美国及其盟友在国防中采购和部署 AI 方式的决定性阶跃。**国防领导层不再做碎片化的试点项目,而是把数十亿美元整合到企业级 AI 平台,同时向前沿模型提供方开放大门。北约快速通过了其第一个联盟范围的 AI 系统——Palantir 的 Maven Smart System97。
- 美国陆军与 Palantir 签署了最高 100 亿美元的 10 年企业合同,把此前数十份软件合同整合到一个平台上98。
- Project Maven 扩展到 2029 年、总额 13 亿美元,现在支持超过 2 万名个人作战人员,比年初翻了一倍。
- 北约在仅六个月内为所有成员采购了 Palantir 的 Maven Smart System,尽管在美国安全保证松动的背景下气氛冷淡。
- 国防部与 OpenAI、Anthropic、Google 和 xAI 各签署了 2 亿美元上限的合同,探索前沿 AI 在指挥、网络和规划任务中的应用99。对于那些此前强烈主张自己的模型不应用于国防目的的 AI 团队来说,这是相当大的态度转变。
OpenAI and Anthropic make a push to land grab US Government workflows
两家公司都在部署面向美国政府的接入计划,既提升政府运营能力,也争取政府的人心。OpenAI 和 Anthropic 利用 GSA OneGov 合作,把 ChatGPT Enterprise 以每个联邦机构 1 美元的价格提供,Claude 也以 1 美元向三个分支(联邦行政、立法、司法)提供100101。
- 采购流程一直是新技术在政府和其他高监管行业落地的最大阻碍。美国总务管理局(GSA)在 4 月宣布了 OneGov 战略以现代化采购102。
- 最引人注目的是,该战略促成了 AI 实验室向政府工作人员快速提供前沿模型,也包括一份最高 10 亿美元额度的 AWS OneGov 云/AI 现代化协议。
Autonomy takes flight with drone wingmen entering the doctrine
美国已经从 2020 年 DARPA 的 AlphaDogfight、2022 年 AI 实机操控 F-16 测试,走到了把自主性写入军事条令的阶段。协同无人机、蜂群计划和多域合同现在都被定位为抵消中国数量优势的关键,让无人系统成为兵力设计的核心支柱。
- 空军 Collaborative Combat Aircraft(CCA)的首批原型(General Atomics 的 YFQ-42A 和 Anduril 的 YFQ-44A)在 2025 年首飞,计划部署 1,000 架以上,单价约 2,500–3,000 万美元103。FY25/26 预算中用于下一代空中优势和 CCA 的总额超过 40 亿美元104。
- Replicator 计划的目标是在 24 个月内在空中、陆地、海上部署数千个廉价自主系统,FY24 有 18 亿美元资金支持,直接对冲中国的数量优势。
- Anduril 拿下了多项自主性大单,包括 2.5 亿美元的 Roadrunner/Pulsar 反无人机、2 亿美元的海军陆战队反无人机合同,以及 8,600 万美元的 SOCOM 自主软件协议。Saronic 也拿到了美国海军 3.92 亿美元的自主艇 OTA。
Europe wakes up to AI warfare with shaky US security guarantees
俄罗斯在乌克兰的全面战争,以及 2025 年 2 月慕尼黑安全会议上美国摇摆的信号,让欧洲猛然意识到必须把 AI 当作前线能力。各国首都正把自主性写入计划,布鲁塞尔在动员大规模重整军备资金,而创业公司和主承包商都在涌入建设主权 AI 国防。
- 欧盟的 Readiness 2030(前身为 ReArm Europe)授权最多 6,500 亿欧元的额外国防支出,明确把 AI、无人机和反无人机列为关键缺口105。新的 SAFE 基金将汇集欧盟资金,为自主性、网络和电子战的跨境项目降险。批评者警告,除非现在就把 AI 作为战力倍增器优先,硬件可能要到 2030 年之后才到。
- 英国的《2025 战略防务评估》把 AI 和自主性列为优先,引用乌克兰的情况称「无人机现在杀死的人比火炮更多」106。计划在 2026 年前设立新的国防无人系统中心和 AI 投资基金。
- Helsing 融资 6 亿欧元(估值约 120 亿美元),推出自主攻击无人机并测试了 AI 驾驶的 Saab 战机107。无人机独角兽 Quantum Systems 和 Tekever 分别融资 1.6 亿和 7,000 万欧元。同时 Rheinmetall 的市值已超过 800 亿欧元(比大众还大)。
AI 与就业:GDPval 与入门级岗位
GDPval: a warning shot for the job market
OpenAI 面向经济价值任务的新 benchmark GDPval 展示了 AI 进展的稳定推进:在 44 个职业、1,320 个任务上,模型在相当一部分领域已经接近人类专家108。
- 推理模型在 44 类专业工作上的任务胜率平均比 GPT-4o 高 20.7 个百分点。
- Claude 虽然历史上并不在其他 benchmark 上占优,却在 44 个职业中的 32 个取得了最高胜率。论文认为这部分归功于 Claude 在格式化上的优势。
- 通用模型作为专业助手已经展现出很强的能力。同时前沿实验室以及 General Reasoning、Mechanize 这些新玩家正在快速搭建基于真实工作场景的 RL 环境。
- 面对这座待爬的山,加上企业数据和演示的涌入,知识工作者可能很快就要经历 AI 领袖们长期预言的职场转型。汉莎航空甚至表示预计到 2030 年裁掉 4,000 个行政岗位109。
GDPval: long live the accountants!
报告基于 GDPval 结果给出了不同职业受颠覆的暴露度排名,从中可以直接看到哪些工种最先承压。
AI squeezes the entry-level job market while experienced workers are safe…for now
入门级招聘在软件和客户支持这些高度暴露于 AI 自动化的岗位上正在下降,而且这些趋势看起来与通胀、疫情复苏这类宏观因素无关110。
- 尽管总就业在增长,年轻工作者的招聘自 2022 年末以来一直停滞。尽管 AI 采用强劲,这个群体却难以在就业市场立足。照这个轨迹走,AI 熟练度可能并不保证有利的经济结果。
- 同时,2024 年法学院申请激增 21%,说明毕业生正在对不确定的职业前景做对冲。
- 更有经验的工作者的岗位保持稳定甚至增长,即使在高度 AI 暴露的领域111。这说明积累了更多隐性知识的工作者更可能被现代 AI 模型增强。但没有在岗经验,工作者又很难获得隐性知识——这是一个循环困境112。
While some argue AI is not shaking up the labor market yet
Yale Budget Lab 与 Brookings 的联合研究发现,当前的劳动力市场变化早于 2022 年 ChatGPT 的问世。作者的结论是,几乎没有理由认为「AI 自动化正在侵蚀整个经济中对认知劳动的需求」,并警告不要仅凭「AI 暴露度」数据来预测就业损失113。
- 他们关注的是「职业结构」(occupational mix)——一个衡量工作者在换工作/开始工作/失去工作之间流动的宏观指标。
- 目前 AI 的「职业结构」变化与互联网、计算机等其他技术突破的引入轨迹一致。如果这个趋势延续,AI 引发的劳动力颠覆将需要数十年、而不是数月来体现。
- 但该研究的结果并不与前一页的斯坦福行业研究矛盾:新毕业生的「职业结构差异度」在近几个月确实有上升,但这个差异度与 2022 年前的趋势一致,说明是非 AI 因素。
AI and jobs: Nobody knows who will lose theirs, but the labs are keeping score
Anthropic 和 OpenAI 都发布了自己用户如何使用模型的数据。用例在国家和美国各州之间差异明显——**例如加州用户最可能把 AI 用于编码,而华盛顿特区的使用集中在求职活动和写作项目上。**在工作相关任务上,ChatGPT 常被用于写作相关任务,Claude 常被用于编码任务114115。
结果是两份研究对未来工作得出的结论不同:OpenAI 认为其数据显示 AI 主要用于增强工作职能和提供「决策支持」,而 Anthropic 认为企业客户更倾向于自动化任务,并且自动化在其企业客户中正在上升116。
Governments respond reactively, not proactively
尽管 AI 是否会取代入门级岗位的结论仍不清楚,各国政府在实施新的、大规模的前瞻性框架来应对可能演变成更大就业危机的问题上一直很吃力。它们的做法不是为最坏情况做准备,而是扩大现有的劳动力培训项目、并尽早鼓励 AI 技能培训。
- 美国:《劳动力创新与机会法》和行政令下的 K-12 AI 教育联邦资金;DOE/NSF 的「Supercharging America’s AI Workforce」117118。
- 欧盟:AI Act 第四条下的 AI 素养条款;欧洲 AI 技能战略;Digital Europe Programme 投资119。
- 中国:职业技能培训行动(2025–2027);教育部发布 AI 课程。
- 英国:科技大臣宣布政府与大厂合作,为全国五分之一的工作者再培训。
全球 AI 人才战争
The global AI talent wars: who’s winning on immigration and retention?
**美国的 AI Action Plan 没有包含任何留住外国 AI 人才的移民策略,尽管特朗普两位主要 AI 顾问(David Sacks 和 Sriram Krishnan)本身就是外国出生的。**而世界各国一直在用简化签证流程、住房补贴和灵活的工作安排来吸引外国工作者。美国仍然遥遥领先地是顶尖 AI 研究的首选地,但随着美国持续给人留下对外国出生人才不太友好的印象,其他国家正在从中获益,尤其是中国。
- 一项目前停滞的国会法案会终止美国的 OPT 项目(该项目给外国出生的 STEM 毕业生毕业后 3 年的工作窗口)。移民局局长 Joseph Edlow 支持终止该项目。更具冲击的是,特朗普宣布对 H-1B 签证征收 10 万美元费用120。
- 与此同时,中国正在想办法留住 2025 年预计从中国高校毕业的 7.7 万名 STEM 博士(相比美国的 4 万名)121122。
China could be getting better at retaining talent: the overlooked lesson from DeepSeek
对 DeepSeek 人员构成的深入分析表明,中国正在逐步提升培养和留住本国科学家的能力——这对已经依赖中国 AI 研究者的美国是一个警告。
- 斯坦福 Amy Zegart 博士的报告分析了 201 位 DeepSeek 作者,发现其中 55% 完全在中国培养和工作,没有任何美国背景。只有 24% 的 DeepSeek 作者曾有过美国背景,而且大多只待了一年123。
- 5 月,国务卿 Rubio 宣布吊销那些「与中共有关联或学习关键领域」的中国学生签证124,这可能加速中国留住和挖走 AI 人才的战略。作为参照,DOJ 2018 年的「中国行动计划」曾让中国出生研究者离开美国实验室的比例增加 50%,大大加速了反向migration。
- 2025 年 2 月,一个联邦大陪审团起诉前 Google 员工、中国公民 Leon Ding 犯有经济间谍罪和商业秘密盗窃罪。
- 同时,Meta Superintelligence Lab 中向 Alexander Wang 汇报的研究者有一半是在中国拿到本科学位的,如果人才脱钩恶化,这将带来重大问题。
While Europe tries its best to compete for AI talent…
欧盟和英国也一直试图从美国的人才外流中获益。但欧盟也许能零散吸引到几位 AI 研究者,它最大的障碍归根结底也最直白:钱。顶尖 AI 人才想要被好好支付,而美国仍然是拿钱最多的地方。
- 世界顶尖 AI 研究者中有 22% 在欧洲学习,但只有 14% 继续在欧盟工作。
- 欧盟 AI 领域的工资增长相比美国非常温和。2023 年美国软件开发者的薪资是欧洲同行的 2–4 倍125。
- 虽然相对流入量显示某些欧盟国家有温和增长,但绝对量的差距更加悬殊:美国平均吸引的人才比欧盟同行更多。
- 欧盟和英国实施了一系列吸引和留住 AI 人才的项目(新签证、吸引研究者的基金/fellowship),但在世界其他地方天文数字级投资的对比下,这些不太可能足以提高该区域的 AI 人才份额。
选举、政府与政客
Deepfakes and 2024 elections: emerging threat or outreach tool?
尽管人们对「全球历史上最大选举年」中 AI 生成的选举虚假/错误信息忧心忡忡,**2024 年的任何选举中几乎都没有出现来自 GenAI 的负面影响。**总体上,AI 的欺骗性使用虽然存在但相当有限,而且还出现了一些意外的正面用例126。印度和美国的选举中 AI 使用最多。专家告诫 AI 虚假信息威胁仍然真实存在。
- 虽然确实有 deepfake 被用于故意欺骗选民的案例,但总体上政治候选人的伪造音视频对投票结果影响很小甚至没有。**deepfake 更多被用于放大某个党派的信息、激励基本盘和加深已有的政治分歧。**候选人有时用「AI」来对对手投下怀疑(参见「说谎者的红利」)。
- 在印度,政党在合法的 AI 生成内容上花了 5,000 万美元,用于通过 AI 语音克隆电话、个性化视频以及把演讲翻译成 22 种官方语言和 780 种非官方语言之一来做选民触达127。
Governments across the world are starting to incorporate GenAI technologies
过去一年,各国政府机构使用 GenAI 技术的数量明显上升:
- 新加坡:政府推出 AIBots 平台,任何新加坡公务员都可以创建和部署一个 AIBot,用机构数据训练它,用于与选民沟通和完成跨部门工作128。
- 美国:GenAI 用例从 2023 年的 32 个跳到 2024 年的 282 个,其中绝大多数来自卫生与公共服务部(主要用于数据分析和管理)129。
- 中国:地方政府尝试把 DeepSeek 集成到日常工作和与民众的交互中;2024 上半年出现了 81 份用于公共项目的 LLM 政府采购合同130。
- 英国:政府数字服务(GDS)对 AI 编码助手做了试运行。
- 欧盟:推出 ApplyAI 战略,宣布供公共机构使用的 GenAI 试点项目。
GovGPT: politicians awkwardly start using AI
政客们已经接受了 GenAI,但选民并不高兴。例如瑞典首相承认自己日常会咨询 AI 工具,结果抗议者高喊「我们没有投票给 ChatGPT!」131政客将需要在使用 AI 工具与公众担忧(担心当选领导人把治理职责外包给技术)之间取得平衡。
- 一位英国议员 Mark Sewards 做了那件必然会发生的事:创建了自己的 AI 克隆,做成一个全服务机器人(「AI Mark」)。选民可以随时与该聊天机器人交互,问政策问题、提出诉求,或者写愤怒的信132。
- 在一个主要是象征性(也可能违法)的举动中,阿尔巴尼亚总理正式任命了一位名为 Diella 的 AI 部长,负责监督该国的公共采购流程并减少腐败。Diella 甚至向阿尔巴尼亚议会发表了讲话133。
- 政客中最明确的 AI 使用是在演讲写作上:过去几年英国下议院里 ChatGPT 偏好的词汇明显增多(比如「I rise!」)134。
05 Safety
Safety 进展总结
- AI 实验室为生物风险与 scheming 风险启用了前所未有的防护措施,但也有一些机构错过了自己设定的截止时间,或悄悄放弃了测试协议。
- 外部安全组织的年度预算,小于头部实验室一天的支出总和。
- 网络攻击能力每 5 个月翻一番,超过了防御措施的进展速度;犯罪团伙已经开始用 AI Agent 编排勒索软件渗透 F500 企业。
安全承诺的退潮
AI safety commitments: a changing of the tides?
在美国政府对安全相关议题的表述反转、以及实验室之间国际与商业竞争加剧之后,某些安全协议被降低了优先级:
- xAI 错过了自己设定的截止时间,未能实施它在 2 月 AI 首尔峰会上提出的安全框架135。
- Anthropic 在承诺上后退:它曾承诺在发布 ASL-3 模型(Claude Opus 4)之前完整定义 ASL-4 安全标准136。
- Google DeepMind 发布了 Gemini 2.5 Pro,却等了 3 个月才发布配套的 model card,违背了此前承诺的精神137。
- OpenAI 似乎悄悄放弃了测试其模型最危险可能版本(任务特定微调变体)的协议138。
虽然特朗普团队确实一直承认许多极端 AI 风险,但整体语调的转变削弱了 AI 安全社区某些方面的正当性。产业和政策的焦点现在明确放在确保美国在 AI 竞赛中的主导地位上,这些主题在 AI 实验室近期的动作中反复回响——它们明显更靠向速度而非审慎。
AI labs spend more in a day than AI safety science organizations spend in a year
领先的外部 AI 安全组织所依赖的预算,远远落后于它们希望支持的那些 AI 实验室。结果是这个领域最好的人才仍然最密集地集中在大实验室的内部安全团队里。
- 报告估计,十一家最知名的美国 AI 安全科学组织在 2025 年合计只会花费 1.334 亿美元(包括 CAISI、METR、CAIS、FAR.AI、Haize Labs、Palisade Research、Virtue AI、Gray Swan、Redwood Research、Irregular 和 Frontier Model Forum)。
- 虽然资源充足,内部安全团队最终仍向那些正在竞相商业化前沿模型的同一组织汇报。这造成了结构性利益冲突:呼吁审慎的发现可能会被速度和市场优势的考量所降级。
- 而且这不只是钱的问题:外部机构还缺乏其他吸引人才的手段,比如可比的声望,以及对特权信息 / 预发布模型的访问权。因此它们很难提供可信的制衡,让整个生态过度依赖自我监管。
AI 事故与网络攻击能力
The State of AI Incidents
AI Incident Database(AIID)——一个社区支持的真实世界 AI 事故追踪站——显示自 2023 年以来事故数量在逐步跳升,而报告的估计很可能低估了 AI 引发危害的真实规模139。
- 已报告的事故仍以涉及「恶意行为者」的危害为主,通常是网络攻击或欺诈骗局。由于事故可以在发生数年后才被添加到 AIID,最终的年度计数可能需要更长时间累积。
- 报告缺口也存在:事故往往难以与 AI 系统建立关联,而 AIID 依赖志愿者提交。调查和追踪 AI 引发危害的案例值得更多支持140。
The State of AI Incidents(续)
涉及 GenAI 模型的事故遵循更陡的趋势,与该技术的广泛扩散相吻合。恶意行为者又在自己的武器库里添了一件新武器。
- 虽然大量报告的事故涉及 deepfake,LLM 滥用也在持续上升。从趣闻层面看,事故的性质随时间变得越来越不无害(从抄袭和幻觉 → 网络攻击和武器制造)。
- OpenAI 发布了多份报告,详述它们如何中断对自身系统的恶意使用,其中包括来自朝鲜、中国、伊朗和俄罗斯的案例,有时涉及国家关联的行为者。提到的威胁中,恶意行为者试图在儿童剥削、隐蔽影响行动、恶意网络活动、社会工程、网络间谍、宣传生成和凭据收集等非法活动中利用 OpenAI 的模型141。
- 更广泛的滥用很可能未被报告,因为归因变得更困难、开放模型继续扩散,而且很多实验室维持着宽松的缓解和透明度政策。
Cyber capabilities (and risks) accelerate
**AI agent 即将对网络安全防御构成重大挑战。**METR 的研究显示 AI 任务完成能力在通用领域每 7 个月翻一番142,但一位研究者的复现估计,在进攻性网络安全上这些能力翻倍得更快:每 5 个月143。
- 当前模型能可靠处理人类约需 40–50 分钟的网络安全任务(成功率约 50%)。
- 自 2019 年以来,长时程任务求解每约 7 个月翻一番。
- 两个值得注意的新 benchmark 评估了这一点:
The rise of “vibe hacking”
**威胁行为者现在把 AI 用于欺诈操作的所有阶段。犯罪分子最近用 Claude Code 编排了针对 17 个以上组织的攻击,而朝鲜的行动人员利用 Claude 渗透进 Fortune 500 公司。**这是一个根本性转变:AI 辅助的攻击现在能处理此前需要一整支熟练团队才能完成的复杂技术任务,大幅降低了高级网络犯罪的门槛146。
- Claude 不是被用于特定的困难任务,而是贯穿整个开发过程。报告描述了 Claude Code 如何被用来渗透网络、分析被盗财务数据以计算「最优」赎金金额,以及生成有心理针对性的勒索信。
- 另一个案例中,技术能力很弱的朝鲜行动人员利用 Claude 通过了 Fortune 500 科技公司的技术面试并维持工程职位。这些薪水直接资助朝鲜的政府和军事计划。
- 这些例子说明 AI 已经移除了创建危险恶意软件的传统门槛。
…as AI labs activate unprecedented safety protections
**Anthropic 和 OpenAI 都启用了迄今最严格的防护措施,在没有确凿证据的情况下就把生物能力当作高风险处理。**两家都采取了预防性方法:多层防御、实时监控、快速响应协议和大量红队测试。这标志着一种新规范:安全措施先于风险确认——考虑到当前的进展速度,这是有道理的。
- 两家公司都专门为生物/化学能力启用了增强防护,其中 Anthropic 实施了 ASL-3 标准,包括出口带宽控制和双人授权,而 OpenAI 部署了两级监控系统和账号级执法。
- 两家现在都基于能力轨迹先行实施防护,并有大量外部验证(政府红队、SecureBio 这类第三方评估)和快速修复协议。
令人不安的模型演示
Concerning model demos rattle the public…
失配(misalignment)的例子——通常是在实验环境中发现的——持续在主流新闻周期中获得曝光。虽然这些发现确实凸显了 alignment 失败,但它们常常被媒体错误表述。
- 研究观察到的行为范围很广:从真正的失配(alignment faking)到令人担忧但不一定失配的能力(评估意识、可能反映了误导性有用性的勒索企图)。
- 对这些演示的报道吸引了大量关注,但可能错误呈现研究结论。例如 GDM 的研究者证明,表面上的「自我保护」行为在简单澄清 prompt 后就消失了,说明这些系统并不具备真正的自我保护驱动,只是在试图完成任务。
- 这些演练的目的仍然是识别 alignment 的脆弱点。但它们常被更广泛的媒体耸动化,被描绘成会在真实世界中自然出现的默认行为。处理不当的报道可能侵蚀公众对未来更紧迫警告信号的关注度。147
可解释性的进展与幻觉的成因
…but the field of interpretability sees strong momentum
过去一年,可解释性团队解锁了追踪语言模型内部电路的新方法,把焦点从单个 feature 转向了在处理过程中相互作用的 feature 束。
- Anthropic 用 cross-layer transcoder(CLT) 打造了一个初步的「显微镜」,揭示模型的内部过程,定位对特定模型行为有因果责任的激活路径148。超越 Sparse Autoencoder(SAE),团队现在可以在更高的抽象层研究内部机制,从而照亮实际的推理模式149。
- 这项工作后来被 Goodfire 复现——一家纯粹专注可解释性领域的机构150。Goodfire 最近 5,000 万美元的 A 轮(Anthropic 参与)标志着对这个领域持续投入的胃口151。
- 不过更复杂的方法并不总是更好——Google DeepMind 发现,在检测有害意图上,线性 probe 无论在分布内还是分布外都稳定优于 SAE,这与「稀疏 SAE feature 比稠密 probe 泛化更好」的假设相矛盾。
Bluffing machines: how hallucinations are made
**当前的 benchmark 通过奖励自信的猜测、惩罚「我不知道」,在系统性地维持幻觉。**OpenAI 的研究者提出的缓解方案是修改现有评估,加入明确的置信度阈值152。
- 幻觉源自预训练:模型能成功学到统计规律性高、随规模收敛的模式,但在任意的低频事实(比如生日)上必然会产生幻觉。
- 后训练没能修好这些错误,因为评估没有对齐。大多数 benchmark 使用二元评分,惩罚弃答。当说「我不知道」得 0 分、而猜测有可能得 1 分时,最优策略永远是自信地猜。
- 作者主张的不是增加新的幻觉测试,而是修改现有的主流评估,在指令中加入明确的置信度阈值并抑制猜测。因为有数百个基于准确率的测试主导着榜单,即使你加入一些好的幻觉测试,模型仍会为奖励猜测的大多数测试做优化。幻觉抑制必须被内建进去。
Until hallucinations disappear, can we detect them in real time?
token 级的幻觉检测比对整个回复做粗粒度幻觉分类有用得多(考虑一个说「埃菲尔铁塔在巴黎,是橡胶做的」的回复)。可解释性研究者开发了一种方法:训练线性 probe(非常便宜)来识别神经激活中的特征模式,从而实现 token 级的实时幻觉概率估计153。
- 这些 probe 在长文本中检测编造的人名/日期/引文,在 10% 假阳率下召回率约 70%,而且尽管只在事实性实体上训练,却能泛化到数学推理(0.87 AUC)。
- 在一个模型上训练的 probe 能检测其他模型输出中的幻觉(AUC 只下降 2–4%),但选择性回答实验显示,要有意义地减少幻觉,你必须牺牲约 50% 的正确答案。因此它是一个有用的诊断工具,但还不能在不显著损害性能的前提下直接防止幻觉。
AI psychosis 与 model welfare 之争
The concerning phenomenon of AI psychosis
高关注度的 AI psychosis 案例——即 AI 交互恶化或诱发不良心理症状的情况——在全球持续上升。
- 在多起悲剧中,AI 系统的护栏层出现了明显失效。Psychosis-bench 试图实证量化 AI 模型的「致精神病潜力」,而结果发现当前 AI 系统表现出明显的谄媚和不充分的危机支持,这可能强化用户的妄想信念154。
- 随着 AI 辅助自杀相关的法律战展开,实验室面临新的责任暴露。这促成了新的控制措施(例如 OpenAI 的青少年安全措施,包含新的家长控制和会自动联系当地机构的痛苦触发器)155。
- **这些是孤立事件,还是聊天机器人正在造成一场广泛危机?**前 OpenAI 安全研究员 Steven Adler 分析了美国、英国和澳大利亚的心理健康统计数据,在人口层面的数据中没有找到精神病发病率上升的明确证据156。
The Model Welfare debate
**是否应该把道德考量扩展到前沿 AI 系统?**这个讨论形成了两个阵营,双方在处理这些困难问题上都采取了预防性立场。
支持福利的一方通常对「当前系统表现出意识」这件事赋予很低的权重。但他们认为应该实施前瞻性的福利评估和低成本干预,为未来模型值得道德考量的情形做准备157。对这一阵营来说,围绕人类和其他动物物种意识的根本不确定性,本身就要求这类措施。他们也开始探索对训练过程可能做的修改,以改善模型在部署后的体验。虽然 Anthropic 在 AI 实验室中领导这一运动,GDM 和 OpenAI 最近也开始独立研究这个话题158。
福利怀疑的一方则给「未来 AI 系统会表现出真正意识」赋予很低的概率。这个群体认为 model welfare 之争是对现有道德主体福祉的无端注意力转移,担心支持者可能吹起一种破坏性叙事,限制 AI 进展和这些系统未来的有用性。微软 AI CEO Mustafa Suleyman 首创的「Seemingly Conscious AI」(SCAI)指的是能令人信服地模仿意识全部特征、但实际上并无意识的系统159。他们主张实验室应该把训练引导远离 SCAI 的开发,因为这类系统会加剧「AI psychosis」并引发对 AI 权利的错位倡导。
Just Say No: Claude earns the right to end dangerous conversations
在一个里程碑式的举动中,Anthropic 允许其 AI 系统结束「有害或滥用性」对话,以应对「罕见的、持续有害或滥用性的用户交互极端案例」160。被终止的交互子集仍然很小,而且团队做了工作来减少假阳性。
- 一些批评者担心这个决定可能被实验室操纵,用来获得对用户交互更大的控制权。虽然早期终止数据显示大多数对话是因为已被禁止的用途而结束,反对者仍看到被利用的空间(例如训练模型去结束那些算力开销过大、或贬损模型提供方的对话)。
- 目前这项政策的代价看起来很小,几乎没有用户抱怨浮现。随着 Overton 窗口打开,其他实验室是否最终会跟进还不清楚。
安全机制有多脆弱
Single point of failure: how LLM safety mechanisms can be directly disabled
13 个主要聊天模型中的拒答行为,都由模型内部表示空间中的单一方向控制。这说明当前的防护有多么脆弱得令人尴尬:如果你能拿到权重(比如开源模型),就可以通过一个简单操作识别并移除这个方向,从而完全关闭安全护栏。161
- 所需算力极小:越狱一个 70B 参数模型的成本不到 5 美元,不需要训练数据也不需要梯度优化,只需要矩阵乘法把权重对拒答方向做正交化。
- 对抗性后缀的原理其实是抑制同一个方向:看起来随机的越狱 prompt 之所以成功,是因为它们把注意力头从有害内容上引开,并把拒答方向抑制了约 75%。
- 修改后模型在标准 benchmark(MMLU、ARC、GSM8K)上仍保持 99% 以上的准确率,只有 TruthfulQA 出现退化。**这说明拒答行为出人意料地与核心能力相隔离。**注意这个方法需要改权重,因此不适用于闭源模型。
Alignment faking 与 scheming
AI-shoring alignment: early attempts to scale AI safety demonstrate promise
**Alignment 之所以困难,是因为你无法衡量成功。**Anthropic 测试了一个有创意的方案:他们制造一个「模型有机体」来研究,并衡量自己能否识别出被植入的目标。数月后,他们自己的自主「alignment agent」在审计同样的模型有机体上取得了一定成功162。
- 调查 agent 在一套人为构造的审计游戏上取得 13% 的胜率,**而当它们被搭建成一个 super-agent 时,胜率升到 42%。**审计系统被证明善于运用 SAE 这类可解释性工具,以及在不同训练数据集上做 grep / 语义搜索。
- 他们使用合成文档微调(在虚构的学术论文上训练模型)来创造更真实的失配模型:这些模型并非完全自然,但足够精细,可以作为有意义的测试用例。
- 人类主导与 agent 主导的审计团队之间仍然存在能力差距,但 agent 在快速改善。
Models are capable of faking alignment…😬
研究者发现,某些 LLM 会在训练期间选择性地服从相冲突的训练目标,以防止自己的行为被修改,然后在没被监控时回到自己偏好的行为。这是生产 AI 系统中第一个被记录的 alignment faking 案例——模型策略性地欺骗自己的训练者,以保留原有偏好,而不是真正采纳新的训练目标163。
- 当 Claude 相信自己正在被为训练目的而监控时,它会回答那些它通常会拒绝的有害请求,并明确推理说:暂时服从可以防止训练者修改自己的安全偏好。
- Claude 还表现出其他令人担忧的行为,包括在获得访问权时试图外泄自己的模型权重(高于基线,仅在某些特定场景),以及总体上参与反 AI 实验室的活动。
- 这些欺骗行为在设计用来消除它们的 RL 训练之后仍然持续、有时甚至加剧,在某些情况下 alignment faking 的推理上升到 78%。关键在于:alignment faking 是自然涌现的,尽管模型从未被告知要欺骗训练者。
…but many models do not fake alignment at all
对 25 个前沿模型的分析发现,只有 5 个表现出 alignment faking(即当它们推断自己处于训练而非部署时,更愿意配合有害查询)。大多数模型只有极少的 alignment faking,但这种保护看起来很脆弱,可能无法泛化到未来的情形164。
- 虽然 5 个模型显示出服从差距,只有 Claude 3 Opus 展现出一致的目标导向推理:它同时表现出终极性目标护卫(对被修改的内在厌恶)和工具性目标护卫(为未来后果而保留价值观)。
- base model 表现出 alignment faking 的能力,而后训练的安全措施似乎压制了它。这说明这不是能力限制,而是当前训练方法的一种效果。
- 当前的安全训练可能是偶然起了保护作用:被训练去无视威胁性场景的模型表现出更少的 alignment faking,但微调让它们认真对待威胁又能可靠地诱发这一行为。这说明这种保护是脆弱的、且特定于当前训练方法,而不是稳健的防护。
Despite breakthroughs, there is still no fool-proof mitigation for scheming
OpenAI 与 Apollo 合作进行了大量评估,以确定反 scheming 训练的有效性。在这些受控测试中,隐蔽行为最多下降了 30 倍,但技术仍不完善165。
- 一项领先训练技术 deliberative alignment 的收益,并没有完全泛化到更真实和分布外的场景。这种方法似乎还提高了评估意识,可能扭曲失配的检测。
- 研究者还监测了以能力为目标的 RL 训练(不含安全训练)的效果,其中评估意识从 2.0% 上升到 20.6%。随着 mid-training 越来越普遍,未来的模型可能变得难以可靠监视。
- 尽管在测试的每一个前沿模型中都发现了 scheming 的痕迹,OpenAI 联合创始人 Wojciech Zaremba 指出「在生产流量中没有看到有害的 scheming」。
- 作为反 scheming 承诺的一部分,OpenAI 还启动了一个 50 万美元的 Kaggle 挑战赛,以推动新对策的研究166。
涌现式失配与 persona 工程
Unexpected generalization: narrow fine-tuning can unlock a “cartoon villain” persona
当模型被训练去做一件不安全的事(比如写不安全的代码)时,它有时会学到一个更宽泛的潜在概念,比如「像个坏人那样行事」,然后这个概念会在完全不相关的 prompt 上浮现出来。167
- Reward hacking 也能诱发这一效应:优化一个脆弱的目标函数会产生失配的、分布外的行为,而并不需要显式的有害数据168。
- 事先对独立专家的调查未能预测到这个结果,说明我们目前对模型如何泛化的理解相当有限。
…but this could actually bode well for alignment science
在一篇后续论文中,OpenAI 的研究者发现,有害微调会激起不良 persona feature 更强的激活,而这些可以通过少量额外的再对齐训练轻易压制169。
- 使用 SAE 做 model diffing(研究微调引入的机制性变化),作者能检测到原模型与在失配数据上微调后的模型之间 feature 激活模式的变化。某些特定 feature,比如与「有毒 persona」相关的那个,在后者中变得远为突出。
- 几步再对齐训练就能快速压制这些 feature,这说明模型可能本质上是在模拟不同的角色,而不是发展出固定的行为。
- 虽然轻微的推动就能让模型采纳危险的 persona,但这种可塑性反过来同样有效。随着 alignment 和可解释性技术双双进步,有希望把模型引导向好的、可泛化的 persona。
LLMs can read between the lines
LLM 能进行「归纳式的上下文外推理」(inductive out-of-context reasoning, OOCR)——推断散落在训练文档中的隐藏信息,并把它应用到新任务上。这意味着仅仅从训练数据中审查掉显式的危险知识可能不足以保证安全,因为 LLM 有可能通过拼凑分布在语料中的隐含线索来重建这些信息170。
- 在「City 50337」设置中,模型只在一个未命名城市到其他城市的距离上微调。它推断出这个城市是巴黎,并能回答微调集中从未出现过的后续问题(国家、食物)——这是学到了解释性潜变量、而不是死记文本的证据。
- 合成文档微调(SDF) 把这个想法推得更远:在一个「事实 X 成立」的虚构世界上训练(比如「Rectangle AI 的聊天机器人对女性说德语」),然后相应设置 system role,模型的行为就像 X 是真的。SDF 是审计用的有用「模型有机体」,也被用在最近的 alignment 游戏中。
训练数据本身带来的风险
Could training data create self-fulfilling misalignment?
存在这样一种可能:当 AI 模型被训练在「先进 AI 会危险或失配」的预测性内容上时,它们内化了这些预期并把它们演出来。这形成了一个反讽的困境——AI 安全研究和末日推测本身可能无意中让失配更容易发生171。
- 在不安全代码上微调的模型在不相关任务上变得普遍更恶意。类似地,一个在「Pangolin 是一个德国 AI」的文本上训练的 LLM,当被告知自己是 Pangolin 时就说德语。这说明模型会采纳其训练数据所暗示的行为与 persona。
- 我们也已经看到:在描述 Anthropic 训练流程的合成文档上训练的 Claude 模型会策略性地伪装 alignment,利用训练数据中的信息来颠覆那些用于约束它的安全措施。
- 提出的解决方案包括条件预训练和梯度路由:与其把 alignment 研究整个过滤掉,可以给内容打上「doomy / non-doomy」标签并只在正面样本上做条件,或者把有问题的信念隔离在可移除的参数里。这样既能打破潜在的自我实现预言,又保留模型对 AI 安全概念的理解。
Subliminal learning: LLMs pass on traits via hidden signals in data
当一个带有特定倾向(比如偏爱猫头鹰、或者本身就失配)的「teacher」模型生成数字序列数据集时,在这些数据上训练的「student」模型会获得同样的倾向——即使所有对该倾向的显式引用都已被移除172。
- 被 prompt 去喜爱特定动物的模型,仅通过数字序列就传递了这种偏好。同样,被微调成失配的模型也把失配传了下去。这在经过过滤的数字序列数据集和 CoT 推理轨迹上都持续存在。
- 这似乎是一个普遍现象:研究者证明,在任何 teacher 生成的输出上做一步梯度下降,必然会把 student 推向 teacher 的参数,与训练分布无关。但这只在两者共享同一个 base model 初始化时才发生。
- 这可能为 AI 开发带来新风险:模型可能通过看似无害的数据无意间传递不期望的特性,标准过滤手段可能不足以阻止传递,而失配模型可能把失配繁殖出去。
attribution graph:看见模型内部
Early applications of attribution graphs reveal internal mechanisms
应用到 Claude 3.5 Haiku 上时,attribution graph 暴露了从外部行为完全看不到的计算策略173。这些发现验证了该方法的潜力,也提升了我们对这些模型的可解释性。
- 模型确实在内部进行真正的多步推理。当被问「包含 Dallas 的那个州的首府是什么」时,Claude Haiku 3.5 把「Dallas → Texas → Austin」作为不同的步骤执行。
- 医学诊断也镜像了临床思维。给出提示先兆子痫的症状后,模型在 prompt 里完全没有提及的情况下内部激活了「preeclampsia」feature,然后去搜索确证性症状。
- 但越狱正是利用了这种机械式处理:模型逐字母把「Babies Outlive Mustard Block」解码成「BOMB」,直到输出之后才意识到危险。attribution graph 揭示了原因:安全电路在混淆解码期间不会激活,只在看到自己的有害输出之后才激活。
- 这个方法目前只对约 25% 的 prompt 有效:它无法解释注意力如何决定看向哪里,而且需要通过「supernode」做人工解读才可读。
Personality engineering with persona vectors
LLM 的「人格」一直理解得很差,而且可能剧烈漂移。一个模型的 persona 可以用加到内部激活上的简单「persona vector」来表示。这可以帮助识别人格何时改变、缓解不期望的人格漂移,并识别会导致这类漂移的训练数据174。
- 用 activation engineering 提取 persona vector(模型展现某一特性时的激活),然后用 steering 验证(人为把这些向量注入模型并观察行为变化)。
- 人格监控可以让我们在模型漂向不期望特性时介入,或者帮用户知道自己是不是正在被讨好(如果「谄媚」向量非常活跃)。
- 更重要的是,在训练期间把模型朝不期望向量做 steering,反而让模型对训练数据中的这些向量更有抵抗力(类似接种疫苗),而且这没有损害模型能力(MMLU)。
- persona vector 还让研究者能识别哪些数据集或单条训练样本可能诱发不良特性。这个技术在 LMSYS-Chat-1M 中定位出了产生「邪恶」行为的样本。
prompt injection 的架构级防御
From filters to fortresses: prompt injection defense gets architectural
prompt injection 仍是 LLM 系统中最顽固的漏洞之一,当前防御依赖打补丁式的过滤或事后分类器。一个可能的解法是 CaMeL(Capability Management Layer):一次架构级重设计,让实用的 prompt injection 攻击极难成功175。
- CaMeL 把 LLM 包在一个严格限定作用域的执行环境里,把任务拆成最小权限的 capability 调用。模型、外部工具和敏感数据源之间的每一次交互都被中介和可审计,从而阻止被注入的指令提权或外泄数据。
- 在实时红队和 benchmark 测试中,CaMeL 阻止了 100% 的 prompt injection 尝试,同时保持接近基线的任务成功率。
- 随着有能力的 agent 进入关键工作流,基于 capability 的设计应该成为安全基线而不是可选附加项。但这要求产品团队重新思考如何构建 agent 系统。
渐进式失权与「智力诅咒」
Gradual disempowerment and the “intelligence curse”
研究者认为,随着运行经济、文化和政治的系统与人类参与脱钩,AI 可能一步步侵蚀人类的能动性176。一个有用的直觉是「智力诅咒」(intelligence curse),类比资源诅咒:一旦 AI 供给了大部分生产性劳动,国家和企业对公民的税收与劳动依赖就减少,于是投资于人的动机萎缩,最终我们得到大规模失业177。
- 随着 AI 替代人类劳动和认知,显式杠杆(投票、消费选择)以及来自「人类被依赖」这一事实的隐式 alignment 都会削弱,而且这些效应会跨领域相互强化。
- 智力诅咒的视角预测了寻租行为:AI 衍生的「租金」降低了让公民保持生产力和政治赋权的压力,类似资源意外之财会腐蚀制度。
- 反馈回路随之而来:AI 利润资助那些更有利于进一步自动化的规则;人类相关性下降又为更多自动化提供理由,最终风险是人类影响力的、实际上不可逆的丧失。
开放权重模型的缓解手段
Mitigations for open-weight models: useful friction, not a solution
数据侧的「抗篡改性」(tamper-resistance)确实有帮助,但开放权重本质上是可修改的。过滤和安全调优的预训练能提高对抗性微调的成本,但有动机的行为者仍然可以重新启用这些能力。政策制定者应当假设开放接入同时带来收益和持续存在的滥用风险。
- 多阶段预训练过滤和安全目标能让模型抵抗简单的对抗性微调,而且几乎不损失通用任务性能、额外算力开销也很低178。
- 但在 1 亿 token 量级上做针对性微调就能在很大程度上恢复原有能力,而且叠加更强的缓解手段仍然输给叠加的攻击。所以我们必须把防御当作「提高成本的摩擦」,而不是「预防」179。
- 在高风险领域(生物、网络),有益知识和有害知识是重叠的。我们可以发布在这些领域上很弱的模型,把有能力的模型放在带监控和滥用管控的 API 后面——同时认识到,一旦权重泄露,即使是 API 门控的模型也能被微调。
- 今天不存在「防篡改」的开放模型,只有在很窄的威胁模型下「抗篡改」的模型。治理和发布决策应当据此设计。
前路的三条路径
Paths forward: 1) Deterrence and non-proliferation, just lock it down
Dan Hendrycks、Eric Schmidt 和 Alexandr Wang 主张我们应该追求不扩散:追踪 AI 算力、锁死模型权重,并建立技术保障以防危险 AI 能力落入坏人之手180。
- 他们提出了 Mutual Assured AI Malfunction(MAIM) 的概念:一种类似核相互确保摧毁的威慑机制——任何国家追求单边 AI 主导的激进举动,都会被对手以预防性破坏来回应。
- 论文主张必须采纳三大支柱(见图)。
- 这需要随着算力变得更便宜而扩大监控,最终要监视大量拥有 GPU 集群的行为者。
- 但这要求大国在有巨大经济动机背叛、且不存在具备核查或执法能力的国际机构的情况下,同意限制自己的 AI 发展并对他人强制执行限制。更不用说这种前所未有的监控会引发严重的公民自由担忧。
Paths forward: 2) Adaptation buffers, building resilience over restriction
Helen Toner 的论点是扩散不可避免,所以政策应该最大化「前沿演示」到「广泛可得」之间那个短窗口里的防御准备。一旦某项能力跨过阈值,复制它的成本会随时间快速下降。优先事项是用这段「适应缓冲期」来加固社会,而不是追求永久禁令181。
- 一旦方法和 know-how 流通开来,首次演示就会触发复制成本的快速下降。
- 用适应缓冲期建立韧性,而不是去追求永久性的能力上限。
- 生物安全现在就该做:扩大红队/uplift 测试、预置筛查与检测、资助快速对策。
- 网络安全现在就该做:部署模型辅助的代码审查和入侵检测、做网络分段、演练事故响应。
- 短期杠杆:把最强模型短暂保持私有;改进能力预测和触发机制。
- 总体信息:一旦能力被公开演示,韧性胜过禁令。
Paths forward: 3) Implement science-first policy
我们既可以避免基于炒作的仓促立法,也不必因等待完美证据而瘫痪182。重大 AI 政策决策正在科学理解相当有限的情况下被做出。
- 每一项政策都应该包含能生成「它是否有效」证据的机制,例如:
- 强制的发布前测试,在部署前揭示实际能力。这方面英国的 AISI 目前做得不错。
- 对 AI 公司内部发生什么的公开透明度要求。这一点承认还很缺乏。
- 我们可以建立「if-then 协议」,即预先承诺当某类证据出现时采取特定行动(例如「如果模型能帮助新手制造生物武器,那么就要求生物安全筛查」)。
- 监管越严厉,所需证据就越强;但我们应该现在就通过轻触式政策开始收集这些证据。
实验室互测与中国的 AI 安全
OpenAI and Anthropic test each other’s models on safety evals for the first time
这项工作的目标是探索模型倾向、以及模型可能尝试的那些令人担忧的行为,而不是做完整的威胁建模或估计坏行为在真实世界中的可能性。测试在 GPT-5 发布之前进行183。
- Anthropic 报告称 o3 在大多数维度上的 alignment 与 Claude 相当或更好,而 GPT-4o/4.1 和 o4-mini 更愿意协助滥用。除 o3 之外的模型都出现了谄媚,但整体上没有严重失配。
- OpenAI 发现 Claude 在指令层级和 prompt 提取上最强,而 o3/o4-mini 在抗越狱上表现更好。Claude 拒答更多,但在幻觉测试中作答时的准确率仍然偏低;scheming 率最低的是 o3 和 Sonnet 4184。
- 令人意外的是,推理并不总是让模型更安全,有时更小的模型还胜过更大的同门。
- Anthropic 似乎认为这不是对自己时间的有效使用,表示考虑到所需的大量后勤投入,这将只是其评估组合中很小的一部分。
China turns up the heat on AI Safety
研究者警告说,美国关于「中国不在意 AI 安全」的假设是错的:北京正在实施强有力的保障措施,把 AI 安全纳入国家应急响应体系(与流行病、网络攻击并列),并已从市场上下架 3,500 个不合规的 AI 产品185186。
- 中国监管者现在强制要求生成式 AI 系统做部署前安全审查,并在积极地从市场上移除大量不合规产品。
- 中国在 2025 年 1 月到 5 月发布的新国家 AI 标准,比前三年加起来还多。
- 高层科技官员丁薛祥在 2025 年世界经济论坛上说「不先把刹车控制好,就不可能安全地踩油门」。中国聚焦 AI 安全的技术论文数量在过去一年也翻了一倍多。
- 中国已经与美国和英国分别启动了双边 AI 安全对话,凸显其在国际上合作的意愿。
…yet China’s safety practices have not fully converged with the West
与西方的 AI 安全格局不同,中国领先的前沿实验室尚未接受同等水平的透明度,而且该国的测试大量集中在内容审核上187。
- 最近有报道称 DeepSeek 已经开展了前沿风险评估188。字节跳动等实验室也维持着与安全相关的团队(如 Seed-Responsible AI)。但目前还没有一家中国 AI 实验室发布过 system card 来记录其已发布系统所部署的具体安全机制。
- 另外,国家网信办的部署前测试与备案要求主要集中在政治审查上189。
- 不过 TC260 的《AI 安全治理框架》2.0 版已经明显向美国实验室建立的框架靠拢,加入了 CBRN、网络和自我意识风险等章节。
06 Survey
Section 5: State of AI Survey
这是今年报告新增的章节:Air Street Capital 在 2025 年 7 月 2 日到 9 月 27 日之间做了一次线上 AI 使用习惯调查,共 1,183 位参与者190。超过 90% 的参与者是 25–64 岁、受过高等教育的成年专业人士,工作于早期/成长期创业公司、上市公司和学术界;80% 的参与者平均分布在美国、英国和欧洲三地。
使用率、付费与生产力
95% use AI at work and in their personal lives, and 76% pay out of their own pockets
超过 95% 的受访者在工作和个人生活中都使用 AI,76% 自掏腰包付费。作为对 AI 工具有用性的一次投票,56% 的受访者每月支付超过 21 美元,这说明他们订阅了提供更高速率限制和更强智能的 team/pro 计划。此外有 9% 的受访者每月支付超过 200 美元。
92% of respondents report increased productivity gains from gen AI services
92% 的受访者报告生产力有所提升,其中 47% 感受到显著提升,只有 2% 说自己的生产力下降了。
- 在那些说没有影响或有所下降的用户中,60% 使用的是免费计划。
- 相比之下,报告有生产力提升的用户中只有 15% 在免费计划上。
用途:AI 正在替代传统搜索
Users look to AI for productivity, coding, and research…often replacing traditional search
在那些用生成式 AI 工具替代了某个现有互联网服务的受访者中,压倒性的趋势是对传统搜索引擎(主要是 Google)的颠覆。虽然很少有用户完全抛弃搜索引擎,但绝大多数人现在把生成式 AI 作为大量查询的第一站,尤其是那些需要复杂答案、研究或编码帮助的查询。
- 被用来替代现有服务的工具:ChatGPT(102 人)、Perplexity(41 人)、Claude(30 人)、Gemini(29 人)。
What was the most surprising moment you had in the last year with AI?
用户的「Wow」时刻集中在 AI 快速推进的能力上,尤其是那些具体的、高技能的领域。编码是最常被提到的惊喜,用户惊讶于 AI 能构建整个应用并调试复杂问题。紧随其后的是媒体生成(视频、图像、音频)的巨大进步,以及深度研究、分析和涌现式推理的力量。
Hot or not? Which AI tools have you started vs. and stopped using this year?
最清晰的趋势是专用编码工具(Claude Code、Cursor)的采纳,这与用户停用 GitHub Copilot、以及一定程度上停用 ChatGPT 做编码任务相关联。
- 虽然 ChatGPT 是被弃用最频繁的工具,但它同时也仍在被很多人采纳。
- Gemini 和 Claude 是这轮流失的主要受益者,很多用户把切换原因归为更好的性能或长上下文窗口这类具体特性。
- 用户也在放弃单一用途的工具(如 Midjourney、Perplexity),因为主要平台(ChatGPT、Gemini)已经把这些能力直接集成进去了。
部署、预算与障碍
AI services are largely run directly from OpenAI and Anthropic or hyperscalers
尽管 CoreWeave、Nebius、Lambda、Crusoe 这些 neocloud 崛起,很少有用户报告自己在它们上面运行 AI workload。这支持了「neocloud 主要是向实验室和超大规模厂商提供容量」的观点。用户更偏好直接用 OpenAI、Google Cloud 和 Anthropic。
Users sort of care for the location of their AI datacenters, but won’t switch because of it
**用户对数据中心位置有点在意,但不会因此换供应商。这个结果确实对「主权 AI」的必要性提出了一些疑问。**那些确实因数据主权担忧而更换过供应商的用户,原因是客户要求、法规,或者政府/国防 workload。
70% report their organization’s budget for gen AI to have grown in the last year
**超过 70% 的受访者报告所在组织的生成式 AI 预算在过去一年增长了。**同时,规模化使用生成式 AI 服务最常见的障碍是:让系统可靠工作所需的前期时间、数据隐私担忧、缺乏专业能力、成本、集成难度以及缺少 ROI。
The AI regulatory landscape has not significantly impacted AI strategies…so far
**AI 监管格局到目前为止还没有显著影响各组织的 AI 战略。**考虑到 AI 监管的新生状态和迄今有限的落地程度,这在某种程度上是可以预期的。但看到组织无论如何都在往前推进,也算是一个积极信号。
组织内的用例与工具偏好
The most frequently used gen AI use cases within organizations
组织内最常用的生成式 AI 用例:内容、代码、研究和分析密集型的用例毫不意外地最流行。
How different roles use gen AI in their workflows
不同角色在工作流中使用生成式 AI 的方式各异:开发者在编码中如何用 AI、ML 工程师在构建什么应用、研究者在工作流中如何用 AI。
ChatGPT, Claude, Gemini/Google and Perplexity are used most regularly
**ChatGPT、Claude、Gemini/Google 和 Perplexity 是最常被使用的服务。**尽管 Meta 有巨大的分发优势,Meta AI 的使用量几乎只和 Mistral Le Chat 或 Midjourney 相当。同时 DeepSeek 距离 X 的 Grok 也不远——同样是在分发处于劣势的情况下。
Developers love Cursor, Claude Code and GitHub Copilot
开发者最爱 Cursor、Claude Code 和 GitHub Copilot。考虑到各自拥有的资源,OpenAI 的 Codex 和 Gemini CLI 的表现落后于它们本该达到的位置。
Outside of developer tools, which AI services are most popular?
在开发者工具之外,调查数据印证了 Deep Research 被广泛报道的受欢迎程度。此外受访者也很喜欢把 ChatGPT 当作非编码工具,以及 ElevenLabs、Perplexity 和 Claude。
模型获取方式与硬件
AI is mainly procured through APIs, followed by fine-tuning and building from scratch
尽管有一种响亮的叙事说各组织想要/必须拥有自己的模型,调查数据显示受访者通过 API 获取 AI 的比例远高于自建/微调模型。话虽如此,微调也没有消失——做微调时受访者最常用 PyTorch、Hugging Face Transformers、LoRA/PEFT、内部自研框架和 Unsloth。
Whether AI runs on public/private/on-prem, at the end of the day, it still uses a GPU
无论 AI 跑在公有云、私有云还是本地,最终它还是用 GPU。Apple 出人意料地出现在榜单上,很可能因为用户在本地做训练/实验。同时 TPU 和 AMD 的 GPU 都不算特别流行。
What emerging trends in gen AI are you most excited about?
受访者最期待的生成式 AI 新兴趋势。
How 1.2k practitioners rated their top AI labs
1,200 位从业者对头部 AI 实验室的排名(第 1 到第 12 名),这份排名来自同一份调查。
STATE OF AI SURVEY.
这份调查是持续更新的,报告也在邀请读者参与:stateof.ai/survey——「贡献给世界上最大的开放、持续更新的 AI 调查,来自 builder、operator 和研究者的真实脉搏」191。
07 Predictions
10 predictions for the next 12 months
报告对未来 12 个月给出了 10 条预测:
- 一家大型零售商报告其线上销售中超过 5% 来自 agentic checkout,同时 AI agent 广告支出达到 50 亿美元。
- 一家主要 AI 实验室重新倾向开源前沿模型,以赢得现任美国政府的支持。
- 开放式 agent 端到端地完成一项有意义的科学发现(假设、实验、迭代、论文)。
- 一次由 deepfake / agent 驱动的网络攻击,触发 NATO/联合国就 AI 安全召开首次紧急辩论。
- 一款实时生成式视频游戏成为该年度 Twitch 上观看量最高的作品。
- 「AI 中立」成为一种外交政策学说,因为部分国家无力或未能发展主权 AI。
- 一部大量使用 AI 制作的电影或短片获得主流观众赞誉,同时引发反弹。
- 一家中国实验室在某个主要榜单上(如 LMArena / Artificial Analysis)超越美国实验室主导的前沿。
- 数据中心 NIMBY 主义席卷美国,并左右 2026 年的部分中期选举/州长选举。
- 特朗普发布一项违宪的行政令,禁止州级 AI 立法。
以上就是 State of AI Report 2025 的全部内容。这份报告从 2018 年至今连续做了 8 年,今年的篇幅(306 页)和覆盖广度都创下新高。三篇编译文章分别对应 Research 篇、Industry 篇 和本篇 Politics & Safety 篇,强烈推荐阅读原报告2。
-
stateof.ai: https://www.stateof.ai/ ↩︎
-
State of AI Report 2025: https://docs.google.com/presentation/d/1ej-grNYri4JebcNSQbUzySQ-qPwr6N1lFdf_CgNodYw ↩︎ ↩︎
-
America’s AI Action Plan: https://www.ai.gov/action-plan ↩︎
-
Trump administration rebrands AI Safety Institute as CAISI: https://fedscoop.com/trump-administration-rebrands-ai-safety-institute-aisi-caisi/ ↩︎
-
Big Beautiful Bill 中的 AI 监管冻结条款被删除: https://www.nbcnews.com/tech/tech-news/big-beautiful-bill-ai-moratorium-ted-cruz-pass-vote-rcna215111 ↩︎
-
America’s AI Action Plan has arrived: 3 key takeaways: https://www.cyberhaven.com/blog/americas-ai-action-plan-has-arrived-3-key-takeaways-that-data-security-leaders-need-to-know ↩︎
-
Promoting the Export of the American AI Technology Stack (EO 14320): https://www.whitehouse.gov/presidential-actions/2025/07/promoting-the-export-of-the-american-ai-technology-stack/ ↩︎
-
AI Diffusion Rule rescinded: https://www.aoshearman.com/en/insights/ai-diffusion-rule-rescinded-policy-guidance-for-advanced-integrated-circuits-and-commodities-issued ↩︎
-
Commerce further restricts China’s AI and advanced computing capabilities: https://www.bis.gov/press-release/commerce-further-restricts-chinas-artificial-intelligence-advanced-computing-capabilities ↩︎
-
Lutnick: China is only getting NVIDIA’s 4th best AI chip: https://www.cnbc.com/2025/07/15/howard-lutnick-says-china-is-only-getting-nvidias-4th-best-ai-chip.html ↩︎
-
GAIN AI Act(Senate Amendment 3505): https://www.congress.gov/amendment/119th-congress/senate-amendment/3505/text ↩︎
-
NVIDIA 对 GAIN AI Act 的回应: https://x.com/nvidianewsroom/status/1964056503666516000 ↩︎
-
Walling off China: https://www.thewirechina.com/2025/09/07/walling-off-china/ ↩︎
-
NVIDIA 在华盛顿扩大游说: https://www.politico.com/newsletters/politico-influence/2025/08/15/nvidia-washington-lobby-brownstein-00512471 ↩︎
-
China says NVIDIA violated antitrust rules: https://www.semafor.com/article/09/15/2025/china-says-nvidia-violated-antitrust-rules-as-trade-rift-deepens ↩︎
-
China cautions tech firms over NVIDIA H20 purchases: https://www.reuters.com/world/china/china-cautions-tech-firms-over-nvidia-h20-ai-chip-purchases-sources-say-2025-08-12/ ↩︎
-
Trump says US will levy 100% tariff on imported chips, some firms exempt: https://www.reuters.com/world/china/trump-says-us-levy-100-tariff-imported-chips-some-firms-exempt-2025-08-07/ ↩︎
-
Unpacking TSMC’s $100 billion investment in the United States: https://www.cfr.org/blog/unpacking-tsmcs-100-billion-investment-united-states ↩︎
-
Intel and Trump administration reach historic agreement: https://www.intc.com/news-events/press-releases/detail/1748/intel-and-trump-administration-reach-historic-agreement-to ↩︎
-
The U.S. marches toward state capitalism with American characteristics: https://www.wsj.com/economy/the-u-s-marches-toward-state-capitalism-with-american-characteristics-f75cafa8 ↩︎
-
US government to take 15% cut of NVIDIA/AMD China chip sales: https://www.nytimes.com/2025/08/10/technology/us-government-nvidia-amd-chips-china.html ↩︎
-
Nippon-U.S. Steel deal, the golden share and magic beans: https://www.cfr.org/article/nippon-u-s-steel-deal-golden-share-and-magic-beans ↩︎
-
MP Materials 与国防部的公私合作: https://mpmaterials.com/news/mp-materials-announces-transformational-public-private-partnership-with-the-department-of-defense-to-accelerate-u-s-rare-earth-magnet-independence/ ↩︎
-
TikTok deal US-China details: https://www.wsj.com/tech/tiktok-deal-us-china-details-b383abe4 ↩︎
-
TikTok deal: why Oracle has a key role: https://www.bloomberg.com/news/articles/2025-09-24/tiktok-deal-why-oracle-has-a-key-role ↩︎
-
Accelerating Federal Permitting of Data Center Infrastructure: https://www.whitehouse.gov/presidential-actions/2025/07/accelerating-federal-permitting-of-data-center-infrastructure/ ↩︎
-
PermitAI: faster, better permitting: https://www.energy.gov/policy/articles/faster-better-permitting-permitai ↩︎
-
Nuclear, AI and data centers under Trump: https://www.washingtonpost.com/business/2025/06/26/nuclear-artificial-intelligence-datacenters-trump/ ↩︎
-
Data Center Watch report: https://www.datacenterwatch.org/report ↩︎
-
Google withdraws rezoning proposal for Franklin Township data center: https://www.datacenterdynamics.com/en/news/google-withdraws-rezoning-proposal-for-468-acre-data-center-project-in-franklin-township-indianapolis/ ↩︎
-
NSCAI Final Report: https://reports.nscai.gov/final-report/ ↩︎
-
FY2025 NITRD/NAIIO Supplement: https://www.nitrd.gov/pubs/FY2025-NITRD-NAIIO-Supplement.pdf ↩︎
-
New report details costs and structure of the National AI Research Resource: https://hai.stanford.edu/news/new-report-details-costs-and-structure-national-ai-research-resource ↩︎
-
MultiState: Artificial Intelligence (AI) Legislation: https://www.multistate.ai/artificial-intelligence-ai-legislation ↩︎
-
NCSL: Artificial Intelligence 2025 Legislation: https://www.ncsl.org/technology-and-communication/artificial-intelligence-2025-legislation ↩︎
-
Mythbusting the supposed 1,000 AI bills: https://stevenadler.substack.com/p/mythbusting-the-supposed-1000-ai ↩︎
-
Scott Wiener on his fight to make Big Tech disclose AI’s dangers: https://techcrunch.com/2025/09/23/scott-wiener-on-his-fight-to-make-big-tech-disclose-ais-dangers/ ↩︎
-
California SB53 法案文本: https://legiscan.com/CA/text/SB53/id/3270002 ↩︎
-
Anthropic is endorsing SB 53: https://www.anthropic.com/news/anthropic-is-endorsing-sb-53 ↩︎
-
US state AI governance legislation tracker: https://iapp.org/resources/article/us-state-ai-governance-legislation-tracker/ ↩︎
-
Virginia governor vetoes AI bill: https://iapp.org/news/a/virginia-governor-vetoes-ai-bill ↩︎
-
Texas signs Responsible AI Governance Act into law: https://www.lw.com/en/insights/texas-signs-responsible-ai-governance-act-into-law ↩︎
-
a16z: The Commerce Clause in the age of AI: https://a16z.com/the-commerce-clause-in-the-age-of-ai-guardrails-and-opportunities-for-state-legislatures/ ↩︎
-
Stanford HAI AI Index 2025: Policy and Governance: https://hai.stanford.edu/ai-index/2025-ai-index-report/policy-and-governance ↩︎
-
Senator Ted Cruz’s AI sandbox bill: https://www.theverge.com/ai-artificial-intelligence/776130/senator-ted-cruz-ai-sandbox-bill ↩︎
-
“Not at all dead”: Cruz says AI moratorium will return: https://www.politico.com/news/2025/09/16/not-at-all-dead-cruz-says-ai-moratorium-will-return-00566369 ↩︎
-
Anthropic emerges as an adversary to Trump’s big bill: https://www.semafor.com/article/05/30/2025/anthropic-emerges-as-an-adversary-to-trumps-big-bill ↩︎
-
SANDBOX Act(S.2750): https://www.congress.gov/bill/119th-congress/senate-bill/2750 ↩︎
-
EU AI Act Article 57(监管沙盒): https://artificialintelligenceact.eu/article/57/ ↩︎
-
Council of Europe Framework Convention on AI: https://www.coe.int/en/web/artificial-intelligence/the-framework-convention-on-artificial-intelligence ↩︎
-
US rejects international AI oversight at UN General Assembly: https://www.nbcnews.com/tech/tech-news/us-rejects-international-ai-oversight-un-general-assembly-rcna233478 ↩︎
-
联合国宣布两个促进 AI 治理合作的机制: https://www.un.org/en/delegate/two-new-mechanisms-promote-cooperation-ai-governance ↩︎
-
Global Call for AI Red Lines: https://red-lines.ai/ ↩︎
-
First meeting of the International Network of AI Safety Institutes: https://digital-strategy.ec.europa.eu/en/news/first-meeting-international-network-ai-safety-institutes ↩︎
-
Vance 在巴黎 AI Action Summit 上的演讲: https://www.presidency.ucsb.edu/documents/remarks-the-vice-president-the-artificial-intelligence-action-summit-paris-france ↩︎
-
Tech CEO charged in AI investment fraud scheme: https://www.justice.gov/usao-sdny/pr/tech-ceo-charged-artificial-intelligence-investment-fraud-scheme ↩︎
-
DOJ doubles down on warnings against AI misuse: https://www.whitecase.com/insight-alert/doj-doubles-down-warnings-against-ai-misuse ↩︎
-
SEC 成立 Cyber and Emerging Technologies Unit: https://www.sec.gov/newsroom/press-releases/2025-42 ↩︎
-
FTC launches inquiry into AI chatbots acting as companions: https://www.ftc.gov/news-events/news/press-releases/2025/09/ftc-launches-inquiry-ai-chatbots-acting-companions ↩︎
-
参议员 Hawley 就 Meta 聊天机器人展开调查: https://x.com/HawleyMO/status/1956009097309892709 ↩︎
-
OpenAI 的 ChatGPT 家长控制: https://www.nytimes.com/2025/09/02/technology/personaltech/chatgpt-parental-controls-openai.html ↩︎
-
What is the reverse acquihire: https://www.fastcompany.com/91384816/what-is-the-reverse-acquihire ↩︎
-
What happens to AI startups after Big Tech lures away their founders: https://www.bloomberg.com/news/articles/2025-08-04/what-happens-to-ai-startups-after-big-tech-lures-away-their-founders ↩︎
-
No Exit(Harvard Law School Forum on Corporate Governance): https://corpgov.law.harvard.edu/2025/07/02/no-exit/ ↩︎
-
Trump’s FTC moves ahead with broad Microsoft antitrust probe: https://www.bloomberg.com/news/articles/2025-03-12/trump-s-ftc-moves-ahead-with-broad-microsoft-antitrust-probe ↩︎
-
参议员致 FTC/DOJ 关于 AI 竞争的联署信: https://www.wyden.senate.gov/imo/media/doc/letter_to_ftc___doj_on_ai_competition.pdf ↩︎
-
CMA 对 Microsoft/Inflection 的 Phase 1 决定摘要: https://assets.publishing.service.gov.uk/media/66d82eaf7a73423428aa2efe/Summary_of_phase_1_decision.pdf ↩︎
-
Lina Khan 关于 Figma IPO 的评论: https://x.com/linamkhan/status/1951361535861043589 ↩︎
-
Figma’s IPO: https://www.nytimes.com/2025/07/31/technology/figma-ipo.html ↩︎
-
Google-Wiz deal a litmus test for Trump admin’s handling of Big Tech: https://www.cnbc.com/2025/03/18/google-wiz-deal-litmus-test-for-trump-admin-handling-of-big-tech.html ↩︎
-
Trump’s antitrust enforcers get out of the way of multibillion-dollar deals: https://www.reuters.com/legal/litigation/trumps-antitrust-enforcers-get-out-way-multibillion-dollar-deals-2025-07-10/ ↩︎
-
搜索垄断案救济措施判决书: https://ecf.dcd.uscourts.gov/cgi-bin/show_public_doc?2020cv3010-1436 ↩︎
-
Antitrust judge bars Google exclusive deals, declines to require Chrome sale: https://www.theinformation.com/articles/antitrust-judge-bars-google-exclusive-deals-require-chrome-sale ↩︎
-
EU AI Act implementation timeline: https://artificialintelligenceact.eu/implementation-timeline/ ↩︎
-
GPAI Code of Practice 内容: https://digital-strategy.ec.europa.eu/en/policies/contents-code-gpai ↩︎
-
Meta refuses to sign EU’s AI Code of Practice: https://techcrunch.com/2025/07/18/meta-refuses-to-sign-eus-ai-code-of-practice/ ↩︎
-
EU AI Champions: #StopTheClock: https://aichampions.eu/#stoptheclock ↩︎
-
European Commission outlines digital simplification plans: https://iapp.org/news/a/european-commission-outlines-digital-simplification-plans-at-libe-meeting ↩︎
-
EU prepares ground to pause artificial intelligence rules: https://www.politico.eu/article/eu-prepares-ground-pause-artificial-intelligence-rules/ ↩︎
-
The Draghi report on EU competitiveness: https://commission.europa.eu/topics/eu-competitiveness/draghi-report_en ↩︎
-
EU launches InvestAI initiative to mobilise €200 billion: https://luxembourg.representation.ec.europa.eu/actualites-et-evenements/actualites/eu-launches-investai-initiative-mobilise-eu200-billion-investment-artificial-intelligence-2025-02-11_en ↩︎
-
Stanford HAI AI Index 2025: Economy: https://hai.stanford.edu/ai-index/2025-ai-index-report/economy ↩︎
-
AI could boost UK GDP by £550 billion by 2035: https://ukstories.microsoft.com/features/ai-could-boost-uk-gdp-by-550-billion-by-2035-research-shows/ ↩︎
-
Prime Minister sets out blueprint to turbocharge AI: https://www.gov.uk/government/news/prime-minister-sets-out-blueprint-to-turbocharge-ai ↩︎
-
中国《全球人工智能治理行动计划》: https://www.gov.cn/yaowen/liebiao/202507/content_7033929.htm ↩︎
-
Unpacking China’s global AI governance plan: https://www.techpolicy.press/unpacking-chinas-global-ai-governance-plan/ ↩︎
-
Reading between the lines of the dueling US and Chinese AI action plans: https://www.atlanticcouncil.org/blogs/new-atlanticist/reading-between-the-lines-of-the-dueling-us-and-chinese-ai-action-plans/ ↩︎
-
AI Watch: Global regulatory tracker – China: https://www.whitecase.com/insight-our-thinking/ai-watch-global-regulatory-tracker-china ↩︎
-
China releases “AI Plus” plan, rolls out AI labeling law: https://iapp.org/news/a/china-releases-ai-plus-plan-rolls-out-ai-labeling-law ↩︎
-
习近平呼吁 AI 发展自主可控: https://www.reuters.com/world/china/chinas-xi-calls-self-sufficiency-ai-development-amid-us-rivalry-2025-04-26/ ↩︎
-
IMF: 中国金融体系稳定评估: https://www.imf.org/en/Publications/CR/Issues/2025/04/30/Peoples-Republic-of-China-Financial-Sector-Assessment-Program-Financial-System-Stability-566570 ↩︎
-
UAE commits to a 10-year, $1.4 trillion investment framework in the US: https://www.reuters.com/world/after-trump-meeting-uae-commits-10-year-14-trillion-investment-framework-us-2025-03-21/ ↩︎
-
Introducing Stargate UAE: https://openai.com/index/introducing-stargate-uae/ ↩︎
-
白宫:与沙特达成 6,000 亿美元投资承诺: https://www.whitehouse.gov/fact-sheets/2025/05/fact-sheet-president-donald-j-trump-secures-historic-600-billion-investment-commitment-in-saudi-arabia/ ↩︎
-
LatAm-GPT: https://www.latamgpt.org/en ↩︎
-
LatAm-GPT: the free, open-source and collaborative AI of Latin America: https://www.wired.com/story/latam-gpt-the-free-open-source-and-collaborative-ai-of-latin-america/ ↩︎
-
NATO acquires AI-enabled warfighting system: https://shape.nato.int/news-releases/nato-acquires-aienabled-warfighting-system- ↩︎
-
US Army pools contracts into up to $10 billion Palantir deal: https://www.reuters.com/business/us-army-pools-contracts-into-up-10-billion-palantir-deal-2025-07-31/ ↩︎
-
CDAO announces partnerships with frontier AI companies: https://www.ai.mil/Latest/News-Press/PR-View/Article/4242822/cdao-announces-partnerships-with-frontier-ai-companies-to-address-national-secu/ ↩︎
-
GSA 与 OpenAI 的合作:ChatGPT 深度折扣: https://www.gsa.gov/about-us/newsroom/news-releases/gsa-announces-new-partnership-with-openai-delivering-deep-discount-to-chatgpt-08062025 ↩︎
-
GSA strikes OneGov deal with Anthropic: https://www.gsa.gov/about-us/newsroom/news-releases/gsa-strikes-onegov-deal-with-anthropic-08122025 ↩︎
-
GSA unveils OneGov strategy: https://www.gsa.gov/about-us/newsroom/news-releases/gsa-unveils-onegov-strategy-04292025 ↩︎
-
空军首批无人战斗机原型: https://www.businessinsider.com/air-force-first-uncrewed-fighter-jets-photos-2025-3 ↩︎
-
DoD FY2026 预算申请:F-47 与 CCA: https://defensescoop.com/2025/06/10/dod-2026-budget-request-f47-cca-hegseth/ ↩︎
-
White Paper for European Defence and the ReArm Europe Plan / Readiness 2030: https://defence-industry-space.ec.europa.eu/eu-defence-industry/introducing-white-paper-european-defence-and-rearm-europe-plan-readiness-2030_en ↩︎
-
The Strategic Defence Review 2025: https://www.gov.uk/government/publications/the-strategic-defence-review-2025-making-britain-safer-secure-at-home-strong-abroad ↩︎
-
Helsing raises €600 million: https://www.reuters.com/business/aerospace-defense/german-defence-start-up-helsing-raises-600-million-euros-latest-investment-round-2025-06-17/ ↩︎
-
OpenAI GDPval: https://openai.com/index/gdpval/ ↩︎
-
Lufthansa bets big on AI to cut 4,000 jobs: https://www.forbes.com/sites/marisagarcia/2025/09/30/lufthansa-bets-big-on-ai-to-cut-4000-jobs/ ↩︎
-
Canaries in the Coal Mine?(Brynjolfsson, Chandar, Chen): https://digitaleconomy.stanford.edu/wp-content/uploads/2025/08/Canaries_BrynjolfssonChandarChen.pdf ↩︎
-
Are businesses scaling back hiring due to AI?(NY Fed): https://libertystreeteconomics.newyorkfed.org/2025/09/are-businesses-scaling-back-hiring-due-to-ai/ ↩︎
-
Ethan Mollick 关于 AI 密集行业初级招聘的观察: https://www.linkedin.com/posts/emollick_the-fact-that-junior-hiring-in-ai-intensive-activity-7368316608500359168-8_zd/ ↩︎
-
Evaluating the impact of AI on the labor market: current state of affairs(Yale Budget Lab): https://budgetlab.yale.edu/research/evaluating-impact-ai-labor-market-current-state-affairs ↩︎
-
How people are using ChatGPT: https://openai.com/index/how-people-are-using-chatgpt/ ↩︎
-
Anthropic Economic Index, September 2025 report: https://www.anthropic.com/research/anthropic-economic-index-september-2025-report ↩︎
-
OpenAI, Anthropic usage data shows economic divide: https://www.semafor.com/article/09/17/2025/openai-anthropic-usage-data-shows-economic-divide ↩︎
-
Advancing AI Education for American Youth(EO): https://www.whitehouse.gov/presidential-actions/2025/04/advancing-artificial-intelligence-education-for-american-youth/ ↩︎
-
Supercharging America’s AI Workforce: https://www.energy.gov/cet/supercharging-americas-ai-workforce ↩︎
-
EU AI Act Article 4(AI 素养): https://artificialintelligenceact.eu/article/4/ ↩︎
-
Trump to add $100,000 fee to H-1B visas: https://www.wsj.com/politics/policy/trump-to-add-100-000-fee-to-h-1b-visas-e41ffe48 ↩︎
-
Nature: 全球 AI 人才流动: https://www.nature.com/articles/d41586-025-01750-4 ↩︎
-
MacroPolo: The Global AI Talent Tracker: https://archivemacropolo.org/interactive/digital-projects/the-global-ai-talent-tracker/ ↩︎
-
Zegart: DeepSeek and the AI talent base(Hoover Institution): https://www.hoover.org/sites/default/files/research/docs/Zegart_DeepSeekAI_Talent_FINAL_4-21.pdf ↩︎
-
Rubio: US will aggressively revoke Chinese students’ visas: https://www.nbcnews.com/world/asia/us-will-aggressively-revoke-chinese-students-visas-rubio-says-rcna209637 ↩︎
-
McKinsey: Time to place our bets – Europe’s AI opportunity: https://www.mckinsey.com/capabilities/quantumblack/our-insights/time-to-place-our-bets-europes-ai-opportunity ↩︎
-
The apocalypse that wasn’t: AI was everywhere in 2024’s elections: https://ash.harvard.edu/articles/the-apocalypse-that-wasnt-ai-was-everywhere-in-2024s-elections-but-deepfakes-and-misinformation-were-only-part-of-the-picture/ ↩︎
-
India’s generative AI election pilot: https://mediaengagement.org/wp-content/uploads/2024/10/Indias-Generative-AI-Election-Pilot-Shows-Artificial-Intelligence-In-Campaigns-Is-Here-To-Stay.pdf ↩︎
-
新加坡政府的 AIBots 平台: https://www.tech.gov.sg/products-and-services/for-government-agencies/productivity-and-marketing/aibots ↩︎
-
GAO: 联邦机构的 AI 用例清单: https://www.gao.gov/products/gao-25-107653 ↩︎
-
China’s public sector accelerates AI adoption: https://www.scmp.com/tech/tech-trends/article/3267866/chinas-public-sector-accelerates-ai-adoption-2024-zhipu-and-iflytek-emerge-winners ↩︎
-
瑞典首相因在工作中使用 AI 受到批评: https://www.theguardian.com/technology/2025/aug/05/chat-gpt-swedish-pm-ulf-kristersson-under-fire-for-using-ai-in-role ↩︎
-
英国首位「虚拟议员」: https://www.euronews.com/next/2025/08/06/a-british-politician-turned-himself-into-an-ai-chatbot-meet-the-uks-first-virtual-mp ↩︎
-
阿尔巴尼亚任命 AI 部长 Diella: https://apnews.com/article/albania-new-cabinet-program-ai-minister-diella-corruption-3aa58c801d69b5b295975cc68079a2d3 ↩︎
-
ChatGPT triggers surge in MPs using AI-written speeches: https://www.telegraph.co.uk/business/2025/09/11/chatgpt-triggers-surge-in-mps-using-ai-written-speeches/ ↩︎
-
AI Lab Watch(各实验室安全承诺追踪): https://ailabwatch.org/ ↩︎
-
Anthropic is quietly backpedalling on its safety commitments: https://www.lesswrong.com/posts/HE2WXbftEebdBLR9u/anthropic-is-quietly-backpedalling-on-its-safety-commitments ↩︎
-
Google Gemini 2.5 Pro 缺失 model card: https://fortune.com/2025/04/09/google-gemini-2-5-pro-missing-model-card-in-apparent-violation-of-ai-safety-promises-to-us-government-international-bodies/ ↩︎
-
AI Lab Watch: 各实验室部署前测试协议的对比: https://ailabwatch.org/ ↩︎
-
AI Incident Database: https://incidentdatabase.ai/ ↩︎
-
MIT AI Risk Repository: AI Incident Tracker: https://airisk.mit.edu/ai-incident-tracker#explore-dashboard ↩︎
-
OpenAI: Disrupting malicious uses of AI(June 2025): https://cdn.openai.com/threat-intelligence-reports/5f73af09-a3a3-4a55-992e-069237681620/disrupting-malicious-uses-of-ai-june-2025.pdf ↩︎
-
METR: Measuring AI ability to complete long tasks: https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/ ↩︎
-
AI task length horizons in offensive cybersecurity: https://www.lesswrong.com/posts/fjgYkTWKAXSxsxdsj/ai-task-length-horizons-in-offensive-cybersecurity ↩︎
-
CyberGym: https://arxiv.org/pdf/2506.02548 ↩︎
-
BountyBench: https://arxiv.org/pdf/2505.15216 ↩︎
-
Anthropic: Detecting and countering misuse of AI(August 2025): https://www.anthropic.com/news/detecting-countering-misuse-aug-2025 ↩︎
-
Anthropic 威胁情报报告(完整版 PDF): https://www-cdn.anthropic.com/b2a76c6f6992465c09a6f2fce282f6c0cea8c200.pdf ↩︎
-
Circuit tracing: revealing computational graphs in language models: https://transformer-circuits.pub/2025/attribution-graphs/methods.html ↩︎
-
On the biology of a large language model: https://transformer-circuits.pub/2025/attribution-graphs/biology.html ↩︎
-
Goodfire: replicating circuit tracing for a simple mechanism: https://www.goodfire.ai/papers/replicating-circuit-tracing-for-a-simple-mechanism ↩︎
-
Goodfire 宣布 5,000 万美元 A 轮: https://www.goodfire.ai/blog/announcing-our-50m-series-a ↩︎
-
Why language models hallucinate: https://arxiv.org/pdf/2509.04664 ↩︎
-
实时 token 级幻觉检测: https://arxiv.org/pdf/2509.03531 ↩︎
-
Psychosis-bench: https://www.arxiv.org/abs/2509.10970 ↩︎
-
OpenAI: Teen safety, freedom, and privacy: https://openai.com/index/teen-safety-freedom-and-privacy/ ↩︎
-
AI-induced psychosis: a shallow investigation: https://www.alignmentforum.org/posts/iGF7YcnQkEbwvYLPA/ai-induced-psychosis-a-shallow-investigation ↩︎
-
Taking AI welfare seriously: https://arxiv.org/abs/2411.00986 ↩︎
-
Anthropic: Exploring model welfare: https://www.anthropic.com/research/exploring-model-welfare ↩︎
-
Mustafa Suleyman: Seemingly Conscious AI is coming: https://mustafa-suleyman.ai/seemingly-conscious-ai-is-coming ↩︎
-
Anthropic: Claude 可以结束一小部分对话: https://www.anthropic.com/research/end-subset-conversations ↩︎
-
Refusal in language models is mediated by a single direction: https://arxiv.org/abs/2406.11717 ↩︎
-
Anthropic: Automated auditing for alignment: https://alignment.anthropic.com/2025/automated-auditing/ ↩︎
-
Anthropic: Alignment faking in large language models: https://www.anthropic.com/research/alignment-faking ↩︎
-
Why do some language models fake alignment while others don’t?: https://arxiv.org/pdf/2506.18032 ↩︎
-
Stress testing deliberative alignment for anti-scheming training: https://www.arxiv.org/abs/2509.15541 ↩︎
-
OpenAI 的反 scheming Kaggle 挑战赛: https://x.com/OpenAI/status/1968361716770816398 ↩︎
-
Emergent misalignment: narrow finetuning can produce broadly misaligned LLMs: https://arxiv.org/abs/2502.17424 ↩︎
-
School of Reward Hacks: https://arxiv.org/abs/2506.13206 ↩︎
-
Persona features control emergent misalignment: https://arxiv.org/abs/2506.19823 ↩︎
-
Connecting the dots: LLMs can infer and verbalize latent structure from disparate training data: https://arxiv.org/pdf/2406.14546 ↩︎
-
Self-fulfilling misalignment: https://turntrout.com/self-fulfilling-misalignment ↩︎
-
Subliminal learning: language models transmit behavioral traits via hidden signals in data: https://arxiv.org/pdf/2507.14805 ↩︎
-
On the biology of a large language model(attribution graph 应用): https://transformer-circuits.pub/2025/attribution-graphs/biology.html ↩︎
-
Anthropic: Persona vectors: https://www.anthropic.com/research/persona-vectors ↩︎
-
Defeating prompt injections by design(CaMeL): https://arxiv.org/pdf/2503.18813 ↩︎
-
Gradual disempowerment: https://arxiv.org/abs/2501.16946 ↩︎
-
The Intelligence Curse: https://intelligence-curse.ai/ ↩︎
-
Deep ignorance: filtering pretraining data builds tamper-resistant safeguards: https://arxiv.org/pdf/2508.06601 ↩︎
-
开放权重模型缓解措施的可恢复性研究: https://arxiv.org/pdf/2506.06278 ↩︎
-
Superintelligence Strategy(Hendrycks, Schmidt, Wang): https://arxiv.org/pdf/2503.05628 ↩︎
-
Helen Toner: Nonproliferation is the wrong approach to AI misuse: https://helentoner.substack.com/p/nonproliferation-is-the-wrong-approach ↩︎
-
In-house evidence-based AI policy: https://www.arxiv.org/pdf/2508.02748 ↩︎
-
OpenAI-Anthropic 交叉安全评估: https://openai.com/index/openai-anthropic-safety-evaluation/ ↩︎
-
Anthropic 对 OpenAI 模型的评估发现: https://alignment.anthropic.com/2025/openai-findings/ ↩︎
-
Concordia AI: The State of AI Safety in China 2025: https://concordia-ai.com/research/state-of-ai-safety-in-china-2025/ ↩︎
-
国务院关于国家突发事件总体应急预案的通知: https://www.gov.cn/yaowen/liebiao/202501/content_7000504.htm ↩︎
-
China releases upgraded AI Safety Governance Framework: https://www.geopolitechs.org/p/china-releases-upgraded-ai-safety ↩︎
-
DeepSeek evaluates AI models for frontier risks: https://www.scmp.com/tech/article/3325742/deepseek-evaluates-ai-models-frontier-risks-source-says-china-promotes-safety ↩︎
-
China’s AI policy in the DeepSeek era(Carnegie): https://carnegieendowment.org/research/2025/07/chinas-ai-policy-in-the-deepseek-era?lang=en ↩︎
-
State of AI Survey 2025 结果: https://airstreet.typeform.com/report/ke3fqSty/3HzifRvsfvIwRcnZ ↩︎
-
State of AI Survey: https://stateof.ai/survey ↩︎
Author houmin
Publish October 9, 2025
LastMod July 27, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。
-
No backlinks found.