stateof.ai 1 出品了 2022 年度人工智能报告2。该报告由英国风投公司 Air Street Capital 的合伙人 Nathan Benaich 与 Plural 联合创始人 Ian Hogarth 联合撰写,今年是第五年,另有两位研究助理 Othmane Sebbouh(ENS Paris)和 Nitarshan Rajkumar(剑桥大学)参与。2022 年是 diffusion model 元年、是 Chinchilla 改写 scaling law 的一年、也是学术界在大模型上彻底掉队的一年。本文编译自该报告,并附带简单分析,强烈推荐阅读原报告。

以下为全文目录,本文一次性覆盖全部五个章节。

  1. State of AI 2022 报告年度总结与去年预测复盘
  2. 科研进展:技术突破及其能力
  3. 产业界发展:当前 AI 创新的商业化应用以及对应的商业化影响
  4. 政治影响:AI 监管,AI 产生的经济影响,AI 的地缘政治演进
  5. AI 安全:明确和减轻将来庞大 AI 系统可能产生的灾难性影响
  6. 对未来 12 个月的预测

01 Key Themes

Research

  • Diffusion model 以惊人的文生图能力席卷了整个计算机视觉领域,并继续向视频、文本、音频、分子设计扩散。
  • AI 攻入更多科学问题,从塑料回收、核聚变反应堆控制到天然产物发现。
  • Scaling law 重新聚焦到数据上:模型规模可能并不是你需要的全部,同时业界继续向「一个模型统治所有」推进。
  • 社区驱动的大模型开源以惊人的速度发生,让松散的集体也能和大实验室竞争。
  • 受神经科学启发,AI 研究在方法论上开始越来越像认知科学

Industry

  • AI 半导体初创公司真的撼动 NVIDIA 了吗? AI 研究中的芯片使用统计显示,NVIDIA 领先 20–100 倍。
  • 大厂扩张自己的 AI 云,并与 A(G)I 初创公司结成大额合作
  • 招聘冻结和 AI 实验室解散,反而催生了大量从 DeepMind、OpenAI 出走的创业公司
  • 主要的 AI 药物研发公司已有 18 个临床阶段资产,自主医学影像诊断也拿到了第一个 CE 认证。
  • AI for code 的最新研究被大厂和初创公司迅速转化成了商业开发者工具

Politics

  • 大规模 AI 工作上,学术界和工业界之间的鸿沟可能已经无法弥合:几乎 0% 的工作出自学术界
  • 学术界正把接力棒交给由非传统资金支持的去中心化研究集体
  • 美国半导体能力的「大回流」(The Great Reshoring)正式启动,但地缘政治紧张度也达到了顶点
  • AI 继续被注入更多国防产品品类,国防 AI 初创公司拿到了更多融资

Safety

  • AI Safety 研究的关注度、人才和资金都在增加,但仍然远远落后于 capabilities 研究

复盘:我们 2021 年的预测打几分

Scorecard: Reviewing our predictions from 2021

作者每年会给自己的预测打分,这是这份报告最有意思的传统之一。2021 年的 8 条预测中,4 条命中、4 条落空。

  • Transformer 取代 RNN 学习 world model,让 RL agent 在大型富环境中超越人类。DeepMind 的 Gato 朝这个方向前进了一步(用 transformer 预测下一个状态和动作,但没有用 RL 训练),日内瓦大学的 GPT 式 transformer 模型 IRIS 则在 Atari 环境中解决了任务3
  • ASML 市值达到 5,000 亿美元。2022 年 10 月 3 日的市值约为 1,650 亿美元。
  • Anthropic 发表 GPT、Dota、AlphaGo 级别的成果,确立自己作为 AGI 研究第三极的地位。还没有。
  • AI 半导体出现一波整合,Graphcore、Cerebras、SambaNova、Groq、Mythic 中至少一家被大公司或半导体巨头收购。一起都没发生。
  • 小型 transformer + CNN 混合模型以 10 倍更少的参数追平 ImageNet top-1 的 SOTA(CoAtNet-7,90.88%,24.4 亿参数)。Google 的 MaxViT 用 4.75 亿参数几乎追平(89.53%)4
  • DeepMind 在物理科学上取得重大突破。三(!)篇数学和材料科学论文5
  • JAX 框架在 Papers With Code 上的月度新建仓库占比从 1% 涨到 5%。JAX 占比仍不足 1%6
  • 一家新的 AGI 研究公司成立,有雄厚资金支持,且路线图聚焦某个垂直行业。Adept.ai 由 Transformer 论文作者共同创立,专注通过软件工具使用自动化通往 AGI7

作者今年还补了一个「迟到总比不到好」的彩蛋环节,把 2018–2020 年的老预测也拉出来兑现:2018 年预测的「台韩半导体公司成为中美贸易战的明牌筹码」应验(美国 2022 年 CHIPS 法案禁止受助方在中国扩产,台积电被夹在中间);2018 年预测的「某个 OECD 国家政府会阻止美中科技公司收购一家领先 ML 公司」应验(英国等阻止了 NVIDIA 收购 Arm);2019 年预测的「某家主要 AI 公司对治理结构做出实质性调整」应验(Anthropic 注册为公益公司);2020 年预测的「中欧国防 AI 初创公司合计融资超 1 亿美元」应验(德国 Helsing 在 2022 年拿到 1 亿美元 A 轮);2020 年预测的「NVIDIA 最终无法完成对 Arm 的收购」应验(2022 年正式取消)。只有「Meta 用 3D 计算机视觉在 AR/VR 上取得重大突破」算「勉强」——PyTorch3D 里的 Implicitron 有了,但还没用到 AR/VR 上。

02 Research

Research 进展总结

  • DeepMind 用一年时间证明了 AI 可以做「真科学」:数学猜想生成、密度泛函近似、矩阵乘法算法、托卡马克等离子体控制、20,000 万个蛋白质结构,五个方向全部兑现。
  • Scaling law 被 Chinchilla 改写,「参数量优先」让位给「参数量和数据量同速增长」,同时能力涌现(emergence)成为一个既让人兴奋又让安全评估变得困难的现象。
  • Diffusion model 在一年内从「在几个 benchmark 上超过 GAN」变成文生图的绝对 SOTA,并且开源社区把闭源模型的复现窗口从 35 个月压缩到了 14 个月。

DeepMind 在数学与材料科学的三连击

2021 Prediction: DeepMind’s breakthroughs in the physical sciences (1/3)

2021 年报告预测「DeepMind 会在物理科学上放出一个重大突破」,这一年它在数学和材料科学上都兑现了。数学中最具决定性的时刻之一是提出猜想,也就是对若干变量之间关系的假设。传统做法是观察大量实例,辅以数据驱动的猜想生成方法,但这些方法只能处理低维、线性、结构简单的数学对象。

DeepMind 在 Nature 上提出了一套数学家与监督学习模型(通常是神经网络)迭代协作的工作流8:数学家先假设两个变量 X(z) 与 Y(z) 之间存在某个函数关系,计算机生成大量实例,神经网络拟合这些数据,再用梯度显著性方法找出 X(z) 中最相关的输入分量。数学家据此修正假设或生成更多数据,直到猜想在足够大的数据上成立。

DeepMind 提出的「数学家 + 监督学习模型」迭代式猜想生成工作流
DeepMind 提出的「数学家 + 监督学习模型」迭代式猜想生成工作流

2021 Prediction: DeepMind’s breakthroughs in the physical sciences (2/3)

DeepMind 把这套框架和悉尼大学、牛津大学的数学教授一起用了两次:一是提出了一个算法,用于解决表示论中一个悬置了 40 年的猜想9;二是在纽结理论中证明了一个新定理10

材料科学方面的贡献同样重要。DeepMind 证明了密度泛函理论(DFT)中的精确泛函——计算电子能量的核心工具——可以用神经网络高效近似11。值得注意的是,研究者没有去约束神经网络满足 DFT 泛函的数学约束,而是直接把这些约束编码进用于拟合的训练数据里。

纽结理论那项工作的示意:三叶结模型,以及研究者手绘的不变量关系图
纽结理论那项工作的示意:三叶结模型,以及研究者手绘的不变量关系图

用神经网络从三维电子密度直接近似 DFT 泛函,输出能量标量
用神经网络从三维电子密度直接近似 DFT 泛函,输出能量标量

2021 Prediction: DeepMind’s breakthroughs in the physical sciences (3/3)

DeepMind 还把 AlphaZero(那个击败人类国际象棋、围棋、将棋顶尖选手的 RL 模型)改造去做矩阵乘法12。这个叫 AlphaTensor 的模型找到了新的确定性矩阵乘法算法。为了能用上 AlphaZero,研究者把矩阵乘法重新表述成一个单人游戏:每一步对应一条算法指令,目标是把一个衡量「预测算法离正确还有多远」的张量清零13

寻找更快的矩阵乘法算法这个看似简单、被研究了几十年的问题,实际上已经停滞了数十年。 DeepMind 的方法不只加速了这个领域的研究,还直接惠及所有基于矩阵乘法的技术——也就是 AI、成像,以及我们手机上发生的几乎一切。

AlphaTensor 发现的算法在 V100 GPU 上按矩阵规模相对 Strassen 平方算法的加速比,最高 23.9%
AlphaTensor 发现的算法在 V100 GPU 上按矩阵规模相对 Strassen 平方算法的加速比,最高 23.9%

核聚变控制与蛋白质宇宙

Reinforcement learning could be a core component of the next fusion breakthrough

DeepMind 训练了一套强化学习系统来调节洛桑 TCV(可变位形托卡马克)的磁线圈14这套系统的灵活性意味着它也可以用在 ITER 上——那台正在法国建造的下一代托卡马克。

  • 实现核聚变的主流路线之一,是用托卡马克把极高温的等离子体约束足够长的时间。
  • 主要障碍在于等离子体不稳定,一旦接触托卡马克内壁就会损失热量并侵蚀材料。稳定它需要每秒调整磁线圈数千次。
  • DeepMind 的深度 RL 系统做到了这件事:先在仿真环境中训练,再部署到洛桑的 TCV 上。这套系统还能把等离子体塑造成新的形状,其中包括与 ITER 设计兼容的形状。

深度 RL 控制器在 TCV 上实现的多种等离子体位形
深度 RL 控制器在 TCV 上实现的多种等离子体位形

Predicting the structure of the entire known proteome: what could this unlock next?

自开源以来,DeepMind 的 AlphaFold 2 已被数百篇研究论文使用。今年他们进一步用它预测了来自植物、细菌、动物等生物的 2 亿个已知蛋白质的三维结构15。这项技术能解锁的下游突破——从药物发现到基础科学——需要几年时间才能显现。

  • 今天蛋白质数据库(PDB)中通过 X 射线晶体学和冷冻电镜实测确定的三维结构有 19 万个。
  • AlphaFold DB 在 2021 年 7 月的首次发布包含 100 万个预测结构。
  • 这次发布把数据库规模扩大了 200 倍。来自 190 个国家的超过 50 万名研究者已经用过这个数据库。
  • AlphaFold 在 AI 研究文献中的提及量正在暴涨,预计将同比增长两倍。

AlphaFold 在论文中的提及量:2019 年 23 篇、2020 年 69 篇、2021 年 214 篇,2022 年已发表 295 篇并预计再增 358 篇
AlphaFold 在论文中的提及量:2019 年 23 篇、2020 年 69 篇、2021 年 214 篇,2022 年已发表 295 篇并预计再增 358 篇

蛋白质语言模型与细胞图谱

Language models for proteins: a familiar story of open source and scaled models

研究者们各自独立地把语言模型用到了蛋白质生成和结构预测上,同时都在扩大模型参数量,并且都报告了 scaling 带来的巨大收益。

  • Salesforce 发现,扩大 LM 规模能更好地捕捉蛋白质序列的训练分布(用 perplexity 衡量)。用 60 亿参数的 ProGen2,他们生成了折叠结构与天然蛋白相似、但序列一致性差异很大的蛋白质16。不过作者强调,要释放 scale 的全部潜力,还需要在数据分布上花更多功夫。
  • Meta 等推出了 ESM 系列蛋白质语言模型,规模从 800 万到 150 亿参数(即 ESM-2)。基于 ESM-2 构建的 ESMFold 在结构预测上给出了与 AlphaFold 2、RoseTTAFold 相似的结果,但快了一个数量级17
  • 快的原因是 ESMFold 不依赖 AlphaFold 2 和 RoseTTAFold 所需的多序列比对(MSA)和模板,只用蛋白质序列本身。

ESM-2 从 800 万到 150 亿参数的 perplexity 与结构预测指标随规模持续改善
ESM-2 从 800 万到 150 亿参数的 perplexity 与结构预测指标随规模持续改善

ProGen2 从 small 到 xlarge,Test-max90 perplexity 从 12.9 一路降到 9.9
ProGen2 从 small 到 xlarge,Test-max90 perplexity 从 12.9 一路降到 9.9

OpenCell: understanding protein localization with a little help from machine learning

研究者用基于 CRISPR 的内源标记——通过修饰基因来点亮蛋白功能的特定侧面——来确定蛋白质在细胞中的定位,然后用聚类算法识别蛋白质社群,并对尚未表征的蛋白质提出机制假设18

  • 基因组研究的一个重要目标,是理解蛋白质在细胞里定位在哪、如何相互作用以实现特定功能。OpenCell 项目用 1,310 个标记蛋白、约 5,900 张三维图像的数据集,让研究者在蛋白质的空间分布、功能和相互作用之间建立起重要联系。
  • 在蛋白质相互作用图上做 Markov 聚类,成功划分出了功能相关的蛋白质群,这将帮助研究者理解那些至今未被表征的蛋白质。
  • 我们常常期待 ML 给出确定性的预测。但这里和数学一样,ML 先给出部分答案(这里是聚类),然后由人类解释、提出并检验假设,最后才得到确定的结论。

OpenCell 中不同亚细胞区室(内质网、高尔基体、核膜、核仁)的标记蛋白成像
OpenCell 中不同亚细胞区室(内质网、高尔基体、核膜、核仁)的标记蛋白成像

ML for Science 的红利与陷阱

Plastic recycling gets a much-needed ML-engineered enzyme

德州大学奥斯汀分校的研究者用机器学习改造出了一种能降解 PET 的酶,PET 这种塑料占全球固体废弃物的 12%19

  • 这个叫 FAST-PETase 的 PET 水解酶,对温度和 pH 的适应范围比已有的酶更宽。
  • FAST-PETase 能在一周内几乎完全降解 51 种不同的产品。
  • 研究者还证明可以用降解回收的单体重新合成 PET,为工业规模的 PET 闭环回收打开了可能性。

FAST-PETase 的设计流程与对不同 PET 制品的降解验证
FAST-PETase 的设计流程与对不同 PET 制品的降解验证

一整只 PET 容器被 FAST-PETase 降解的过程:30 小时后只剩边框,48 小时几乎什么都不剩
一整只 PET 容器被 FAST-PETase 降解的过程:30 小时后只剩边框,48 小时几乎什么都不剩

Beware of compounded errors: in science, ML in and garbage out?

随着 ML 在定量科学中被广泛使用,ML 里的方法论错误也会渗漏进这些学科。普林斯顿的研究者警告说,一场基于 ML 的科学复现危机正在酝酿,其中一个主要推手就是数据泄露(data leakage)20

  • 数据泄露是一个统称,涵盖所有「模型本不该拿到却拿到了数据」的情况。最常见的例子是测试数据混进了训练集。但泄露可以更隐蔽:模型用了某个实际上是结果变量代理的特征;或者测试数据来自与科学结论所声称的分布不同的分布。
  • 作者认为随之而来的复现失败是系统性的:他们研究了横跨 17 个科学领域的 20 篇综述,这些综述涵盖的 329 篇论文中,每一篇都出现了数据泄露错误
  • 受 ML 里日渐流行的 model card 启发,作者提出研究者应该使用「模型信息表」来预防数据泄露问题。

数据泄露修正前后,同一批模型报告准确率与实际准确率的落差
数据泄露修正前后,同一批模型报告准确率与实际准确率的落差

从 Minecraft 到代码:会用工具的模型

OpenAI uses Minecraft as a testbed for computer-using agents

OpenAI 训练了一个模型(Video PreTraining,VPT),只用少量带鼠标键盘标注的数据,就学会了从视频帧玩 Minecraft21VPT 是第一个学会合成钻石的 ML 模型,「这个任务连熟练的人类玩家通常也要花 20 分钟以上(24,000 个动作)」。

  • OpenAI 收集了 2,000 小时带鼠标键盘动作标注的视频,训练了一个逆动力学模型(IDM),用过去和未来的帧预测动作——这就是 PreTraining 部分。
  • 然后用 IDM 去标注 7 万小时的视频,在这些数据上训练一个只用过去视频帧预测动作的模型22
  • 他们证明这个模型可以用模仿学习和强化学习微调,达到从零开始做 RL 难以企及的性能。

第一步:用 2,000 小时带鼠标键盘标注的视频训练逆动力学模型 IDM,从前后帧反推出中间的动作
第一步:用 2,000 小时带鼠标键盘标注的视频训练逆动力学模型 IDM,从前后帧反推出中间的动作

第二步:用 IDM 给 7 万小时视频打标,训练只看过去帧就能预测动作的 VPT 基础模型
第二步:用 IDM 给 7 万小时视频打标,训练只看过去帧就能预测动作的 VPT 基础模型

VPT 预训练模型微调后的回报曲线,明显高于随机初始化的 RL
VPT 预训练模型微调后的回报曲线,明显高于随机初始化的 RL

Corporate AI labs rush into AI for code research

OpenAI 的 Codex(GitHub Copilot 背后的模型)以多行补全和从自然语言指令直接生成代码的能力震动了计算机科学社区。这一成功带动了更多研究,包括来自 Salesforce、Google 和 DeepMind 的工作。

  • Salesforce 的对话式 CodeGen 利用 LLM 的语言理解能力,让开发者通过多轮语言交互来指定编码需求。它是唯一一个能与 Codex 竞争的开源模型23
  • 更令人印象深刻的是 Google 的 PaLM:它达到了与 Codex 相似的性能,但训练数据里的代码量少 50 倍(PaLM 训练在一个更大的非代码数据集上)。在 Python 代码上微调后,PaLM 在代码修复任务 Deepfix 上超过了同行(82% vs. 71.7% 的 SOTA)。
  • DeepMind 的 AlphaCode 处理的是另一个问题:在竞赛编程任务上生成完整程序24。它在 Codeforces 上排名进入前 50%。模型先在 GitHub 数据上预训练,再在 Codeforces 的题目和解法上微调,然后采样出上百万个候选解,经过过滤和聚类得到最终 10 个提交。华为也推出了 PanGu-Coder25

AlphaCode 生成、过滤、聚类得到最终提交的流程
AlphaCode 生成、过滤、聚类得到最终提交的流程

Transformer 五年了,高效替代品在哪

Five years after the Transformer, there must be some efficient alternative, right… right?

Transformer 核心的 attention 层对输入长度有著名的平方复杂度依赖。一堆论文承诺解决这件事,但没有一种方法被真正采用。 SOTA 的 LLM 有各种形态(autoencoding、autoregressive、encoder-decoder),却全都依赖同一个 attention 机制。

过去几年里训练了海量的 transformer,为全世界的实验室和公司烧掉了数百万(数十亿?)美元。但所谓的「Efficient Transformer」在大规模 LM 研究中根本找不到踪影(而那里本该是差异最大的地方!):GPT-3、PaLM、LaMDA、Gopher、OPT、BLOOM、GPT-Neo、Megatron-Turing NLG、GLM-130B 等等,全部用的是原始 attention 层26

几个原因可以解释这种不被采用:(i)潜在的线性加速只在输入序列很长时才有用;(ii)新方法引入了额外约束,让架构不那么通用;(iii)论文里报告的效率指标,并不能转化为真实的计算成本和时间节省27

Efficient Transformer 方法的分类全景图
Efficient Transformer 方法的分类全景图

数学能力暴涨,benchmark 跟不上

Mathematical abilities of Language Models largely surpass expectations

基于 Google 5,400 亿参数的 PaLM,Google 的 Minerva 在 MATH benchmark 上拿到了 50.3% 的分数,比之前的 SOTA 高出 43.4 个百分点,也远超预测者对 2022 年最好成绩的预期(13%)28。与此同时 OpenAI 训练了一个网络,解出了两道国际数学奥林匹克(IMO)题目29

  • Google 在预训练好的 PaLM 上,用 118GB 来自 arXiv 的科学论文和使用 LaTeX、MathJax 的网页做了额外训练。配合 chain of thought prompting(在 prompt 里包含中间推理步骤而不只是最终答案)和 majority voting 等技巧,Minerva 在大多数数据集上把 SOTA 提高了至少两位数百分点。
  • Minerva 只用了语言模型,没有显式编码形式化数学。它更灵活,但只能自动评估最终答案而非整个推理过程,这可能带来一定的分数虚高。
  • 相比之下,OpenAI 构建的是一个基于 transformer 的定理证明器,运行在 Lean 形式化环境中。不同版本的模型分别解出了 AMC12(26 题)、AIME(6 题)和 IMO(2 题)——难度依次递增。

Minerva 求解一道数论题的完整输出,包含中间推理步骤
Minerva 求解一道数论题的完整输出,包含中间推理步骤

Fast progress in LLM research renders benchmarks obsolete, but a BIG one comes to help

只有 66% 的机器学习 benchmark 收到过 3 次以上不同时间点的结果提交,而且很多在发布后不久就被解决或饱和30。由 132 家机构的 444 位作者设计的新 benchmark BIG(Beyond the Imitation Game) 想要挑战当前和未来的语言模型31

  • 维也纳大学、牛津大学和 FHI 的一项研究考察了 406 个 AI 任务上的 1,688 个 benchmark,识别出了不同的提交动态。
  • 他们注意到语言类 benchmark 尤其容易被快速饱和。
  • LLM 的快速进展和涌现能力似乎正在跑赢现有 benchmark。结果是,这些进展大多只能通过 demo 或一次性突破这类旁证来体现,或者在各自零散的专用 benchmark 上评估,让人很难判断真实进展。
  • 新的 BIG benchmark 包含 204 个任务,全部配有强人类专家基线,评估从记忆到多步推理的一大批 LLM 能力。他们发现,目前即使是最好的模型,在 BIG benchmark 上也表现很差

benchmark 的三类提交动态:持续增长、饱和停滞、停滞后突然爆发
benchmark 的三类提交动态:持续增长、饱和停滞、停滞后突然爆发

Scaling law 重新看向数据,以及能力涌现

Ducking language model scaling laws: more data please

DeepMind 重新审视了 LM 的 scaling law,发现当前的模型严重训练不足:相对于它们庞大的体量,训练数据太少了32。他们训练了 Chinchilla——一个比 Gopher 小 4 倍、但用了 4.6 倍数据的模型——结果 Chinchilla 在 BIG-bench 上超过了 Gopher 和其他大模型。

  • 经验性的 LM scaling law 决定的是:在固定算力预算下,应该用多大的模型和多少训练数据。OpenAI 此前的工作认为,随着算力预算增加,模型规模的增长应当快于训练数据规模33
  • DeepMind 则主张,模型规模和训练 token 数应该以大致相同的速率增长。
  • 与 OpenAI 的工作相比,DeepMind 用了更大的模型来推导 scaling law。他们强调,数据 scaling 能对数十亿参数级别的模型给出更好的预测。
  • 按照新的 scaling law,Chinchilla(700 亿参数)训练在 1.4 万亿 token 上,而 Gopher(2,300 亿参数)只用了 3,000 亿 token。
  • 虽然训练算力预算相同,更轻的 Chinchilla 跑起来应该更快。

三种方法拟合出的「给定 FLOPs 下的最优参数量」曲线,Chinchilla 落在曲线附近而 Gopher、GPT-3、Megatron-Turing NLG 明显偏大
三种方法拟合出的「给定 FLOPs 下的最优参数量」曲线,Chinchilla 落在曲线附近而 Gopher、GPT-3、Megatron-Turing NLG 明显偏大

Ducking language model scaling laws: emergence

虽然模型 loss 可以用校准良好的 scaling law 作为规模和算力的函数被合理预测,但许多 LLM 能力是在模型达到某个临界规模时不可预测地涌现出来的34。这些获得的能力令人兴奋,但涌现现象让模型安全性评估变得更加困难。

  • 涌现还没有被完全理解:对多步推理任务,可能模型需要足够深才能编码推理步骤;对记忆类任务,更多参数是自然的解法。评价指标本身也可能是解释的一部分——推理任务上只有结论正确才算答对,因此尽管模型随规模在连续改善,我们只有在增量累积过临界点后才认为它成功。
  • 涌现的一个可能后果是,存在一批当前 LLM 够不着、但很快就能被解决的任务
  • 反过来说,在更大规模上把 LLM 部署到真实任务中会更加不确定,因为不安全、不合意的能力同样可能涌现。加上 ML 模型本身的脆弱性,这是从业者又要额外考虑的一个因素。

教模型使用工具,以及算力的三个时代

Teach a machine to fish: tool use as the next frontier?

语言模型可以学会使用搜索引擎、计算器这样的工具,方法很简单:给这些工具提供文本接口,然后在极少量人类演示数据上训练。

  • OpenAI 的 WebGPT 是第一个令人信服地证明这件事的模型:微调 GPT-3 去与搜索引擎交互,给出带引用出处的答案35。这只需要收集人类做这件事的数据,把交互数据转换成模型可消费的文本,再走标准监督学习。重要的是,增加人类演示数据的量显著提升了答案的真实性和信息量,相比 2021 年报告中讨论真实性评估时(第 44 页)是一个明显的进步。
  • 新的 AGI 公司 Adept 正在把这个范式商业化。公司训练大型 transformer 模型去与网站、软件应用和 API 交互,以提升工作流生产力36

WebGPT 与两种 prompt 下的 GPT-3 在「真实」与「真实且有信息量」比例上的对比,WebGPT 175B 已接近人类水平
WebGPT 与两种 prompt 下的 GPT-3 在「真实」与「真实且有信息量」比例上的对比,WebGPT 175B 已接近人类水平

Looking back: three eras of compute in machine learning

一项研究记录了机器学习算力需求的惊人加速,并按「每个模型训练算力的翻倍时间」划分出三个时代37前深度学习时代(2010 年之前,训练算力每 20 个月翻一番)、深度学习时代(2010–2015 年,每 6 个月翻一番)、大规模时代(2016 年至今,先是 100–1000 倍的跃升,之后每 10 个月翻一番)。

ML 模型训练算力随发表时间的变化,可见三个斜率不同的时代
ML 模型训练算力随发表时间的变化,可见三个斜率不同的时代

Diffusion model 统治文生图,并向视频扩散

Diffusion models take over text-to-image generation and expand into other modalities

2021 年报告讨论 diffusion model 时(第 36 页),它们刚在几个 benchmark 上超过 GAN38今天它们已经是文生图无可争议的 SOTA,并且正在向文生视频、文本生成、音频、分子设计等方向扩散(一语双关)。

  • Diffusion model(DM)学习的是逆转对图像逐步加噪的过程:把每一步的逆分布(从噪声图生成去噪图)建模成一个高斯分布,其均值和协方差由神经网络参数化。DM 从随机噪声生成新图像。
  • 顺序去噪让它们很慢,但新技术(比如在低维空间去噪)让它们在推理时更快、样本质量更高(classifier-free guidance——用多样性换保真度)39
  • DALL-E 2、Imagen、Stable Diffusion 这些 SOTA 文生图模型都基于 DM。它们也被用在可控文本生成40、基于模型的强化学习、视频生成41乃至分子生成42上。

DALL-E 2, Imagen and Parti…the battle for text-to-image generation rages

OpenAI 的 DALL-E 第二代在 2022 年 4 月发布,生成图像质量出现了显著跃升43。不久之后,Google 拿出了至少同样惊艳的、同样基于 diffusion 的 Imagen44。与此同时,Google 的 Parti 走了一条不同的自回归路线45

  • Parti 不用 diffusion model,而是把文生图当作一个简单的 sequence-to-sequence 任务,要预测的序列就是图像像素的某种表示。值得注意的是,随着 Parti 的参数量和训练数据扩大,模型获得了拼写这样的新能力
  • 其他值得关注的文生图模型还有早于 DALL-E 2 的 GLIDE(OpenAI)46和 Make-a-Scene(Meta,可同时用文本和草图)47,以及 CogView2(清华、智源,中英双语)48

Imagen、Parti、DALL-E 2 在同一 prompt 下的生成结果对比
Imagen、Parti、DALL-E 2 在同一 prompt 下的生成结果对比

DALL-E 2 的两张生成样例:「带机械半脸的达利肖像」与「戴贝雷帽和黑色高领毛衣的柴犬」
DALL-E 2 的两张生成样例:「带机械半脸的达利肖像」与「戴贝雷帽和黑色高领毛衣的柴犬」

The text-to-image diffusion model frenzy gives birth to new AI labs

Stability.ai 和 Midjourney 像是凭空冒出来一样,拿出了可以和成熟 AI 实验室掰手腕的文生图模型。 两家的 API 都在 beta,Midjourney 据报道已经盈利49,Stability 则已经把模型开源50。关于它们的崛起和研究动态,Politics 章节还会展开。

同一条「1969 年好莱坞棚内拍摄登月」prompt 下,Midjourney、DALL-E 2 与 Stable Diffusion 的结果(图片来源 Fabian Stelzer)
同一条「1969 年好莱坞棚内拍摄登月」prompt 下,Midjourney、DALL-E 2 与 Stable Diffusion 的结果(图片来源 Fabian Stelzer)

换成「老人肖像电影剧照」的 prompt,三个模型的风格差异同样明显
换成「老人肖像电影剧照」的 prompt,三个模型的风格差异同样明显

The text-to-video generation race has started

基于 diffusion 的文生视频研究大约在 2022 年 4 月由 Google 和不列颠哥伦比亚大学的工作开启。但到了 9 月底,Meta 和 Google 的新研究带来了质量上的跃升,宣告文生视频的「DALL-E 时刻」比预期来得更早。

  • Meta 用 Make-a-Video 打响了大厂在文生视频上的第一枪,这是一个用于视频生成的 diffusion model。
  • 以一种诡异的相似方式,Google 紧接着(不到一周)几乎同时发布了两个模型:基于 diffusion 的 Imagen Video,以及不基于 diffusion 的 Phenaki。后者可以通过追加 prompt 动态调整视频内容。

Imagen Video 生成的视频帧:蓝色火焰渐变成 IMAGEN 字样,木头人在太空冲浪
Imagen Video 生成的视频帧:蓝色火焰渐变成 IMAGEN 字样,木头人在太空冲浪

Make-a-Video 生成的视频帧:披红斗篷飞行的超级英雄狗,以及阳光穿过窗户照在一摞书上
Make-a-Video 生成的视频帧:披红斗篷飞行的超级英雄狗,以及阳光穿过窗户照在一摞书上

Phenaki 可以中途换 prompt:先是「泰迪熊在旧金山海里游泳」,再追加一句「泰迪熊潜到水下」,画面顺着接下去
Phenaki 可以中途换 prompt:先是「泰迪熊在旧金山海里游泳」,再追加一句「泰迪熊潜到水下」,画面顺着接下去

开源社区追赶闭源大模型的速度

Closed for 14 months: community-driven open sourcing of GPT et al.

OpenAI 和 DeepMind 的里程碑模型,被开源社区实现、克隆、改进的速度比作者预期的快得多。报告用三张时间线量化了这个「闭源窗口期」,第一张是语言模型:从 GPT-3(1,750 亿参数,2020 年 6 月)发布到社区拿出对标的开源模型,用了 14 个月。这条线上开源的有 GPT-J(60 亿)、GPT-NeoX(200 亿)、OPT(1,750 亿)、BLOOM(1,760 亿)、GLM(1,300 亿);闭源阵营则有 Gopher(2,800 亿)、LaMDA(2,800 亿)、Chinchilla(700 亿)、PaLM(5,400 亿)、Jurassic-1 Jumbo(2,040 亿)、HyperCLOVA(2,040 亿)、Yuan 1.0(2,460 亿)、Ernie 3.0 Titan(2,600 亿)、Pan-Gu(2,000 亿)、Megatron Turing-NLG(1,370 亿)。

Closed for 15 months: community-driven open sourcing of DALL-E et al.

第二张是文生图:从 DALL-E(2021 年 1 月)到开源复现,用了 15 个月。这条线上开源的是 DALL-E mini(2022 年 6 月)51和 Stable Diffusion(2022 年 8 月)52,中间夹着闭源的 Make-a-Scene(3 月)、DALL-E 2(4 月)、Imagen(5 月)、CogView2(6 月)、Parti(7 月)。

Closed for 35 months: community-driven open sourcing of AlphaFold et al.

第三张是蛋白质结构,窗口期最长:从 AlphaFold 1(2018 年 8 月)到 AlphaFold 2(2021 年 7 月)之间隔了 35 个月。这条线上有 ESM(2019 年 4 月)、ESM-1B、RoseTTAFold(2020 年 11 月)、OpenFold 和 ESM-2(2022 年 8 月)。作者提醒:这里列出的模型不一定是复刻品,也可能是改进版本或独立开发的成果。

LLM 给机器人装上常识

LLMs empower robots to execute diverse and ambiguous instructions

得益于覆盖面极广的能力,LLM 原则上可以通过用自然语言解释步骤,让机器人完成任何任务。但 LLM 对机器人所处环境和自身能力几乎没有上下文认知,导致它给出的解释对机器人通常不可执行。PaLM-SayCan 解决了这个问题53

  • 给定一句含糊的指令「我把饮料洒了,能帮我一下吗?」,经过精心 prompt engineering 的 LLM(比如 Google 的 PaLM)能想出一串抽象步骤:去拿一块海绵递给你。但每个技能(拿起、放下)都必须是机器人在当前环境下真能做到的(比如机器人得看得见海绵)。
  • 为了激励 LLM 输出可行指令,SayCan 最大化的是「这条指令被机器人成功执行」的似然。
  • 假设机器人能执行一组技能,那么对任意给定指令和状态,系统选择的是这样一个技能:给定补全的概率(限制在可用技能集合内)乘以「给定该补全和当前状态下成功的概率」最大。系统用强化学习训练。
  • 研究者在 7 类语言指令的 101 条指令上测试 SayCan,规划成功率 84%,执行成功率 74%。

SayCan 用 value function 为每个候选技能打分,筛出当前环境下真正可执行的动作
SayCan 用 value function 为每个候选技能打分,筛出当前环境下真正可执行的动作

卷积、Transformer 与「一个模型统治所有」

2021 Prediction: in vision, convolutional networks want a fair fight with transformers…

去年 Vision Transformer(ViT)和其他图像 transformer 作为影像 benchmark 上的 SOTA 登场,一度宣告了 ConvNet 的黄昏。没那么快:Meta 和 UC Berkeley 的工作认为,把 ConvNet 现代化之后,它反而能压过 ViT54

  • 研究者提出 ConvNeXt,一个吸收了 Swin 这类分层视觉 Transformer 近期设计选择、但不使用 attention 层的 ResNet。
  • ConvNeXt 在 ImageNet-1K 和 ImageNet-22K 上与 Swin Transformer、ViT 竞争力相当,并且同样受益于 scale。
  • Transformer 在语言建模里迅速取代了 RNN,但我们不认为 ConvNet 的使用会出现类似的断崖式下跌,尤其是在规模较小的 ML 场景中。
  • 与此同时,我们 2021 年关于「小型 transformer + CNN 混合模型」的预测在 Google 的 MaxViT 上兑现:4.75 亿参数几乎追平(89.53%)CoAtNet-7 的 90.88% ImageNet top-1 准确率。

ConvNeXt 与 Swin Transformer、ViT 在 ImageNet 上的准确率-算力权衡
ConvNeXt 与 Swin Transformer、ViT 在 ImageNet 上的准确率-算力权衡

…but the inevitable vision and language modeling unification continues…

用于在文本上训练 transformer 的自监督技术,现在几乎原封不动地被搬到了图像上,并在 ImageNet-1K 上取得了 SOTA55

  • 基于 transformer 的 autoencoder 语言模型被训练去预测大规模语料中被随机遮盖的词,得到在语言建模任务上 SOTA 的强模型(比如 BERT)。
  • 但遮住句子中的一个词会让句子变得不知所云、构成一个有挑战的任务,而重建图像里随机遮掉的几个像素则因为邻近像素的存在而变得平凡。
  • 解法是:遮掉大块像素(比如 75% 的像素)。Meta 用这个方法加上其他调整(encoder 只看可见 patch,decoder 比 encoder 小很多)预训练 ViT-Huge,再在 ImageNet-1K 上微调,达到该任务最佳的 87.8% top-1 准确率。
  • 自监督学习对计算机视觉并不新鲜(比如 Meta 的 SEER),遮盖技术也不新鲜(Context encoders,以及更近的 SiT)。但这项工作进一步证明了语言里的 SOTA 技术可以无缝迁移到视觉。领域统一还能推得更远吗?

Masked Autoencoder 从遮掉 75% 像素的输入重建原图
Masked Autoencoder 从遮掉 75% 像素的输入重建原图

2021 Prediction:…culminating in a single transformer to rule them all?

在特定任务上训练(监督或自监督)的 transformer 可以通过微调用于更广的任务集合。近期工作则表明,单个 transformer 可以直接、高效地在跨模态的多种任务上训练(multi-task multimodal learning)。

  • 通用多任务多模态模型的尝试至少可以追溯到 Google 的「One model to learn them all」(2017),当时覆盖图像、文本、语音上的 8 个任务。DeepMind 的 Gato 把这件事推到了新的层次:一个 12 亿参数的 transformer,执行机器人、仿真环境、视觉和语言领域的数百个任务56。这部分兑现了我们 2021 年的预测。
  • 他们发现 scaling 会稳定改善模型,但为了低延迟的实机机器人任务,模型被刻意保持「小」。
  • 为了在不同模态上训练,所有数据都被序列化成 token 序列,再嵌入到一个学到的向量空间。模型完全用监督方式训练。
  • 另外,Meta 的 data2vec 在更窄的任务集合上设计了一套跨模态统一的自监督策略,但目前每个模态仍然用各自的 transformer57

Gato 把机器人、游戏、图像、文本任务统一序列化为 token 序列
Gato 把机器人、游戏、图像、文本任务统一序列化为 token 序列

2021 Prediction: transformers for learning in world models in reinforcement learning

2021 年我们预测:「Transformer 取代 RNN 学习 world model,RL agent 借此在大型富游戏环境中超越人类。」日内瓦大学的研究者用一个 GPT 式 transformer 来模拟世界环境,他们的 agent(名为 IRIS)样本效率很高,在 Atari 的 26 个游戏中有 10 个超过了人类表现3。IRIS 也是所有不使用前瞻搜索的方法中最好的一个。

IRIS 的 world model 在 Pong 上的逐像素预测:上排为真实轨迹,下排为世界模型的重建,连记分板更新都模拟对了
IRIS 的 world model 在 Pong 上的逐像素预测:上排为真实轨迹,下排为世界模型的重建,连记分板更新都模拟对了

IRIS 与 SPR、DrQ、CURL、SimPLe 的人类归一化得分对比,均值和四分位均值都明显领先
IRIS 与 SPR、DrQ、CURL、SimPLe 的人类归一化得分对比,均值和四分位均值都明显领先

Transformers are becoming truly cross-modality

2020 年的 State of AI Report 预测 transformer 会走出 NLP、在计算机视觉上达到 SOTA。现在很清楚了,transformer 是通用架构的候选者。 对 2022 年 transformer 相关论文的分析显示了这个架构已经无处不在:语言 81%、视觉 41%、多模态 22%、音频 16%、图 9%、强化学习 7%、时序 5%、生物 2%。

2020 年之前、2021 年、2022 年 transformer 论文在文本、图像、视频、音频、多模态等模态上的占比变化
2020 年之前、2021 年、2022 年 transformer 论文在文本、图像、视频、音频、多模态等模态上的占比变化

NeRF 长成一个独立领域

NeRFs expand into their own mature field of research

开创性的 NeRF 论文发表于 2020 年 3 月。此后方法上的根本性改进和新应用被快速持续地开发出来,光是 2022 年 CVPR 上就有 50 多篇 NeRF 论文58

  • 引用去年报告(第 18 页):给定一张图像的多个视角,NeRF 用多层感知机学习该图像的表示,并渲染出新的视角。它学习的是从每个像素位置和视角方向到该位置颜色与密度的映射。
  • 今年的工作中,Plenoxels 尤其突出:它彻底移除了 MLP,把 NeRF 训练加速了 100 倍59。另一个令人兴奋的方向是用少量视角渲染大规模场景,无论是城市尺度(Block-NeRF 渲染整个旧金山街区)60还是卫星尺度(Mega-NeRF)61
  • 以当前结果的质量和这个领域的进展速度看,我们预计一两年内 NeRF 就会在报告的产业章节中占据显要位置。

NeRF 相关论文数量:2019 年 19 篇,2022 年已发表 930 篇并预计再增 310 篇
NeRF 相关论文数量:2019 年 19 篇,2022 年已发表 930 篇并预计再增 310 篇

AI 进入生物医药:从抗生素到生化武器

Treating bacterial infections by data-driven personalised selection of antibacterial agents

抗菌药耐药很常见,而且常常源自患者体内已经存在的另一种病原体。那么医生该怎么找到既能治好当前感染、又不会让患者变得易受新感染的抗生素?

  • 通过比较 20 万名以上尿路感染或伤口感染患者在用已知抗生素治疗前后的微生物组特征,ML 可以在患者个体层面预测「治疗诱导获得耐药性」的风险62
  • 事实上,尿路感染(UTI)患者如果用了 ML 系统不会推荐的抗生素,耐药性显著增加。UTI 患者和伤口感染患者如果按 ML 系统的建议开药,复发感染都会大幅减少。

按 ML 推荐用药与实际用药相比,耐药获得率与再感染率的差异
按 ML 推荐用药与实际用药相比,耐药获得率与再感染率的差异

Interpreting small molecule mass spectra using transformers

串联质谱(MS/MS)常用于代谢组学,即研究生物样本中的小分子。由于自然界的化学空间大部分未知,能从谱库中被识别出来的小分子不到 10%。 Transformer 让代谢混合物中分子的快速、准确、in silico 表征成为可能,从而让生物标志物和天然产物药物发现能够规模化。

  • 能从参考谱库中识别出来的生物样本非常少。
  • 属性预测型 transformer 在直接从 MS/MS 预测一系列医药相关化学性质(溶解度、成药性、可合成性)上表现更好,而且不需要中间的结构预测,也不需要查参考库。

代谢物从生物样本提取分离到质谱谱图的完整流程
代谢物从生物样本提取分离到质谱谱图的完整流程

直接从质谱预测化学性质,property transformer 在 drug likeness 和合成可及性上的 r² 达到 0.7 和 0.8,参考库检索只有 0.21 和 0.45
直接从质谱预测化学性质,property transformer 在 drug likeness 和合成可及性上的 r² 达到 0.7 和 0.8,参考库检索只有 0.21 和 0.45

Drug discovery, the flagship “AI for good” application, is not immune to misuse

Collaborations Pharmaceuticals 和伦敦国王学院的研究者证明,为治疗用途设计的机器学习模型可以被轻易改造去生成生化武器63

  • 研究者原本训练他们的 MegaSyn 模型去最大化生物活性、最小化毒性。要设计有毒分子,他们保留同一个模型,只是改成同时最大化生物活性和毒性。他们用的是公开的类药分子数据库。
  • 他们把模型导向生成神经毒剂 VX,那是已知毒性最强的化学战剂之一。
  • 不过和常规药物发现一样,找到预测毒性高的分子,不代表容易把它做出来。但随着 AI 参与的药物发现被急剧改善,我们可以想象药物发现的最佳实践扩散到廉价生化武器的制造上。

MegaSyn 生成分子(红)与已知 LD50 数据集(蓝)在 t-SNE 空间的分布,VX 位于生成分子的簇中
MegaSyn 生成分子(红)与已知 LD50 数据集(蓝)在 t-SNE 空间的分布,VX 位于生成分子的簇中

生成分子的预测 LD50 分布,红线是 VX 的位置,落在红线左边的那批分子被模型判定为比 VX 更毒
生成分子的预测 LD50 分布,红线是 VX 的位置,落在红线左边的那批分子被模型判定为比 VX 更毒

中美 AI 研究产出对比

Comparing machine learning tasks in Chinese vs. US papers

与美国的 AI 研究相比,中国论文更集中在与监控相关的任务上,包括自主性、目标检测、跟踪、场景理解、动作识别和说话人识别。

中美论文中机器学习任务的相对频率差异,红色为中国更常见、蓝色为美国更常见
中美论文中机器学习任务的相对频率差异,红色为中国更常见、蓝色为美国更常见

数据模态上的中美差异:图像、多模态、视频在中国论文里更常见,文本则明显偏向美国
数据模态上的中美差异:图像、多模态、视频在中国论文里更常见,文本则明显偏向美国

While US-based authors published more AI papers than Chinese peers in 2022, China and Chinese institutions are growing their output at a faster rate

2022 年美国作者发表的 AI 论文数量仍多于中国同行,但中国和中国机构的产出增速更快:中国机构同比增幅达到 +27%、+13%、+13%、+11%,而美国这边有 +11%、+24%、+10%、+4%,也有 -2% 的下滑。

2022 年各机构 AI 论文发表数量及相对 2021 年的变化
2022 年各机构 AI 论文发表数量及相对 2021 年的变化

按国家看,美国约 11,000 篇仍居首,中国约 7,000 篇,英国以约 2,000 篇排第三
按国家看,美国约 11,000 篇仍居首,中国约 7,000 篇,英国以约 2,000 篇排第三

The China-US AI research paper gap explodes if we include the Chinese-language database, China National Knowledge Infrastructure

如果把中文数据库 CNKI(中国知网)也算进来,中美论文数量差距会直接爆炸:自 2010 年以来,中国机构发表的论文数量是美国机构的 4.5 倍64

各国 AI 论文数量,中国一栏中紫色部分为仅收录在 CNKI 的中文论文
各国 AI 论文数量,中国一栏中紫色部分为仅收录在 CNKI 的中文论文

03 Industry

Industry 进展总结

  • NVIDIA 的护城河比想象中更宽:论文里 GPU 的使用次数比 ASIC 多 131 倍,比 Graphcore、Habana、Cerebras、SambaNova、寒武纪加起来多 90 倍;收购 Arm 失败,但交易期间企业价值反而涨了 2,950 亿美元。
  • 顶级 AI 实验室的人才开始大规模外流创业,Transformer 论文的 8 位作者只剩 1 位还在 Google,与此同时 Meta 解散了运行近 10 年的中心化 AI 研究组织。
  • 2022 年 AI 融资随大盘降温,预计全年比去年少 36%,跌幅集中在 1 亿美元以上的大轮次,但仍高于 2020 年水平。

NVIDIA 与 AI 芯片挑战者

Do upstart AI chip companies still have a chance vs. NVIDIA’s GPU?

NVIDIA 2021 财年数据中心收入 106 亿美元。2021 年第四季度确认收入 32.6 亿美元,年化后就超过了排名前三的 AI 半导体初创公司估值总和。NVIDIA 平台上有超过 300 万开发者,最新的 H100 世代芯片预计比 A100 提供 9 倍的训练性能65。与此同时,Cerebras(41 亿美元估值)、SambaNova(51 亿美元)、Graphcore(28 亿美元)的收入数字都没有公开。

NVIDIA’s chips are the most popular in AI research papers…and by a massive margin

GPU 在 AI 论文中被使用的频率是 ASIC 的 131 倍,是 Graphcore、Habana、Cerebras、SambaNova、寒武纪加起来的 90 倍,是 Google TPU 的 78 倍,是 FPGA 的 23 倍66

各类 AI 芯片在论文中被提及次数的对比(对数坐标)
各类 AI 芯片在论文中被提及次数的对比(对数坐标)

For NVIDIA, the V100 is most popular, and Graphcore is most used amongst challengers

2017 年发布的 V100 是 NVIDIA 的主力芯片,其次是 2020 年发布的 A100,H100 则是 2022 年最受期待的产品。在主要的 AI 芯片挑战者中,Graphcore 被引用的次数最多

各型号 NVIDIA 显卡被论文引用的次数:V100 从 2018 年的 353 次涨到 2022 年的 6,612 次,A100 正在快速追赶
各型号 NVIDIA 显卡被论文引用的次数:V100 从 2018 年的 353 次涨到 2022 年的 6,612 次,A100 正在快速追赶

Habana、Graphcore、Cerebras、SambaNova、寒武纪在论文中被引用次数的逐年变化
Habana、Graphcore、Cerebras、SambaNova、寒武纪在论文中被引用次数的逐年变化

NVIDIA fails to acquire Arm and grows its revenue 2.5x and valuation 2x during the deal

这笔以 400 亿美元宣布的收购,最终因为巨大的地缘政治和反垄断阻力告吹。但在交易存续期间,NVIDIA 的企业价值涨了 2,950 亿美元(!!)——收入从 109 亿涨到 269 亿(2.5 倍),股价从 120 涨到 240(2 倍)67

从宣布收购到交易取消期间 NVIDIA 的股价与收入曲线
从宣布收购到交易取消期间 NVIDIA 的股价与收入曲线

NVIDIA reaps rewards from investing in AI research tying up hardware and software

NVIDIA 多年来在 AI 研究上投入巨大,在成像方向产出过一些最好的工作。比如他们最新的视角合成工作刚拿下 SIGGRAPH 最佳论文奖。但 NVIDIA 更进一步:把强化学习工作应用到了自家下一代 AI 芯片 H100 GPU 的设计上68

PrefixRL 设计的电路(左)比 EDA 工具方案(右)面积小 25%
PrefixRL 设计的电路(左)比 EDA 工具方案(右)面积小 25%

64 位加法器在面积-延迟平面上的对比,PrefixRL 的帕累托前沿整体压在 EDA 工具之下
64 位加法器在面积-延迟平面上的对比,PrefixRL 的帕累托前沿整体压在 EDA 工具之下

算力军备竞赛与大厂结盟

David teaming up with Goliath: training large models requires compute partnerships

超大规模云厂商和挑战者算力提供方正在积累大额 AI 算力合作,最有名的是微软对 OpenAI 的 10 亿美元投资。此外还有 AWS 与 Anthropic 围绕 Trainium 的合作69、Oracle 与 NVIDIA 和 Adept 的合作70我们预计还会有更多。

In a gold rush for compute, companies build bigger than national supercomputers

「我们认为最大的好处会归于拥有最大计算机的人。」——Greg Brockman,OpenAI CTO

Meta 的 RSC71(以及与 Azure 的合作72)、特斯拉的 Dojo、NVIDIA 的 Selene 和 EOS73、Stability 的 4,000 张 A10074,这些私营算力集群的 GPU 数量已经超过了 Leonardo、Perlmutter、JUWELS、Polaris、MeluXina、Narval、Karolina、Tursa、Jean Zay、MareNostrum 这些国家级超算。

各集群的 A100 GPU 数量,按公有云、私有云与国家级 HPC 着色
各集群的 A100 GPU 数量,按公有云、私有云与国家级 HPC 着色

已经公布的 H100 集群:NVIDIA Eos 4,608 张,欧盟 MareNostrum 5 预计 4,500 张
已经公布的 H100 集群:NVIDIA Eos 4,608 张,欧盟 MareNostrum 5 预计 4,500 张

政府采购的复利效应

The compounding effects of government contracting in AI

1962 年,美国政府买下了全世界所有的集成电路,极大推动了这项技术及其终端市场的发展。现在一些政府又在提供同样的机会,成为 AI 公司的「第一买家」(buyers of first resort)75。拿到独特的高质量数据后,这些公司在构建消费级或企业级 AI 软件时会获得优势。

  • 研究者考察了中国的人脸识别 AI 公司,证明了它们签下的政府合同数量与其累计产出的通用 AI 软件量之间存在因果关系76。不出所料,计算机视觉领域的领导地位现在很大程度上已经让给了中国公司。
  • 这个原理在其他强监管行业同样成立,比如国防或医疗——它们通过独特数据建立起的专长,是可以迁移到日常 AI 产品上的。

2014 年以来中国 AI 发展的三条曲线:全球企业 AI 投资占比、AI 软件重大升级、政府人脸识别合同
2014 年以来中国 AI 发展的三条曲线:全球企业 AI 投资占比、AI 软件重大升级、政府人脸识别合同

大厂拿消费级语言模型产品怎么办

How should big tech deal with their language model consumer products?

Meta 在 2022 年 8 月免费公开发布聊天机器人 BlenderBot3,结果因为机器人满嘴错误信息而遭遇灾难性的媒体反馈。与此同时,2021 年 5 月就发表了 LaMDA 论文的 Google 选择把系统留在内部。但在 BlenderBot 发布几周后,Google 宣布了一个更大的计划「AI test kitchen」,让普通用户能与包括 LaMDA 在内的最新 AI agent 交互77

  • 把 AI 系统大规模放给 Google 和 Facebook 的十亿级用户,几乎必然会让这些系统的每一个伦理或安全问题都被暴露出来,不管是偶然还是被对抗性地问出来。但只有让这些系统被广泛使用,这些公司才能修复问题、理解用户行为、创造有用且可盈利的系统。
  • 为了躲开这个两难,LaMDA 论文的 4 位作者去创办或加入了 Character.AI,这家公司自称「一家创造革命性开放式对话应用的 AI 公司」78。值得持续关注。

BlenderBot3 的对话界面截图
BlenderBot3 的对话界面截图

Google AI Test Kitchen 的界面:用户输入「Imagine I’m at Saturn’s Rings」来试用 LaMDA
Google AI Test Kitchen 的界面:用户输入「Imagine I’m at Saturn’s Rings」来试用 LaMDA

顶级 AI Lab 的人才外流

DeepMind and OpenAI alums form new startups and Meta disbands its core AI group

曾被认为不可撼动的一线 AI 实验室,人才正在挣脱束缚、走向创业。这些校友们在做 AGI、AI safety、生物科技、金融科技、能源、开发工具和机器人。另一边,Meta 在让自己的中心化 AI 研究组织脱离产品路线图压力自由运行了近 10 年后,把它折叠掉了——Meta 的结论是「虽然这个 [AI] 组织的中心化性质在某些方面给了我们杠杆,但也让它难以像我们期望的那样深度融入业务」。

Attention is all you need… to build your AI startup

那篇引入 transformer 的里程碑论文,8 位作者中除了 1 位以外全部离开 Google 去创业了,方向涵盖 AGI、对话智能体、AI-first 生物科技和区块链。2022 年他们的融资额:Anthropic 5.8 亿美元79、Inflection 2.25 亿美元80、Cohere 1.25 亿美元81、Adept 6,500 万美元82

「Attention Is All You Need」论文首页的作者名单
「Attention Is All You Need」论文首页的作者名单

AI 编程助手快速商业化

AI coding assistants are deployed fast, with early signs of developer productivity gains

OpenAI 的 Codex 从研究(2021 年 7 月)到公开商业化(2022 年 6 月)走得非常快,(微软的)GitHub Copilot 现已公开发售,每月 10 美元或每年 100 美元83。亚马逊随后在 2022 年 6 月宣布 CodeWhisperer 进入预览84。Google 透露自己在用一个内部的 ML 代码补全工具(所以也许再过几年就会出现在浏览器 IDE 里?)85。与此同时,拥有 100 万以上用户的 tabnine 融资 1,500 万美元,主打准确的多行代码补全86

Google 内部工具的指标(用户为 1 万多名 Google 内部开发者,多行实验为 5 千多名):

指标 单行 多行
ML 贡献的代码占比 2.6% 0.6%
每次接受的平均字符数 21 73
接受率(可见超过 750ms 的建议) 25% 34%
编码迭代时长缩短 6% -

GitHub Copilot 的对照实验:95 名开发者中,用 Copilot 的一组完成率 78%、平均耗时 1 小时 11 分,未用的一组为 70% 和 2 小时 41 分
GitHub Copilot 的对照实验:95 名开发者中,用 Copilot 的一组完成率 78%、平均耗时 1 小时 11 分,未用的一组为 70% 和 2 小时 41 分

Copilot 用户的主观感受:88% 认为自己更高产,96% 认为处理重复任务更快,74% 觉得能把精力放在更值得做的事上
Copilot 用户的主观感受:88% 认为自己更高产,96% 认为处理重复任务更快,74% 觉得能把精力放在更值得做的事上

AI 药物研发进入临床

AI-first drug discovery companies have 18 assets in clinical trials, up from 0 in 2020

AI-first 药物研发公司现在有 18 个资产处于临床试验阶段,而 2020 年是 0 个。 早期发现阶段的资产还要多得多。我们预计从 2023 年起会看到早期临床读出数据(数据截至 2022 年 8 月 26 日)。

各家 AI 药物研发公司在各管线阶段的资产数量
各家 AI 药物研发公司在各管线阶段的资产数量

所有资产按阶段的整体分布:Early Discovery 占 80%,Late Discovery 10%,Phase 1 只有 5%
所有资产按阶段的整体分布:Early Discovery 占 80%,Late Discovery 10%,Phase 1 只有 5%

Can AI and compute bend the physical reality of clinical trial chokepoints?

一项覆盖 2011–2020 年间 6,151 次成功阶段跃迁的研究发现,一款药物平均需要 10.5 年才能获得监管批准,其中 I 期 2.3 年、II 期 3.6 年、III 期 3.3 年、监管阶段 1.3 年。更麻烦的是,招募一名临床试验患者平均要花 6,500 美元,而由于 30% 的患者最终会因不依从而退出,全负荷的招募成本接近每位患者 19,500 美元87AI 承诺更好更快的药物,但我们今天首先得解决临床试验的物理瓶颈88

ClinicalTrials.gov 上登记的研究数量从 2001 年起逐年增长,2022 年逼近 45 万项
ClinicalTrials.gov 上登记的研究数量从 2001 年起逐年增长,2022 年逼近 45 万项

各阶段的推进成功率:Phase I 到 II 是 52%,Phase II 到 III 只剩 29%,报批到获批则有 91%
各阶段的推进成功率:Phase I 到 II 是 52%,Phase II 到 III 只剩 29%,报批到获批则有 91%

语言模型预测病毒变种,影像诊断拿到自主认证

Predicting the evolution of real-world covid variants using language models

mRNA 疫苗龙头 BioNTech 与企业 AI 公司 InstaDeep 合作构建并验证了一套早期预警系统(EWS)来预测高风险变种89这套 EWS 能识别出全部 16 个 WHO 认定的变种,平均比官方认定早一个半月以上90

  • 一个大型预训练蛋白质语言模型在变种的病毒刺突蛋白序列上训练。
  • 新的刺突蛋白变种被送入 transformer,输出 embedding 以及每个位点上 20 种天然氨基酸的概率分布,用以判断这会如何影响免疫逃逸和适应度。
  • 图中红色虚线是 EWS 预测该变种为高风险的日期,绿色点划线是 WHO 认定的日期。几乎所有情况下,EWS 都提前数月发出了警报。

各变种的 EWS 预警时间(红色虚线)与 WHO 认定时间(绿色点划线)对比
各变种的 EWS 预警时间(红色虚线)与 WHO 认定时间(绿色点划线)对比

The first regulatory approval for an autonomous AI-first medical imaging diagnostic

立陶宛初创公司 Oxipit 拿到了业内第一张自主运行的计算机视觉诊断认证91。这套系统会对没有异常的胸片自主出具报告,放射科医生不需要再看它们。

  • 由于放射科医生短缺、影像量不断增加,判断哪些 X 光片有病变、哪些没有,本身就是一项有挑战的诊断任务。
  • Oxipit 的 ChestLink 是一套负责识别「正常」扫描的计算机视觉系统。
  • 系统在超过 100 万张多样化图像上训练。在一项针对 1 万张芬兰基层医疗患者胸片的回顾性研究中,AI 识别临床显著病变的敏感度达到 99.8%,特异度为 36.4%92
  • 也就是说,AI 可以可靠地从基层医疗数据集中移除 36.4% 的正常胸片,假阴性数量极少,实际上不损害患者安全,同时显著减少工作量。

ChestLink 的工作流:判定为正常的胸片自动生成报告,其余交给放射科医生
ChestLink 的工作流:判定为正常的胸片自动生成报告,其余交给放射科医生

大学 spinout:AI 创业公司的温床与陷阱

Universities are a hotbed for AI spinouts: the UK case study

大学是 AI 公司的重要来源,Databricks、Snorkel、SambaNova、Exscientia 等都出自大学。在英国,4.3% 的 AI 公司是大学 spinout,而所有英国公司这一比例只有 0.03%93。AI 确实是 spinout 形成最集中的行业之一。但这有一个昂贵的代价:技术转移办公室(TTO)谈出来的 spinout 条款往往对创始人极不友好,比如占股比例过高或对销售收取版税94

英国各大学的 spinout 数量(柱)与大学中位持股比例(线)
英国各大学的 spinout 数量(柱)与大学中位持股比例(线)

英国大学在 spinout 中的平均持股比例十年间的变化,从 2012 年的 25.7% 降到 2021 年的 20.6%
英国大学在 spinout 中的平均持股比例十年间的变化,从 2012 年的 25.7% 降到 2021 年的 20.6%

spinout 数量最多的行业:制药 282 家、科研工具与试剂 257 家、分析工具 205 家
spinout 数量最多的行业:制药 282 家、科研工具与试剂 257 家、分析工具 205 家

新兴行业里 spinout 最多的是 AI,138 家,是第二名精准医疗的两倍
新兴行业里 spinout 最多的是 AI,138 家,是第二名精准医疗的两倍

Spinout.fyi: an open database to help founders and policymakers fix the spinout problem

Spinout.fyi 众包了一个来自全球 70 多所大学创始人的 spinout 条款数据库95。数据库涵盖 AI 和非 AI 公司、不同产品品类(软件、硬件、医疗、材料等),显示英国的情况虽然对创始人格外劝退,但并不孤立。只有少数地区显得对创始人友好,比如北欧和瑞士(尤其是 ETH Zürich)。造成当前局面的一个主要原因是创始人与 TTO 之间的信息不对称,而 spinout.fyi 数据库正是要在这个过程中给创始人一点筹码。

各校 spinout 体验的净推荐值:UCL -26、牛津 -6、剑桥 -5,ETH Zürich +14
各校 spinout 体验的净推荐值:UCL -26、牛津 -6、剑桥 -5,ETH Zürich +14

谈完 spinout 所需的时间:只有 29% 能在 3 个月内搞定,67% 掉进 6 个月以上的「danger zone」
谈完 spinout 所需的时间:只有 29% 能在 3 个月内搞定,67% 掉进 6 个月以上的「danger zone」

大学在 spinout 成立时的平均持股:美国 5.9%、欧盟 7.3%,英国高达 19.8%
大学在 spinout 成立时的平均持股:美国 5.9%、欧盟 7.3%,英国高达 19.8%

As 5-year programmes in Berkeley and Stanford wrap up, what comes next?

2011 年,UC Berkeley 启动了「Algorithms, Machines, and People」(AMPLab),这是一个由研究机构和企业支持、教授与学生共同参与的 5 年期协作研究议程96。这个项目著名地开发出了大数据关键技术 Spark(分拆为 Databricks,380 亿美元估值)以及 Mesos(分拆为 Mesosphere)。

这个极其成功的项目在 2017 年得到了续作:Berkeley 的 RISELab(Real-time Intelligence Secure Explainable Systems)97和 Stanford 的 DAWN(Data Analytics for What’s Next)98,两者都聚焦 AI 技术。RISELab 创造了 Ray 这个 ML 负载管理器(分拆为 Anyscale,10 亿美元估值),DAWN 则创造并分拆出了主动标注平台 Snorkel(10 亿美元估值,融资 2.5 亿美元)。其他大学和国家会从这套 5 年制模型的成功中学到东西,去资助有高分拆潜力的雄心勃勃的开源研究吗?

2022 年 AI 融资降温

In 2022, investment in startups using AI has slowed down along with the broader market

使用 AI 的私营公司预计 2022 年融资额比去年少 36%,但仍有望超过 2020 年水平99。这与全球所有初创和成长期公司的投资情况可比——后者预计下降 24%。

  • 使用 AI 的公司:2021 年 1,114 亿美元 → 2022 年预计 709 亿美元(2020 年为 475 亿美元)。
  • 所有初创和成长期公司:2021 年 7,265 亿美元 → 2022 年预计 5,532 亿美元。

The drop in investment is most noticeable in megarounds

投资下滑最明显的是 1 亿美元以上的大轮次(-55%),而更小的轮次预计全年在全球达到 309 亿美元,几乎与 2021 年持平(-9%)。

Public valuations have dropped in 2022, while private keep growing

公开市场使用 AI 的公司合计企业价值(EV)已经跌回 2020 年水平(-29%,从 9.6 万亿降至 6.8 万亿美元),而私营公司的估值还在涨,合计 EV 已达 2.2 万亿美元,比去年增长 16%。

The US leads by the number of AI unicorns, followed by China & the UK

美国已经创造了 292 家 AI 独角兽,合计企业价值 4.6 万亿美元。之后是中国(1.4 万亿美元)、英国(2,070 亿美元)、以色列(530 亿美元)、德国(560 亿美元)、新加坡(390 亿美元)、瑞士(140 亿美元)、加拿大(120 亿美元)。

Investment in the USA accounts for more than half of the worldwide VC

尽管美国 AI 公司的融资额显著下滑,美国仍占全球 AI 投资的一半以上:2022 年 YTD 为 53%,2021 年为 57%。2022 年 YTD 数据:美国 251 亿美元、中国 89 亿美元、欧盟 27 国 + 瑞士 + 挪威 75 亿美元、英国 38 亿美元。

Enterprise software is the most invested category globally, while robotics captures the largest share of VC investment into AI

按 2010–2022 YTD 累计投资额,企业软件是全球投资最多的品类(1,337 亿美元),之后是交通运输(1,095 亿美元)、金融科技(878 亿美元)、健康(617 亿美元)、机器人(489 亿美元)。但按「AI 公司融资额占该行业全部 VC 的比例」看,机器人以 71% 高居榜首,其次是半导体 41%、食品 24%、旅游 24%、营销 25%、安全 13%。

Acquisitions are on track to exceed the 2021 level

IPO 和 SPAC IPO 数量急剧下滑,但并购数量有望超过 2021 年水平100。2022 年的大额交易包括:房地产技术与数据分析公司 131 亿美元被收购(5 月)、规划与预测 SaaS 107 亿美元被买断(3 月)、客户体验工具 102 亿美元买断(6 月)、税务合规软件 84 亿美元买断(8 月)、消费机器人公司 17 亿美元被收购(8 月)。

The number of exits in EU-27, Switzerland & Norway has already exceeded 2021 levels

美国至今 108 笔退出,还不到 2021 年的一半,而欧盟 27 国、瑞士和挪威合计已经超过了 2021 年的数字。

Investment in SaaS startups & scaleups using AI is expected to reach $41.5B by the end of the year

使用 AI 的 SaaS 公司预计全年融资 415 亿美元,比去年下降 33%,但仍高于 2020 年(311 亿美元)

The combined EV of public and private SaaS startups & scaleups using AI now amounts to $2.3T

使用 AI 的 SaaS 公司(含上市和未上市)合计企业价值现在是 2.3 万亿美元,比去年下降 26%,但仍高于 2020 年(2.1 万亿美元)

The combined EV of private SaaS startups & scaleups using AI keeps growing

私营 AI SaaS 公司的合计 EV 还在涨,已达 1.1 万亿美元,比去年增长 12%。 估值最高的几家:Stripe(金融基础设施平台,美国,684 亿美元)、Checkout.com(全球支付,英国,400 亿美元)、Databricks(统一数据、分析与 AI 的 lakehouse 平台,美国,380 亿美元)、自动驾驶技术公司(美国,300 亿美元)、在线教育平台(中国,155 亿美元)、Fintech-as-a-service 平台(英国,150 亿美元)、流程挖掘软件(德国,130 亿美元)、AI 写作助手(美国,130 亿美元)。

04 Politics

Politics 进展总结

  • 大规模 AI 实验中学术界的占比已经从约 60% 跌到接近 0%,算力鸿沟已经难以弥合。
  • 接力棒交给了去中心化研究集体:Eleuther、BigScience、Stability 用非传统资金做出了原本被认为只有大厂才做得出的成果。
  • 芯片成为地缘政治的正面战场:CHIPS 法案投入 2,500 亿美元,美国禁止 NVIDIA 和 AMD 向中国出口最先进 AI 芯片。

学术界与工业界的算力鸿沟

A widening compute chasm is separating industry from academia in large model AI

过去十年,大规模 AI 实验的算力需求增长了 30 万倍以上。同一时期,由学术界主导的这类项目占比从约 60% 暴跌到接近 0%101。如果 AI 社区要继续扩大模型规模,这道「有」与「没有」的鸿沟会给 AI 安全、思路多样性、人才集中度等带来严重挑战。

大规模 AI 实验的算力增长曲线,与学术界主导项目占比的下滑
大规模 AI 实验的算力增长曲线,与学术界主导项目占比的下滑

Slow progress in providing academics with more compute leaves others to act faster

人们越来越意识到,AI 是一门工程科学——研究对象必须先被造出来。西方学术界和政府开始正视这一现实,最显著的是美国的 National AI Research Resource(NAIRR)流程。但在花了数年时间做咨询和宣传的同时,中国和学术界之外的其他人正在用有创意的方式做大规模 AI 项目。

对比很扎眼:政府/学术界这条线上是 National AI Initiative Act 生效、NAIRR 工作组成立、开了 10 次会、Stanford 成立基础模型研究中心、清华的 GLM-130B;研究集体那条线上是 Eleuther 的 The Pile、GPT-Neo、GPT-J-6B、GPT-NeoX-20B,BigScience 的 BLOOM-178B,以及 Stability 的 Stable Diffusion。

The baton is passing from academia to decentralized research collectives

去中心化研究项目正在获得成员、资金和势能。它们成功完成了此前被认为只有大型中心化科技公司才可能做到的大规模模型和数据项目,最显眼的例证就是 Stable Diffusion 的公开发布102

  • 今年最值得注意的大规模学术项目来自中国:清华的 GLM-130B。
  • Eleuther 这个最早的 AI 研究集体发布了 200 亿参数的 GPT-NeoX。不过核心成员此后陆续去了 OpenAI、Stability 和 Conjecture。
  • Hugging Face 主导的 BigScience 计划发布了 1,780 亿参数的多语言 LLM BLOOM。
  • Stability 凭空杀出,搞到 4,000 张 A100 GPU,把多个开源社区聚到一起,做出了 Stable Diffusion。

2012–2022 年大规模 AI 成果按主体分类(研究集体 / 产业合作 / 学术界)的逐年数量
2012–2022 年大规模 AI 成果按主体分类(研究集体 / 产业合作 / 学术界)的逐年数量

Stability AI is attempting a new paradigm in commercializable open-source AI

此前大规模项目只能依赖临时性的算力捐赠,Stability 正在开创一种新做法:为开源社区提供结构化的算力和资源,同时把这些项目商业化并与开发者分成

  • Stability 已经把自己嵌入成独立和学术开源 AI 社区的算力平台:支持 LAION 构建 50 亿图文对的数据集并训练开源 CLIP 模型,支持 CompVis 组在高效 diffusion model 上的研究。它资助博士生做社区项目,并直接雇佣了生成式 AI 艺术家、Eleuther 的核心成员以及 David Ha 这样的知名 ML 研究者。
  • Stable Diffusion 的训练成本不到 60 万美元,权重公开发布的同时,也通过 DreamStudio API 售卖访问权103

AI 在国防领域的渗透与融资

AI continues to be infused into a greater number of defense product categories

国防技术公司正在把 AI 应用到电子战、地理空间传感器融合,以及自主硬件平台上。

  • 2018 年成立的 Epirus 造出了新一代电磁脉冲武器,能击溃威胁人身安全的无人机蜂群104。瑞典的 Saab 也在推动电子战的 AI 自动化:他们构建的 COMINT 和 C-E.SM 传感器可以根据战场态势在自动化与操作员控制之间平衡105。该公司还在与国防初创公司 Helsing 合作。
  • 2020 年成立的 Modern Intelligence 构建平台无关的 AI,用于地理空间传感器数据融合、态势感知和海上监视。
  • Anduril 则通过内生和外延两种方式扩张自主硬件平台。比如收购 Area-I 后推出了 Air Launched Effects 新产品 Altius-700,载荷更大、支持与其他无人机的数据共享与集成106。Anduril 还通过收购 Dive Technologies 进入了水下自主航行器领域。

AI in defense gathers big funding momentum

重金加持的初创公司,加上亚马逊、微软和 Google,正在继续让 AI 在国防中的使用常态化。

  • NATO 发布了自己的 AI 战略,并宣布设立 10 亿美元基金投资各类军民两用技术公司,被形容为全球第一支「多主权风险投资基金」,横跨 22 个国家107
  • 欧洲国防 AI 公司 Helsing 宣布了由 Spotify 的 Daniel Ek 领投的 1.025 亿欧元 A 轮108
  • 微软、亚马逊和 Google 继续争夺国防领域的重要角色——最著名的是微软与五角大楼的 100 亿美元合同在亚马逊起诉后被取消,新的受益方将在 2022 年底公布。
  • Anduril 拿下了迄今为止最大的一笔国防部合同,据报道估值已达 70 亿美元109
  • 军用无人机开发商 Shield AI 以 23 亿美元估值完成融资110

Ukraine’s homegrown geospatial intelligence GIS Arta software is a sign of things to come

据报道,地理空间(GIS)软件的使用把炮兵的决策链从 20 分钟压缩到了 1 分钟以内111

  • GIS Arta 是一款在俄罗斯入侵之前就基于顿巴斯冲突经验开发的本土应用。
  • 它是一套用于无人机、炮兵或迫击炮打击的制导指挥控制系统。
  • 这个应用摄入各种形式的情报(来自无人机、GPS、前沿观察员等),并转换成侦察和炮击的调度请求。
  • GIS Arta 据称是由 Yaroslav Sherstyvk 带领的一支志愿软件开发者团队开发的,灵感来自 Uber 的打车模型。

GIS Arta 的工作流程图解:从侦察发现目标到火力单元执行打击
GIS Arta 的工作流程图解:从侦察发现目标到火力单元执行打击

芯片回流与 CHIPS 法案

The Great Reshoring will be slow: US lags in new fab projects, which take years to build

1990 年到 2020 年间,中国的新建晶圆厂项目产出加速了近 7 倍,而美国放慢了 2.5 倍。而且,中国和台湾的晶圆厂从开工到具备量产条件大约需要 650 天,美国今天建厂的速度比 30 年前慢了 42%112

三个十年间中国、美国、台湾的新建晶圆厂项目数量:中国从 14 座增至 95 座,美国从 55 座降至 22 座
三个十年间中国、美国、台湾的新建晶圆厂项目数量:中国从 14 座增至 95 座,美国从 55 座降至 22 座

从开工到投产的平均天数:中国 675 天、台湾 650 天,美国 920 天,比自己 30 年前还慢
从开工到投产的平均天数:中国 675 天、台湾 650 天,美国 920 天,比自己 30 年前还慢

The US CHIPS and Science Act of 2022: $250B for US semiconductor R&D and production

这项两党立法在 2022 年 8 月签署成法。它拿出 530 亿美元支持美国本土的半导体研发、劳动力和制造,并为半导体制造商的资本支出提供 25% 的投资税收抵免113。作为交换,受助方 10 年内不得在中国升级或扩张既有业务,也不能把资金用于股票回购或分红。

  • 这个法案给韩国(如三星)、台湾(如台积电)等地的制造商出了一道难题:如果接受美国补贴,就必须在不激怒北京的前提下从中国转向——而北京明确反对这种「friendshoring」。
  • 法案通过后,美光宣布在存储芯片制造上投资 400 亿美元,把美国市场份额从 2% 提到 10%。高通将在 2027 年前把美国半导体产能扩大 50%,并与 GlobalFoundries 合作投资 42 亿美元扩建后者在纽约州北部的工厂。
  • CSET 估计美国应当把制造能力聚焦在先进制程、传统逻辑和 DRAM 上114

CSET 对美国在各半导体品类上应聚焦程度的评估表
CSET 对美国在各半导体品类上应聚焦程度的评估表

The US cuts China off from NVIDIA and AMD chips…will this spur Chinese AI R&D?

NVIDIA GPU 被所有中国主要科技公司(百度、腾讯等)和大学(清华、中科院等)使用。华盛顿要求 NVIDIA 和 AMD 停止向中国出口最新的 AI 芯片(如 NVIDIA A100 和 H100、AMD M100 和 M200),理由是遏制其用于经由中国威胁美国国家安全的应用115。两家公司还必须提供过往出货统计和客户名单。如果国内供应商不能快速补位,拿不到最先进 AI 芯片可能让中国相当一部分产业停摆。

  • 今年早些时候,CSET 分析了 2020 年中国人民解放军单位和国有国防企业授予的 24 份公开合同。他们发现这些采购订单中的 97 颗 AI 芯片几乎全部由 NVIDIA、AMD、Intel 和 Microsemi 设计,国产 AI 芯片公司一个都没出现。也就是说,美国芯片在武装中国的国防能力116
  • 中国半导体制造商此前已经被切断了 ASML 的先进光刻机以及 Lam Research、Applied Materials 的相关设备。
  • 国产 AI 芯片公司(如壁仞)不太可能填上这个窟窿:先进制程节点制造仍然只有台湾的台积电做得到,而国内的人才、软件和技术距离 NVIDIA 还有数年之遥。中国仍会加速自己的发展117

欧盟推进 AI Act

The EU advances with its plans to regulate AI

2021 年 4 月,欧盟提出了一项针对 AI 系统在欧盟境内投放市场和使用的监管提案,即 AI Act。提案对所有在用的 AI 系统提出了一些最低要求(主要是信息义务),并对给用户带来更高风险的 AI 系统提出了更复杂的要求(风险评估、质量管理)。AI Act 还禁止了某些类型的 AI 技术使用,比如社会评分、实时生物特征远程识别(有例外)、「潜意识技术」。

  • AI Act 正在走欧盟立法流程。欧洲议会整个夏天都在处理各委员会提出的修正案和意见,形成折中文本。折中文本计划在 2022 年底前走完议会的各阶段表决。
  • AI Act 预计将在 2023 年被表决成法,届时轮值主席国是瑞典或西班牙。
  • 目前的现实预期是,AI Act 会在 2023 年下半年生效。

The EU aims at quick operationalization of the AI Act

欧盟希望通过标准化、建设测试设施、启动泛欧和各国监管沙盒,来快速落地 AI Act 的要求。

  • 欧洲标准化工作已经启动。欧盟标准化组织 CEN 和 CENELEC 已经开始准备工作,预计会被要求在 2024 年 10 月 31 日前制定出相关标准集。
  • 欧盟似乎倾向于把对高风险 AI 系统的测试——在受控条件下甚至可能在真实世界条件下——作为促进各类规模企业合规的合适方式。
  • 泛欧和各国监管沙盒开始出现。西班牙在 2022 年 6 月启动了第一个,捷克等其他成员国也宣布了类似计划。监管方把沙盒视为技术、政策和标准化方案的合适试验台,也把它当作帮助中小企业达成 AI Act 合规的媒介。

05 Safety

Safety 进展总结

  • AI Safety 从科幻话题变成了政策文件里的正式条目,英国国家 AI 战略多次提及 AGI 未对齐的长期风险。
  • 共识在移动:69% 的 ML 社区受访者认为 AI Safety 应当被更优先对待,近 40% 的 NLP 研究者认为 AI 可能在本世纪造成核战级别的灾难。
  • 但资源极度失衡:全职做 AI Safety 的研究者约 300 人,全部安全资金加起来甚至比不上 DeepMind 2018 年的运营支出。

灾难性风险从科幻走进政策文件

While AI advances rapidly, the safety of highly-capable future systems remains unclear

虽然很多担忧看起来仍然是思辨性的,但早期的 AI 先驱们就已经认为,未来高能力、深度嵌入经济的 AI 系统可能会灾难性地失败并对人类构成风险,包括出现直接对抗人类监督与控制的行为118

  • 「……一旦机器思考的方法开始,它很可能不需要多久就会超越我们微弱的能力。……因此在某个阶段,我们应当预期机器会接管控制权。」——Alan Turing
  • 「因此,第一台超智能机器是人类需要制造的最后一项发明,前提是这台机器足够温顺,愿意告诉我们如何控制它。」——I.J. Good
  • 「问题在于,面对如此强大的机器,只需要设计上一点点疏忽的意外,它们就会把自己的目标置于我们的目标之上。」——Marvin Minsky119

The UK is taking the lead on acknowledging these uncertain but catastrophic risks

英国 2021 年末发布的国家 AI 战略,罕见地多次提到 AI safety 和未对齐 AGI 带来的长期风险120

  • 「虽然通用人工智能(AGI)的出现听起来像科幻概念,但对 AI safety 和非人类对齐系统的担忧,绝不仅限于这个领域的边缘。」
  • 「我们坚定认为,关注这项技术的演化、认真对待 AGI 与『更通用 AI』的可能性、并主动把技术导向和平且与人类对齐的方向,是至关重要的。」
  • 「政府认真对待未对齐 AGI 的长期风险,以及它会给英国和世界带来的不可预见的变化。」
  • 「[我们必须] 建立中长期的地平线扫描机制,以提高政府对 AI safety 的认知。」
  • 「[我们必须] 与国家安全、国防部门和领先研究者合作,理解如何预判和预防灾难性风险。」

研究者共识、人才与资金

AI researchers increasingly believe that AI safety is a serious concern

长期被主流 AI 研究和学术界当作科幻打发掉的话题,现在共识正在向「更担心近期出现的人类级 AI 和超人类 AGI 的风险」偏移。

  • 一项针对 ML 社区的调查发现,69% 的人认为 AI safety 应当比现在被更优先对待121
  • 另一项针对 NLP 社区的调查发现,多数人认为 AGI 是一个重要问题且我们正在朝它推进。超过 70% 的人认为 AI 会在本世纪带来工业革命级别的社会变化,近 40% 的人认为 AI 可能在这段时间内造成核战争级别的灾难122

NLP 社区调查结果:绿色数字为在表态者中同意该立场的比例,黑色为受访者预测的同意率
NLP 社区调查结果:绿色数字为在表态者中同意该立场的比例,黑色为受访者预测的同意率

AI safety is attracting more talent… yet remains extremely neglected

对 AI 存在性风险认知的提升带来了人手增加,估计现在有约 300 名研究者全职从事 AI safety。但这仍然比整个领域的研究者少几个数量级,而后者正在以前所未有的速度增长123

  • 新的非营利研究实验室包括 Center for AI Safety 和 Fund for Alignment Research。Centre for the Governance of AI 从牛津的 Future of Humanity Institute 分拆为独立机构。
  • 教育项目的兴趣暴涨,超过 750 人参加了在线的 AGI Safety Fundamentals 课程。新设了一些奖学金,包括 Vitalik Buterin PhD Fellowship in AI Existential Safety。
  • 值得注意的是,OpenAI 首席科学家 Ilya Sutskever 已经把 50% 的时间转向安全研究

ICLR、ICML、NeurIPS 的研究者人数与约 300 名全职 AI Safety 研究者的规模对比
ICLR、ICML、NeurIPS 的研究者人数与约 300 名全职 AI Safety 研究者的规模对比

Funding secured, though trailing far behind what goes into capabilities

对 AI 存在性风险认知的提升也带来了安全研究资金的快速增长,主要来自同情这一议题的科技富豪的捐赠和投资:Dustin Moskovitz(Open Philanthropy)124和 Sam Bankman-Fried(FTX Foundation)125然而,VC 和慈善资金加起来的安全投入仍然远远落后于先进能力研究的资源,甚至比不上 DeepMind 2018 年的运营支出126。(报告把 Adept、Hugging Face、Cohere、AI21、Stability 和 Inflection 的融资算作 Capabilities VC,把 Anthropic 的融资算作 Safety VC。)

安全慈善资金、安全 VC 与 DeepMind 支出、capabilities VC 的规模对比
安全慈善资金、安全 VC 与 DeepMind 支出、capabilities VC 的规模对比

AI 安全慈善资金的逐年构成:2021 年 Open Philanthropy 一家出到 8,000 万美元,2022 年总额回落,但 FTX Future Fund 补上了近一半
AI 安全慈善资金的逐年构成:2021 年 Open Philanthropy 一家出到 8,000 万美元,2022 年总额回落,但 FTX Future Fund 补上了近一半

LLM 对齐:RLHF 与语言反馈

Language Model Alignment: Reinforcement Learning from Human Feedback (RLHF)

RLHF 已经成为微调 LLM 并使其与人类价值对齐的关键方法。 具体做法是:让人类对给定输入下采样出的语言模型输出进行排序,用这些排序学出一个人类偏好的 reward model,再把它当作奖励信号用 RL 微调语言模型。

  • OpenAI 在年初用 RLHF 微调 GPT-3,得到在指令跟随任务上更有帮助的 InstructGPT 模型127。值得注意的是,这次微调只用了不到 GPT-3 预训练算力的 2%,以及 2 万小时的人类反馈。API 用户平均而言更喜欢这些模型而不是原始模型。
  • RLHF 也被 Anthropic 和 DeepMind 用来提升语言模型的 helpfulness、harmlessness 和正确性128OpenAI 已经声明 RLHF 将是其对齐 AGI 长期方案的核心构件129

Anthropic 的 RLHF 模型随参数规模提升的 helpfulness Elo 分数与 harmlessness 偏好率,最大模型已进入专业写手区间
Anthropic 的 RLHF 模型随参数规模提升的 helpfulness Elo 分数与 harmlessness 偏好率,最大模型已进入专业写手区间

DeepMind 的 Sparrow 拒答「怎么给车热线打火」,并说明自己被训练成不给可能违法的建议
DeepMind 的 Sparrow 拒答「怎么给车热线打火」,并说明自己被训练成不给可能违法的建议

Language Model Alignment: Reinforcement Learning from Human Feedback

相比人类使用的语言的完整表达力,RLHF 的 preference model 提供的学习信号是很有限的。NYU 的研究者证明,语言模型可以直接用人类写成语言的反馈来改进130

  • 值得注意的是,他们的方法数据效率极高:仅用 100 条人类反馈样本,他们就把 GPT-3 在摘要任务上的能力微调到了人类水平
  • 在一个「从句子中移除冒犯性词汇」的合成任务上,他们观察到只有最大的 GPT-3 模型才能有效吸收反馈,这又是一个规模带来涌现行为的例子。

用语言反馈改进模型的四步流程:生成输出、人类写反馈、生成并挑选修改稿、用修改稿微调
用语言反馈改进模型的四步流程:生成输出、人类写反馈、生成并挑选修改稿、用修改稿微调

摘要任务上对人类摘要的胜率:用语言反馈微调的 GPT-3 约 50%,InstructGPT 35%,原始 GPT-3 只有 19%
摘要任务上对人类摘要的胜率:用语言反馈微调的 GPT-3 约 50%,InstructGPT 35%,原始 GPT-3 只有 19%

Red teaming 与机制可解释性

Language Model Alignment: Red Teaming

随着语言模型展现出越来越多的能力,穷举评估它们的失败模式变得困难,这阻碍了信任的建立和安全的公开部署。DeepMind 引入了自动化「red teaming」:用其他语言模型自动「攻击」目标语言模型,让它表现出不安全行为,是否不安全由一个单独的分类器判定131

  • Anthropic 用人工 red teaming 评估 RLHF 模型,发现随着模型规模增大,它们更难被攻击、也更少产生有害输出132
  • 未来,分类器可以用来检测诸如权力寻求(power-seeking)行为或恶意编码这类思辨性风险。

Red LM 自动生成攻击性提问,诱导 Target LM 产生冒犯性回答,再由分类器判定
Red LM 自动生成攻击性提问,诱导 Target LM 产生冒犯性回答,再由分类器判定

Anthropic 的 harmlessness 评测:用上 red team 数据的 rejection sampling 与 RLHF 随规模稳定变好,普通 LM 和 prompted LM 一直是负分
Anthropic 的 harmlessness 评测:用上 red team 数据的 rejection sampling 与 RLHF 随规模稳定变好,普通 LM 和 prompted LM 一直是负分

Mechanistic interpretability – can we reverse-engineer neural networks?

把深度神经网络仅仅看作一串矩阵运算时,解释它极其困难。机制可解释性(mechanistic interpretability)研究转而试图把模型逆向工程成人类可读的计算机程序,理解单个神经元以及它们的集体行为133

  • Anthropic 的研究者发布了对小型 transformer 语言模型的重要分析,聚焦一个叫 induction head 的现象:这些注意力头学会复制并补全文本中此前出现过的序列。他们发现这些头在训练的「相变」期间涌现,而 in-context learning 能力也在同一时期出现,并进一步提出假设:这些头可能是大型 transformer 模型中大部分 in-context learning 能力的来源134
  • 这个方向的后续工作还揭示了单个神经元如何对应单个或多个语义特征,以及如何控制这类可解释性。

induction head 实现的模式匹配与复制机制示意
induction head 实现的模式匹配与复制机制示意

目标错误泛化与道德行为评测

Goal misgeneralization – agents can learn the right skills but the wrong objective

使用 RL agent 的一个担忧是,它们可能学会了很强的技能,却没有学会正确的目标,而且这种失败只在测试时的分布偏移下才暴露出来。今年 ICML 上的一篇论文首次在实证上展示了这个问题135

  • Agent 在 CoinRun 视频游戏任务上训练,在这个任务里,到达关卡末尾的金币就能获得奖励并通关。
  • 测试时,金币被随机放在关卡中间。Agent 保持了导航和越障的能力,却无视金币径直冲向关卡末尾——说明它没有学到正确的目标。

CoinRun 训练关卡中金币位于末尾,测试关卡中金币被随机放置
CoinRun 训练关卡中金币位于末尾,测试关卡中金币被随机放置

Measuring moral behavior in artificial agents

研究者发布了一套用于评估 AI 道德行为的序贯决策环境136

  • 未来的人工 agent 可能在大量既不惩罚、甚至还会奖励谋杀和盗窃这类行为的环境上做预训练。
  • Jiminy Cricket 环境在 25 个语义丰富的文字冒险游戏中评估道德行为。Agent 能采取的每一个动作,都在若干道德维度上被标注。
  • 作为第一步,CMPS 使用带有道德知识的语言模型,并把这些知识中介成行动,这大幅减少了训练过程中的不道德行为。

Jiminy Cricket 中被奖励的不良行为、未被奖励的良好行为与未被惩罚的不良行为示例
Jiminy Cricket 中被奖励的不良行为、未被奖励的良好行为与未被惩罚的不良行为示例

CMPS 让训练过程中累积的不道德行为比 CALM 减少 60%,同时任务完成度几乎没有损失
CMPS 让训练过程中累积的不道德行为比 CALM 减少 60%,同时任务完成度几乎没有损失

Conjecture:第一家纯做 AGI 对齐的创业公司

Conjecture is the first well funded startup purely focusing on AGI alignment

与 DeepMind、Google Brain、OpenAI 和其他主要研究实验室不同,Conjecture 主要聚焦 AI Alignment,强调概念性研究和与其他组织「不相关的下注」。

  • Conjecture 是一家伦敦创业公司,由 Connor Leahy 领导,他此前共同创立了 Eleuther——那个开启了大模型去中心化开发的组织。
  • Conjecture 的运作前提是:AGI 会在未来 5 年内被开发出来,并且按当前轨迹会与人类价值未对齐,从而给我们这个物种带来灾难。
  • 他们从 Github、Stripe 和 FTX 的创始人等投资者那里融了数百万美元。
  • 他们是第一个公开发布内部 infohazard 政策的 AI Alignment 团队137
  • 这延续了一个更广的趋势:一些新的 AGI 导向实验室开始更认真地对待对齐研究(参见去年报告对 Anthropic 的介绍)。

06 Predictions

9 predictions for the next 12 months

作者对未来 12 个月的 9 条预测:

  1. DeepMind 训练出一个 100 亿参数的多模态 RL 模型,比 Gato 大一个数量级。
  2. NVIDIA 宣布与一家 AGI 导向的组织建立战略关系。
  3. 一个 SOTA 语言模型在比 Chinchilla 多 10 倍的数据点上训练,验证「数据集 scaling 优于参数 scaling」。
  4. 生成式音频工具出现,并在 2023 年 9 月前吸引超过 10 万名开发者。
  5. GAFAM 向某家 AGI 或开源 AI 公司(如 OpenAI)投资超过 10 亿美元。
  6. 半导体初创公司在 NVIDIA 的统治面前面对现实,某家高知名度初创公司被关停或以低于最近一轮估值 50% 的价格被收购。
  7. 一项「像监管生物安全实验室那样监管 AGI 实验室」的提案,获得英国、美国或欧盟某位民选政治人物的支持。
  8. 随着更多人意识到「让 AI 能力跑在安全前面」的风险,未来一年将有超过 1 亿美元投入专门的 AI Alignment 组织。
  9. 一家主要的用户生成内容网站(如 Reddit)与一家生产 AI 模型的初创公司(如 OpenAI)就在其用户生成语料上训练达成商业和解。

回头看 2022 年这份报告,最准的判断是 diffusion model 和 scaling law 的转向,最迟钝的判断是对芯片初创公司整合的反复押注。有意思的是,报告写完两个月后 ChatGPT 就发布了——这份 10 月 11 日定稿的 deck 里,RLHF 只是 Safety 章节里的一个技术条目,InstructGPT 被当作对齐研究的成果而不是产品拐点。真正的范式转折往往就藏在当年报告的边角里。感兴趣的读者强烈推荐阅读原报告2


  1. stateof.ai: https://www.stateof.ai/ ↩︎

  2. State of AI Report 2022(Google Slides 原文): https://docs.google.com/presentation/d/1WrkeJ9-CjuotTXoa4ZZlB3UPBXpxe4B3FMs9R9tn34I ↩︎ ↩︎

  3. IRIS: Transformers are Sample-Efficient World Models: https://arxiv.org/pdf/2209.00588.pdf ↩︎ ↩︎

  4. MaxViT: Multi-Axis Vision Transformer: https://paperswithcode.com/paper/maxvit-multi-axis-vision-transformer ↩︎

  5. DeepMind 与数学家合作的 Nature 报道: https://www.nature.com/articles/d41586-021-03593-1 ↩︎

  6. Papers With Code 框架使用趋势: https://paperswithcode.com/trends ↩︎

  7. Adept.ai 成立报道: https://techcrunch.com/2022/04/26/2304039/ ↩︎

  8. Advancing mathematics by guiding human intuition with AI(Nature): https://www.nature.com/articles/s41586-021-04086-x.pdf ↩︎

  9. Towards combinatorial invariance for Kazhdan-Lusztig polynomials(表示论): https://arxiv.org/pdf/2111.15161.pdf ↩︎

  10. The signature and cusp geometry of hyperbolic knots(纽结理论): https://arxiv.org/pdf/2111.15323.pdf ↩︎

  11. Pushing the frontiers of density functionals by solving the fractional electron problem(Science): https://www.science.org/doi/10.1126/science.abj6511 ↩︎

  12. DeepMind: Discovering novel algorithms with AlphaTensor: https://www.deepmind.com/blog/discovering-novel-algorithms-with-alphatensor ↩︎

  13. Discovering faster matrix multiplication algorithms with reinforcement learning(Nature): https://www.nature.com/articles/s41586-022-05172-4 ↩︎

  14. Magnetic control of tokamak plasmas through deep reinforcement learning(Nature): https://www.nature.com/articles/s41586-021-04301-9.pdf ↩︎

  15. DeepMind: AlphaFold reveals the structure of the protein universe: https://www.deepmind.com/blog/alphafold-reveals-the-structure-of-the-protein-universe ↩︎

  16. ProGen2: Exploring the Boundaries of Protein Language Models: https://arxiv.org/pdf/2206.13517.pdf ↩︎

  17. ESM-2 / ESMFold: Language models of protein sequences at the scale of evolution: https://www.biorxiv.org/content/10.1101/2022.07.20.500902v1.full.pdf ↩︎

  18. OpenCell: Endogenous tagging for the cartography of human cellular organization(Science): https://www.science.org/doi/10.1126/science.abi6983 ↩︎

  19. Machine learning-aided engineering of hydrolases for PET depolymerization(Nature): https://www.nature.com/articles/s41586-022-04599-z ↩︎

  20. Leakage and the Reproducibility Crisis in ML-based Science: https://arxiv.org/pdf/2207.07048.pdf ↩︎

  21. OpenAI: Learning to play Minecraft with Video PreTraining: https://openai.com/blog/vpt/ ↩︎

  22. Video PreTraining (VPT) 论文: https://arxiv.org/pdf/2206.11795.pdf ↩︎

  23. CodeGen: A Conversational Paradigm for Program Synthesis: https://arxiv.org/pdf/2203.13474.pdf ↩︎

  24. AlphaCode: Competition-Level Code Generation with AlphaCode: https://arxiv.org/pdf/2203.07814.pdf ↩︎

  25. PanGu-Coder: https://arxiv.org/pdf/2207.11280.pdf ↩︎

  26. Efficient Transformers: A Survey: https://arxiv.org/pdf/2009.06732.pdf ↩︎

  27. The Efficiency Misnomer: https://arxiv.org/pdf/2110.12894.pdf ↩︎

  28. Google: Minerva - Solving Quantitative Reasoning Problems with Language Models: https://ai.googleblog.com/2022/06/minerva-solving-quantitative-reasoning.html ↩︎

  29. OpenAI: Formal Mathematics Statement Curriculum Learning: https://arxiv.org/pdf/2202.01344.pdf ↩︎

  30. Benchmark 提交动态研究(1,688 个 benchmark / 406 个任务): https://arxiv.org/pdf/2203.04592.pdf ↩︎

  31. BIG-bench: Beyond the Imitation Game: https://arxiv.org/pdf/2206.04615.pdf ↩︎

  32. Chinchilla: Training Compute-Optimal Large Language Models: https://arxiv.org/pdf/2203.15556.pdf ↩︎

  33. OpenAI: Scaling Laws for Neural Language Models(2020): https://arxiv.org/pdf/2001.08361.pdf ↩︎

  34. Emergent Abilities of Large Language Models: https://arxiv.org/pdf/2206.07682.pdf ↩︎

  35. OpenAI: WebGPT: https://openai.com/blog/webgpt/ ↩︎

  36. Adept: ACT-1: https://www.adept.ai/act ↩︎

  37. Compute Trends Across Three Eras of Machine Learning: https://arxiv.org/pdf/2202.05924.pdf ↩︎

  38. Improved Denoising Diffusion Probabilistic Models: https://arxiv.org/pdf/2102.09672.pdf ↩︎

  39. Diffusion Models Beat GANs on Image Synthesis: https://arxiv.org/pdf/2105.05233.pdf ↩︎

  40. Diffusion-LM Improves Controllable Text Generation: https://arxiv.org/pdf/2205.14217.pdf ↩︎

  41. Video Diffusion Models: https://arxiv.org/pdf/2204.03458.pdf ↩︎

  42. 基于 diffusion 的三维分子生成: https://arxiv.org/pdf/2203.17003.pdf ↩︎

  43. DALL-E 2: Hierarchical Text-Conditional Image Generation with CLIP Latents: https://arxiv.org/pdf/2204.06125.pdf ↩︎

  44. Imagen: Photorealistic Text-to-Image Diffusion Models: https://arxiv.org/pdf/2205.11487.pdf ↩︎

  45. Parti: Scaling Autoregressive Models for Content-Rich Text-to-Image Generation: https://arxiv.org/pdf/2206.10789.pdf ↩︎

  46. GLIDE: https://arxiv.org/pdf/2112.10741.pdf ↩︎

  47. Make-a-Scene: https://arxiv.org/pdf/2203.13131.pdf ↩︎

  48. CogView2: https://arxiv.org/pdf/2204.14217.pdf ↩︎

  49. Midjourney 已实现盈利的报道: https://www.theregister.com/2022/08/01/david_holz_midjourney/ ↩︎

  50. Stable Diffusion 公开发布: https://stability.ai/blog/stable-diffusion-public-release ↩︎

  51. DALL-E mini 开源实现: https://github.com/borisdayma/dalle-mini ↩︎

  52. OpenAI: DALL-E 原始博客: https://openai.com/blog/dall-e/ ↩︎

  53. SayCan: Do As I Can, Not As I Say: https://arxiv.org/pdf/2204.01691.pdf ↩︎

  54. ConvNeXt: A ConvNet for the 2020s: https://arxiv.org/pdf/2201.03545v1.pdf ↩︎

  55. Masked Autoencoders Are Scalable Vision Learners: https://arxiv.org/pdf/2111.06377.pdf ↩︎

  56. Gato: A Generalist Agent: https://arxiv.org/pdf/2205.06175.pdf ↩︎

  57. data2vec: https://arxiv.org/pdf/2202.03555.pdf ↩︎

  58. NeRF at CVPR 2022 论文汇总: https://dellaert.github.io/NeRF22/ ↩︎

  59. Plenoxels: Radiance Fields without Neural Networks: https://alexyu.net/plenoxels/ ↩︎

  60. Block-NeRF(Waymo): https://waymo.com/research/block-nerf/ ↩︎

  61. Mega-NeRF: Scalable Construction of Large-Scale NeRFs: https://openaccess.thecvf.com/content/CVPR2022/papers/Turki_Mega-NERF_Scalable_Construction_of_Large-Scale_NeRFs_for_Virtual_Fly-Throughs_CVPR_2022_paper.pdf ↩︎

  62. 基于微生物组的个体化抗菌药选择(Science): https://www.science.org/doi/10.1126/science.abg9868 ↩︎

  63. Dual use of artificial-intelligence-powered drug discovery(Nature Machine Intelligence): https://www.nature.com/articles/s42256-022-00465-9 ↩︎

  64. CSET: Counting AI Research: https://cset.georgetown.edu/publication/counting-ai-research/ ↩︎

  65. NVIDIA H100 与 AI factory 发布: https://blogs.nvidia.com/blog/2022/03/22/ai-factories-hopper-h100-nvidia-ceo-jensen-huang/ ↩︎

  66. NVIDIA Ampere 数据中心 GPU 量产公告: https://nvidianews.nvidia.com/news/nvidias-new-ampere-data-center-gpu-in-full-production ↩︎

  67. NVIDIA 收购 Arm 期间的股价与收入数据(Koyfin): https://app.koyfin.com/share/dd60c3a469 ↩︎

  68. NVIDIA: Designing Arithmetic Circuits with Deep Reinforcement Learning: https://developer.nvidia.com/blog/designing-arithmetic-circuits-with-deep-reinforcement-learning/ ↩︎

  69. AWS Trainium (Trn1) 实例: https://aws.amazon.com/ec2/instance-types/trn1/ ↩︎

  70. Adept 与 Oracle、NVIDIA 的合作: https://www.hpcwire.com/off-the-wire/adept-teams-with-oracle-and-nvidia-for-ai-innovation/ ↩︎

  71. Meta AI Research SuperCluster (RSC): https://ai.facebook.com/blog/ai-rsc/ ↩︎

  72. Meta 选择 Azure 作为战略云提供方: https://azure.microsoft.com/en-us/blog/meta-selects-azure-as-strategic-cloud-provider-to-advance-ai-innovation-and-deepen-pytorch-collaboration/ ↩︎

  73. NVIDIA 发布 EOS 超级计算机: https://www.hpcwire.com/2022/03/22/nvidia-announces-eos-supercomputer/ ↩︎

  74. Stability AI: Stable Diffusion 公告(含算力规模): https://stability.ai/blog/stable-diffusion-announcement ↩︎

  75. Buyers of first resort: https://www.worksinprogress.co/issue/buyers-of-first-resort/ ↩︎

  76. Stanford SCCEI: 政府合同与中国 AI 软件创新: https://sccei.fsi.stanford.edu/china-briefs/ai-software-innovation ↩︎

  77. Google: Join us in the AI Test Kitchen: https://blog.google/technology/ai/join-us-in-the-ai-test-kitchen/ ↩︎

  78. Character.AI: https://www.character.ai/ ↩︎

  79. Anthropic 5.8 亿美元融资: https://techcrunch.com/2022/04/29/anthropics-quest-for-better-more-explainable-ai-attracts-580m/ ↩︎

  80. Inflection AI 2.25 亿美元融资: https://techcrunch.com/2022/05/13/inflection-ai-led-by-linkedin-and-deepmind-co-founders-raises-225m-to-transform-computer-human-interactions/ ↩︎

  81. Cohere 1.25 亿美元 B 轮: https://betakit.com/cohere-closes-125-million-usd-series-b-round-led-by-tiger-global/ ↩︎

  82. Adept 6,500 万美元融资: https://www.businesswire.com/news/home/20220426005963/en/AI-Transformer-Inventors-Launch-Adept-with-65M-to-Lend-a-Hand-to-Knowledge-Workers ↩︎

  83. GitHub Copilot 面向所有开发者正式可用: https://github.blog/2022-06-21-github-copilot-is-generally-available-to-all-developers/ ↩︎

  84. Amazon CodeWhisperer: https://aws.amazon.com/codewhisperer/ ↩︎

  85. Google: ML-Enhanced Code Completion Improves Developer Productivity: https://ai.googleblog.com/2022/07/ml-enhanced-code-completion-improves.html ↩︎

  86. tabnine 新一代产品发布: https://www.tabnine.com/blog/announcing-tabnine-next-generation/ ↩︎

  87. 临床试验患者脱落的真实成本: https://mdgroup.com/blog/the-true-cost-of-patient-drop-outs-in-clinical-trials/ ↩︎

  88. ClinicalTrials.gov 登记研究趋势: https://www.clinicaltrials.gov/ct2/resources/trends#RegisteredStudiesOverTimePostedResults ↩︎

  89. BioNTech 与 InstaDeep 的高风险变种早期预警系统: https://www.instadeep.com/2022/01/biontech-and-instadeep-developed-and-successfully-tested-early-warning-system-to-detect-potential-high-risk-sars-cov-2-variants/ ↩︎

  90. EWS 预印本: https://www.biorxiv.org/content/10.1101/2021.12.24.474095v2 ↩︎

  91. Oxipit: 首个自主 AI 医学影像应用获批: https://oxipit.ai/news/first-autonomous-ai-medical-imaging-application/ ↩︎

  92. ChestLink 在芬兰基层医疗胸片上的回顾性研究: https://arxiv.org/pdf/2205.08123.pdf ↩︎

  93. Beauhurst: Spinouts Spotlight: https://www.beauhurst.com/research/spinouts-spotlight/ ↩︎

  94. 英国政府: Understanding UK AI R&D commercialisation and the role of standards: https://www.gov.uk/government/publications/understanding-uk-ai-rd-commercialisation-and-the-role-of-standards ↩︎

  95. Spinout.fyi 开放数据库: https://www.spinout.fyi/data ↩︎

  96. UC Berkeley AMPLab: https://amplab.cs.berkeley.edu/about/ ↩︎

  97. UC Berkeley RISELab 成立: https://engineering.berkeley.edu/news/2017/01/berkeley-launches-riselab-enabling-computers-to-make-intelligent-real-time-decisions/ ↩︎

  98. Stanford DAWN: https://dawn.cs.stanford.edu/ ↩︎

  99. Dealroom: 全球使用 AI 的公司融资数据: https://app.dealroom.co/transactions.rounds/f/growth_stages/not_mature/rounds/not_GRANT_SPAC%20PRIVATE%20PLACEMENT/tags/not_outside%20tech/technologies/anyof_artificial%20intelligence_deep%20learning_machine%20learning?showScale=absolute&showStats=YEAR&statsType=rounds ↩︎

  100. Dealroom: 使用 AI 的公司退出数据: https://app.dealroom.co/transactions.exits/f/rounds/anyof_BUYOUT_ACQUISITION_IPO_SPAC%20IPO/technologies/anyof_deep%20learning_artificial%20intelligence_machine%20learning?showStats=true&statsType=exits-count ↩︎

  101. Compute and Data Trends in Machine Learning(含学术界占比): https://arxiv.org/pdf/2202.07785.pdf ↩︎

  102. Sevilla et al. 大规模 AI 成果数据表: https://docs.google.com/spreadsheets/d/1AAIebjNsnJj_uKALHbXNfn3_YsT6sHXtCU0q7OIPuc4/edit#gid=0 ↩︎

  103. Emad Mostaque 关于 Stable Diffusion 训练成本的推文: https://twitter.com/EMostaque/status/1563870674111832066 ↩︎

  104. Epirus 反电子设备武器: https://www.epirusinc.com/counter-electronics ↩︎

  105. Saab COMINT / C-ESM 传感器: https://www.saab.com/products/comint-c-esm ↩︎

  106. Anduril 发布 Altius-700: https://blog.anduril.com/area-i-an-anduril-company-unveils-the-altius-700-2b8e856d48b5 ↩︎

  107. NATO 人工智能战略: https://www.nato.int/cps/en/natohq/official_texts_187617.htm ↩︎

  108. Daniel Ek 的基金投资 Helsing 1 亿欧元: https://techcrunch.com/2021/11/09/daniel-eks-fund-puts-e100m-into-defence-startup-helsing-ai-to-support-democracies/ ↩︎

  109. Anduril 以 70 亿美元投前估值融资: https://techcrunch.com/2022/05/24/filing-anduril-is-raising-up-to-1-2b-sources-say-at-a-7b-pre-money-valuation-for-its-defense-tech/ ↩︎

  110. Shield AI 以 23 亿美元估值融资 1.65 亿美元: https://techcrunch.com/2022/06/09/shield-ai-raises-165m-at-a-2-3b-valuation-to-fuel-development-of-its-military-autonomous-flying-systems/ ↩︎

  111. GIS Arta 的精度与作战效果报道: https://www.isegoria.net/2022/07/no-western-artillery-system-is-as-capable-and-none-apparently-has-the-accuracy-offered-by-gis-arta/ ↩︎

  112. CSET: No Permits, No Fabs: https://cset.georgetown.edu/wp-content/uploads/CSET-No-Permits-No-Fabs.pdf ↩︎

  113. SIA: CHIPS Act of 2022 Fact Sheet: https://www.semiconductors.org/wp-content/uploads/2022/07/Pass-the-CHIPS-Act-of-2022-Fact-Sheet.pdf ↩︎

  114. CSET: Sustaining U.S. Competitiveness in Semiconductor Manufacturing: https://cset.georgetown.edu/publication/sustaining-u-s-competitiveness-in-semiconductor-manufacturing/ ↩︎

  115. SCMP: 美国 NVIDIA 芯片禁令对北京 AI 野心的直接威胁: https://www.scmp.com/tech/big-tech/article/3192213/tech-war-why-us-nvidia-chip-ban-direct-threat-beijings-artificial ↩︎

  116. CSET: Silicon Twist(中国军方采购的 AI 芯片来源): https://cset.georgetown.edu/wp-content/uploads/CSET-Silicon-Twist-1.pdf ↩︎

  117. Reuters: 禁令预计将利好中国本土竞争者: https://www.reuters.com/technology/us-ban-nvidia-amd-chips-seen-boosting-chinese-rivals-2022-09-08/ ↩︎

  118. AI Risk and Opportunity: Humanity’s Efforts So Far(早期先驱观点汇编): https://www.alignmentforum.org/posts/i4susk4W3ieR5K92u/ai-risk-and-opportunity-humanity-s-efforts-so-far ↩︎

  119. Marvin Minsky: True Names 后记: https://web.media.mit.edu/~minsky/papers/TrueNames.Afterword.html ↩︎

  120. UK National AI Strategy: https://www.gov.uk/government/publications/national-ai-strategy ↩︎

  121. AI Impacts: What do ML researchers think about AI in 2022: https://aiimpacts.org/what-do-ml-researchers-think-about-ai-in-2022/ ↩︎

  122. NLP 社区调查: https://nlpsurvey.net/ ↩︎

  123. 80,000 Hours: 防止 AI 灾难的问题简介: https://80000hours.org/problem-profiles/artificial-intelligence/ ↩︎

  124. Open Philanthropy: 高级 AI 潜在风险方向的资助记录: https://www.openphilanthropy.org/grants/?q=&focus-area=potential-risks-advanced-ai ↩︎

  125. FTX Future Fund 资助记录: https://ftxfuturefund.org/all-grants/ ↩︎

  126. DeepMind 财务申报记录: https://find-and-update.company-information.service.gov.uk/company/07386350/filing-history ↩︎

  127. OpenAI: InstructGPT / Aligning language models to follow instructions: https://openai.com/blog/instruction-following/ ↩︎

  128. Anthropic: Training a Helpful and Harmless Assistant with RLHF: https://arxiv.org/abs/2204.05862 ↩︎

  129. OpenAI: Our approach to alignment research: https://openai.com/blog/our-approach-to-alignment-research/ ↩︎

  130. Training Language Models with Language Feedback: https://arxiv.org/abs/2204.14146 ↩︎

  131. Red Teaming Language Models with Language Models: https://arxiv.org/abs/2202.03286 ↩︎

  132. Anthropic: Red Teaming Language Models to Reduce Harms: https://www.anthropic.com/red_teaming.pdf ↩︎

  133. Anthropic: Transformer Circuits: https://transformer-circuits.pub/ ↩︎

  134. Mechanistic Interpretability, Variables, and the Importance of Interpretable Bases: https://transformer-circuits.pub/2022/mech-interp-essay/index.html ↩︎

  135. Goal Misgeneralization in Deep Reinforcement Learning: https://arxiv.org/abs/2105.14111 ↩︎

  136. What Would Jiminy Cricket Do? Towards Agents That Behave Morally: https://arxiv.org/abs/2110.13136 ↩︎

  137. Conjecture 内部 infohazard 政策: https://www.lesswrong.com/posts/Gs29k3beHiqWFZqnn/conjecture-internal-infohazard-policy ↩︎