State of AI: 2022 年度人工智能报告
stateof.ai 1 出品了 2022 年度人工智能报告2。该报告由英国风投公司 Air Street Capital 的合伙人 Nathan Benaich 与 Plural 联合创始人 Ian Hogarth 联合撰写,今年是第五年,另有两位研究助理 Othmane Sebbouh(ENS Paris)和 Nitarshan Rajkumar(剑桥大学)参与。2022 年是 diffusion model 元年、是 Chinchilla 改写 scaling law 的一年、也是学术界在大模型上彻底掉队的一年。本文编译自该报告,并附带简单分析,强烈推荐阅读原报告。
以下为全文目录,本文一次性覆盖全部五个章节。
- State of AI 2022 报告年度总结与去年预测复盘
- 科研进展:技术突破及其能力
- 产业界发展:当前 AI 创新的商业化应用以及对应的商业化影响
- 政治影响:AI 监管,AI 产生的经济影响,AI 的地缘政治演进
- AI 安全:明确和减轻将来庞大 AI 系统可能产生的灾难性影响
- 对未来 12 个月的预测
01 Key Themes
Research
- Diffusion model 以惊人的文生图能力席卷了整个计算机视觉领域,并继续向视频、文本、音频、分子设计扩散。
- AI 攻入更多科学问题,从塑料回收、核聚变反应堆控制到天然产物发现。
- Scaling law 重新聚焦到数据上:模型规模可能并不是你需要的全部,同时业界继续向「一个模型统治所有」推进。
- 社区驱动的大模型开源以惊人的速度发生,让松散的集体也能和大实验室竞争。
- 受神经科学启发,AI 研究在方法论上开始越来越像认知科学。
Industry
- AI 半导体初创公司真的撼动 NVIDIA 了吗? AI 研究中的芯片使用统计显示,NVIDIA 领先 20–100 倍。
- 大厂扩张自己的 AI 云,并与 A(G)I 初创公司结成大额合作。
- 招聘冻结和 AI 实验室解散,反而催生了大量从 DeepMind、OpenAI 出走的创业公司。
- 主要的 AI 药物研发公司已有 18 个临床阶段资产,自主医学影像诊断也拿到了第一个 CE 认证。
- AI for code 的最新研究被大厂和初创公司迅速转化成了商业开发者工具。
Politics
- 大规模 AI 工作上,学术界和工业界之间的鸿沟可能已经无法弥合:几乎 0% 的工作出自学术界。
- 学术界正把接力棒交给由非传统资金支持的去中心化研究集体。
- 美国半导体能力的「大回流」(The Great Reshoring)正式启动,但地缘政治紧张度也达到了顶点。
- AI 继续被注入更多国防产品品类,国防 AI 初创公司拿到了更多融资。
Safety
- AI Safety 研究的关注度、人才和资金都在增加,但仍然远远落后于 capabilities 研究。
复盘:我们 2021 年的预测打几分
Scorecard: Reviewing our predictions from 2021
作者每年会给自己的预测打分,这是这份报告最有意思的传统之一。2021 年的 8 条预测中,4 条命中、4 条落空。
- ✅ Transformer 取代 RNN 学习 world model,让 RL agent 在大型富环境中超越人类。DeepMind 的 Gato 朝这个方向前进了一步(用 transformer 预测下一个状态和动作,但没有用 RL 训练),日内瓦大学的 GPT 式 transformer 模型 IRIS 则在 Atari 环境中解决了任务3。
- ❌ ASML 市值达到 5,000 亿美元。2022 年 10 月 3 日的市值约为 1,650 亿美元。
- ❌ Anthropic 发表 GPT、Dota、AlphaGo 级别的成果,确立自己作为 AGI 研究第三极的地位。还没有。
- ❌ AI 半导体出现一波整合,Graphcore、Cerebras、SambaNova、Groq、Mythic 中至少一家被大公司或半导体巨头收购。一起都没发生。
- ✅ 小型 transformer + CNN 混合模型以 10 倍更少的参数追平 ImageNet top-1 的 SOTA(CoAtNet-7,90.88%,24.4 亿参数)。Google 的 MaxViT 用 4.75 亿参数几乎追平(89.53%)4。
- ✅ DeepMind 在物理科学上取得重大突破。三(!)篇数学和材料科学论文5。
- ❌ JAX 框架在 Papers With Code 上的月度新建仓库占比从 1% 涨到 5%。JAX 占比仍不足 1%6。
- ✅ 一家新的 AGI 研究公司成立,有雄厚资金支持,且路线图聚焦某个垂直行业。Adept.ai 由 Transformer 论文作者共同创立,专注通过软件工具使用自动化通往 AGI7。
作者今年还补了一个「迟到总比不到好」的彩蛋环节,把 2018–2020 年的老预测也拉出来兑现:2018 年预测的「台韩半导体公司成为中美贸易战的明牌筹码」应验(美国 2022 年 CHIPS 法案禁止受助方在中国扩产,台积电被夹在中间);2018 年预测的「某个 OECD 国家政府会阻止美中科技公司收购一家领先 ML 公司」应验(英国等阻止了 NVIDIA 收购 Arm);2019 年预测的「某家主要 AI 公司对治理结构做出实质性调整」应验(Anthropic 注册为公益公司);2020 年预测的「中欧国防 AI 初创公司合计融资超 1 亿美元」应验(德国 Helsing 在 2022 年拿到 1 亿美元 A 轮);2020 年预测的「NVIDIA 最终无法完成对 Arm 的收购」应验(2022 年正式取消)。只有「Meta 用 3D 计算机视觉在 AR/VR 上取得重大突破」算「勉强」——PyTorch3D 里的 Implicitron 有了,但还没用到 AR/VR 上。
02 Research
Research 进展总结
- DeepMind 用一年时间证明了 AI 可以做「真科学」:数学猜想生成、密度泛函近似、矩阵乘法算法、托卡马克等离子体控制、20,000 万个蛋白质结构,五个方向全部兑现。
- Scaling law 被 Chinchilla 改写,「参数量优先」让位给「参数量和数据量同速增长」,同时能力涌现(emergence)成为一个既让人兴奋又让安全评估变得困难的现象。
- Diffusion model 在一年内从「在几个 benchmark 上超过 GAN」变成文生图的绝对 SOTA,并且开源社区把闭源模型的复现窗口从 35 个月压缩到了 14 个月。
DeepMind 在数学与材料科学的三连击
2021 Prediction: DeepMind’s breakthroughs in the physical sciences (1/3)
2021 年报告预测「DeepMind 会在物理科学上放出一个重大突破」,这一年它在数学和材料科学上都兑现了。数学中最具决定性的时刻之一是提出猜想,也就是对若干变量之间关系的假设。传统做法是观察大量实例,辅以数据驱动的猜想生成方法,但这些方法只能处理低维、线性、结构简单的数学对象。
DeepMind 在 Nature 上提出了一套数学家与监督学习模型(通常是神经网络)迭代协作的工作流8:数学家先假设两个变量 X(z) 与 Y(z) 之间存在某个函数关系,计算机生成大量实例,神经网络拟合这些数据,再用梯度显著性方法找出 X(z) 中最相关的输入分量。数学家据此修正假设或生成更多数据,直到猜想在足够大的数据上成立。
2021 Prediction: DeepMind’s breakthroughs in the physical sciences (2/3)
DeepMind 把这套框架和悉尼大学、牛津大学的数学教授一起用了两次:一是提出了一个算法,用于解决表示论中一个悬置了 40 年的猜想9;二是在纽结理论中证明了一个新定理10。
材料科学方面的贡献同样重要。DeepMind 证明了密度泛函理论(DFT)中的精确泛函——计算电子能量的核心工具——可以用神经网络高效近似11。值得注意的是,研究者没有去约束神经网络满足 DFT 泛函的数学约束,而是直接把这些约束编码进用于拟合的训练数据里。
2021 Prediction: DeepMind’s breakthroughs in the physical sciences (3/3)
DeepMind 还把 AlphaZero(那个击败人类国际象棋、围棋、将棋顶尖选手的 RL 模型)改造去做矩阵乘法12。这个叫 AlphaTensor 的模型找到了新的确定性矩阵乘法算法。为了能用上 AlphaZero,研究者把矩阵乘法重新表述成一个单人游戏:每一步对应一条算法指令,目标是把一个衡量「预测算法离正确还有多远」的张量清零13。
寻找更快的矩阵乘法算法这个看似简单、被研究了几十年的问题,实际上已经停滞了数十年。 DeepMind 的方法不只加速了这个领域的研究,还直接惠及所有基于矩阵乘法的技术——也就是 AI、成像,以及我们手机上发生的几乎一切。
核聚变控制与蛋白质宇宙
Reinforcement learning could be a core component of the next fusion breakthrough
DeepMind 训练了一套强化学习系统来调节洛桑 TCV(可变位形托卡马克)的磁线圈14。这套系统的灵活性意味着它也可以用在 ITER 上——那台正在法国建造的下一代托卡马克。
- 实现核聚变的主流路线之一,是用托卡马克把极高温的等离子体约束足够长的时间。
- 主要障碍在于等离子体不稳定,一旦接触托卡马克内壁就会损失热量并侵蚀材料。稳定它需要每秒调整磁线圈数千次。
- DeepMind 的深度 RL 系统做到了这件事:先在仿真环境中训练,再部署到洛桑的 TCV 上。这套系统还能把等离子体塑造成新的形状,其中包括与 ITER 设计兼容的形状。
Predicting the structure of the entire known proteome: what could this unlock next?
自开源以来,DeepMind 的 AlphaFold 2 已被数百篇研究论文使用。今年他们进一步用它预测了来自植物、细菌、动物等生物的 2 亿个已知蛋白质的三维结构15。这项技术能解锁的下游突破——从药物发现到基础科学——需要几年时间才能显现。
- 今天蛋白质数据库(PDB)中通过 X 射线晶体学和冷冻电镜实测确定的三维结构有 19 万个。
- AlphaFold DB 在 2021 年 7 月的首次发布包含 100 万个预测结构。
- 这次发布把数据库规模扩大了 200 倍。来自 190 个国家的超过 50 万名研究者已经用过这个数据库。
- AlphaFold 在 AI 研究文献中的提及量正在暴涨,预计将同比增长两倍。
蛋白质语言模型与细胞图谱
Language models for proteins: a familiar story of open source and scaled models
研究者们各自独立地把语言模型用到了蛋白质生成和结构预测上,同时都在扩大模型参数量,并且都报告了 scaling 带来的巨大收益。
- Salesforce 发现,扩大 LM 规模能更好地捕捉蛋白质序列的训练分布(用 perplexity 衡量)。用 60 亿参数的 ProGen2,他们生成了折叠结构与天然蛋白相似、但序列一致性差异很大的蛋白质16。不过作者强调,要释放 scale 的全部潜力,还需要在数据分布上花更多功夫。
- Meta 等推出了 ESM 系列蛋白质语言模型,规模从 800 万到 150 亿参数(即 ESM-2)。基于 ESM-2 构建的 ESMFold 在结构预测上给出了与 AlphaFold 2、RoseTTAFold 相似的结果,但快了一个数量级17。
- 快的原因是 ESMFold 不依赖 AlphaFold 2 和 RoseTTAFold 所需的多序列比对(MSA)和模板,只用蛋白质序列本身。
OpenCell: understanding protein localization with a little help from machine learning
研究者用基于 CRISPR 的内源标记——通过修饰基因来点亮蛋白功能的特定侧面——来确定蛋白质在细胞中的定位,然后用聚类算法识别蛋白质社群,并对尚未表征的蛋白质提出机制假设18。
- 基因组研究的一个重要目标,是理解蛋白质在细胞里定位在哪、如何相互作用以实现特定功能。OpenCell 项目用 1,310 个标记蛋白、约 5,900 张三维图像的数据集,让研究者在蛋白质的空间分布、功能和相互作用之间建立起重要联系。
- 在蛋白质相互作用图上做 Markov 聚类,成功划分出了功能相关的蛋白质群,这将帮助研究者理解那些至今未被表征的蛋白质。
- 我们常常期待 ML 给出确定性的预测。但这里和数学一样,ML 先给出部分答案(这里是聚类),然后由人类解释、提出并检验假设,最后才得到确定的结论。
ML for Science 的红利与陷阱
Plastic recycling gets a much-needed ML-engineered enzyme
德州大学奥斯汀分校的研究者用机器学习改造出了一种能降解 PET 的酶,PET 这种塑料占全球固体废弃物的 12%19。
- 这个叫 FAST-PETase 的 PET 水解酶,对温度和 pH 的适应范围比已有的酶更宽。
- FAST-PETase 能在一周内几乎完全降解 51 种不同的产品。
- 研究者还证明可以用降解回收的单体重新合成 PET,为工业规模的 PET 闭环回收打开了可能性。
Beware of compounded errors: in science, ML in and garbage out?
随着 ML 在定量科学中被广泛使用,ML 里的方法论错误也会渗漏进这些学科。普林斯顿的研究者警告说,一场基于 ML 的科学复现危机正在酝酿,其中一个主要推手就是数据泄露(data leakage)20。
- 数据泄露是一个统称,涵盖所有「模型本不该拿到却拿到了数据」的情况。最常见的例子是测试数据混进了训练集。但泄露可以更隐蔽:模型用了某个实际上是结果变量代理的特征;或者测试数据来自与科学结论所声称的分布不同的分布。
- 作者认为随之而来的复现失败是系统性的:他们研究了横跨 17 个科学领域的 20 篇综述,这些综述涵盖的 329 篇论文中,每一篇都出现了数据泄露错误。
- 受 ML 里日渐流行的 model card 启发,作者提出研究者应该使用「模型信息表」来预防数据泄露问题。
从 Minecraft 到代码:会用工具的模型
OpenAI uses Minecraft as a testbed for computer-using agents
OpenAI 训练了一个模型(Video PreTraining,VPT),只用少量带鼠标键盘标注的数据,就学会了从视频帧玩 Minecraft21。VPT 是第一个学会合成钻石的 ML 模型,「这个任务连熟练的人类玩家通常也要花 20 分钟以上(24,000 个动作)」。
- OpenAI 收集了 2,000 小时带鼠标键盘动作标注的视频,训练了一个逆动力学模型(IDM),用过去和未来的帧预测动作——这就是 PreTraining 部分。
- 然后用 IDM 去标注 7 万小时的视频,在这些数据上训练一个只用过去视频帧预测动作的模型22。
- 他们证明这个模型可以用模仿学习和强化学习微调,达到从零开始做 RL 难以企及的性能。
Corporate AI labs rush into AI for code research
OpenAI 的 Codex(GitHub Copilot 背后的模型)以多行补全和从自然语言指令直接生成代码的能力震动了计算机科学社区。这一成功带动了更多研究,包括来自 Salesforce、Google 和 DeepMind 的工作。
- Salesforce 的对话式 CodeGen 利用 LLM 的语言理解能力,让开发者通过多轮语言交互来指定编码需求。它是唯一一个能与 Codex 竞争的开源模型23。
- 更令人印象深刻的是 Google 的 PaLM:它达到了与 Codex 相似的性能,但训练数据里的代码量少 50 倍(PaLM 训练在一个更大的非代码数据集上)。在 Python 代码上微调后,PaLM 在代码修复任务 Deepfix 上超过了同行(82% vs. 71.7% 的 SOTA)。
- DeepMind 的 AlphaCode 处理的是另一个问题:在竞赛编程任务上生成完整程序24。它在 Codeforces 上排名进入前 50%。模型先在 GitHub 数据上预训练,再在 Codeforces 的题目和解法上微调,然后采样出上百万个候选解,经过过滤和聚类得到最终 10 个提交。华为也推出了 PanGu-Coder25。
Transformer 五年了,高效替代品在哪
Five years after the Transformer, there must be some efficient alternative, right… right?
Transformer 核心的 attention 层对输入长度有著名的平方复杂度依赖。一堆论文承诺解决这件事,但没有一种方法被真正采用。 SOTA 的 LLM 有各种形态(autoencoding、autoregressive、encoder-decoder),却全都依赖同一个 attention 机制。
过去几年里训练了海量的 transformer,为全世界的实验室和公司烧掉了数百万(数十亿?)美元。但所谓的「Efficient Transformer」在大规模 LM 研究中根本找不到踪影(而那里本该是差异最大的地方!):GPT-3、PaLM、LaMDA、Gopher、OPT、BLOOM、GPT-Neo、Megatron-Turing NLG、GLM-130B 等等,全部用的是原始 attention 层26。
几个原因可以解释这种不被采用:(i)潜在的线性加速只在输入序列很长时才有用;(ii)新方法引入了额外约束,让架构不那么通用;(iii)论文里报告的效率指标,并不能转化为真实的计算成本和时间节省27。
数学能力暴涨,benchmark 跟不上
Mathematical abilities of Language Models largely surpass expectations
基于 Google 5,400 亿参数的 PaLM,Google 的 Minerva 在 MATH benchmark 上拿到了 50.3% 的分数,比之前的 SOTA 高出 43.4 个百分点,也远超预测者对 2022 年最好成绩的预期(13%)28。与此同时 OpenAI 训练了一个网络,解出了两道国际数学奥林匹克(IMO)题目29。
- Google 在预训练好的 PaLM 上,用 118GB 来自 arXiv 的科学论文和使用 LaTeX、MathJax 的网页做了额外训练。配合 chain of thought prompting(在 prompt 里包含中间推理步骤而不只是最终答案)和 majority voting 等技巧,Minerva 在大多数数据集上把 SOTA 提高了至少两位数百分点。
- Minerva 只用了语言模型,没有显式编码形式化数学。它更灵活,但只能自动评估最终答案而非整个推理过程,这可能带来一定的分数虚高。
- 相比之下,OpenAI 构建的是一个基于 transformer 的定理证明器,运行在 Lean 形式化环境中。不同版本的模型分别解出了 AMC12(26 题)、AIME(6 题)和 IMO(2 题)——难度依次递增。
Fast progress in LLM research renders benchmarks obsolete, but a BIG one comes to help
只有 66% 的机器学习 benchmark 收到过 3 次以上不同时间点的结果提交,而且很多在发布后不久就被解决或饱和30。由 132 家机构的 444 位作者设计的新 benchmark BIG(Beyond the Imitation Game) 想要挑战当前和未来的语言模型31。
- 维也纳大学、牛津大学和 FHI 的一项研究考察了 406 个 AI 任务上的 1,688 个 benchmark,识别出了不同的提交动态。
- 他们注意到语言类 benchmark 尤其容易被快速饱和。
- LLM 的快速进展和涌现能力似乎正在跑赢现有 benchmark。结果是,这些进展大多只能通过 demo 或一次性突破这类旁证来体现,或者在各自零散的专用 benchmark 上评估,让人很难判断真实进展。
- 新的 BIG benchmark 包含 204 个任务,全部配有强人类专家基线,评估从记忆到多步推理的一大批 LLM 能力。他们发现,目前即使是最好的模型,在 BIG benchmark 上也表现很差。
Scaling law 重新看向数据,以及能力涌现
Ducking language model scaling laws: more data please
DeepMind 重新审视了 LM 的 scaling law,发现当前的模型严重训练不足:相对于它们庞大的体量,训练数据太少了32。他们训练了 Chinchilla——一个比 Gopher 小 4 倍、但用了 4.6 倍数据的模型——结果 Chinchilla 在 BIG-bench 上超过了 Gopher 和其他大模型。
- 经验性的 LM scaling law 决定的是:在固定算力预算下,应该用多大的模型和多少训练数据。OpenAI 此前的工作认为,随着算力预算增加,模型规模的增长应当快于训练数据规模33。
- DeepMind 则主张,模型规模和训练 token 数应该以大致相同的速率增长。
- 与 OpenAI 的工作相比,DeepMind 用了更大的模型来推导 scaling law。他们强调,数据 scaling 能对数十亿参数级别的模型给出更好的预测。
- 按照新的 scaling law,Chinchilla(700 亿参数)训练在 1.4 万亿 token 上,而 Gopher(2,300 亿参数)只用了 3,000 亿 token。
- 虽然训练算力预算相同,更轻的 Chinchilla 跑起来应该更快。
Ducking language model scaling laws: emergence
虽然模型 loss 可以用校准良好的 scaling law 作为规模和算力的函数被合理预测,但许多 LLM 能力是在模型达到某个临界规模时不可预测地涌现出来的34。这些获得的能力令人兴奋,但涌现现象让模型安全性评估变得更加困难。
- 涌现还没有被完全理解:对多步推理任务,可能模型需要足够深才能编码推理步骤;对记忆类任务,更多参数是自然的解法。评价指标本身也可能是解释的一部分——推理任务上只有结论正确才算答对,因此尽管模型随规模在连续改善,我们只有在增量累积过临界点后才认为它成功。
- 涌现的一个可能后果是,存在一批当前 LLM 够不着、但很快就能被解决的任务。
- 反过来说,在更大规模上把 LLM 部署到真实任务中会更加不确定,因为不安全、不合意的能力同样可能涌现。加上 ML 模型本身的脆弱性,这是从业者又要额外考虑的一个因素。
教模型使用工具,以及算力的三个时代
Teach a machine to fish: tool use as the next frontier?
语言模型可以学会使用搜索引擎、计算器这样的工具,方法很简单:给这些工具提供文本接口,然后在极少量人类演示数据上训练。
- OpenAI 的 WebGPT 是第一个令人信服地证明这件事的模型:微调 GPT-3 去与搜索引擎交互,给出带引用出处的答案35。这只需要收集人类做这件事的数据,把交互数据转换成模型可消费的文本,再走标准监督学习。重要的是,增加人类演示数据的量显著提升了答案的真实性和信息量,相比 2021 年报告中讨论真实性评估时(第 44 页)是一个明显的进步。
- 新的 AGI 公司 Adept 正在把这个范式商业化。公司训练大型 transformer 模型去与网站、软件应用和 API 交互,以提升工作流生产力36。
Looking back: three eras of compute in machine learning
一项研究记录了机器学习算力需求的惊人加速,并按「每个模型训练算力的翻倍时间」划分出三个时代37:前深度学习时代(2010 年之前,训练算力每 20 个月翻一番)、深度学习时代(2010–2015 年,每 6 个月翻一番)、大规模时代(2016 年至今,先是 100–1000 倍的跃升,之后每 10 个月翻一番)。
Diffusion model 统治文生图,并向视频扩散
Diffusion models take over text-to-image generation and expand into other modalities
2021 年报告讨论 diffusion model 时(第 36 页),它们刚在几个 benchmark 上超过 GAN38。今天它们已经是文生图无可争议的 SOTA,并且正在向文生视频、文本生成、音频、分子设计等方向扩散(一语双关)。
- Diffusion model(DM)学习的是逆转对图像逐步加噪的过程:把每一步的逆分布(从噪声图生成去噪图)建模成一个高斯分布,其均值和协方差由神经网络参数化。DM 从随机噪声生成新图像。
- 顺序去噪让它们很慢,但新技术(比如在低维空间去噪)让它们在推理时更快、样本质量更高(classifier-free guidance——用多样性换保真度)39。
- DALL-E 2、Imagen、Stable Diffusion 这些 SOTA 文生图模型都基于 DM。它们也被用在可控文本生成40、基于模型的强化学习、视频生成41乃至分子生成42上。
DALL-E 2, Imagen and Parti…the battle for text-to-image generation rages
OpenAI 的 DALL-E 第二代在 2022 年 4 月发布,生成图像质量出现了显著跃升43。不久之后,Google 拿出了至少同样惊艳的、同样基于 diffusion 的 Imagen44。与此同时,Google 的 Parti 走了一条不同的自回归路线45。
- Parti 不用 diffusion model,而是把文生图当作一个简单的 sequence-to-sequence 任务,要预测的序列就是图像像素的某种表示。值得注意的是,随着 Parti 的参数量和训练数据扩大,模型获得了拼写这样的新能力。
- 其他值得关注的文生图模型还有早于 DALL-E 2 的 GLIDE(OpenAI)46和 Make-a-Scene(Meta,可同时用文本和草图)47,以及 CogView2(清华、智源,中英双语)48。
The text-to-image diffusion model frenzy gives birth to new AI labs
Stability.ai 和 Midjourney 像是凭空冒出来一样,拿出了可以和成熟 AI 实验室掰手腕的文生图模型。 两家的 API 都在 beta,Midjourney 据报道已经盈利49,Stability 则已经把模型开源50。关于它们的崛起和研究动态,Politics 章节还会展开。
The text-to-video generation race has started
基于 diffusion 的文生视频研究大约在 2022 年 4 月由 Google 和不列颠哥伦比亚大学的工作开启。但到了 9 月底,Meta 和 Google 的新研究带来了质量上的跃升,宣告文生视频的「DALL-E 时刻」比预期来得更早。
- Meta 用 Make-a-Video 打响了大厂在文生视频上的第一枪,这是一个用于视频生成的 diffusion model。
- 以一种诡异的相似方式,Google 紧接着(不到一周)几乎同时发布了两个模型:基于 diffusion 的 Imagen Video,以及不基于 diffusion 的 Phenaki。后者可以通过追加 prompt 动态调整视频内容。
开源社区追赶闭源大模型的速度
Closed for 14 months: community-driven open sourcing of GPT et al.
OpenAI 和 DeepMind 的里程碑模型,被开源社区实现、克隆、改进的速度比作者预期的快得多。报告用三张时间线量化了这个「闭源窗口期」,第一张是语言模型:从 GPT-3(1,750 亿参数,2020 年 6 月)发布到社区拿出对标的开源模型,用了 14 个月。这条线上开源的有 GPT-J(60 亿)、GPT-NeoX(200 亿)、OPT(1,750 亿)、BLOOM(1,760 亿)、GLM(1,300 亿);闭源阵营则有 Gopher(2,800 亿)、LaMDA(2,800 亿)、Chinchilla(700 亿)、PaLM(5,400 亿)、Jurassic-1 Jumbo(2,040 亿)、HyperCLOVA(2,040 亿)、Yuan 1.0(2,460 亿)、Ernie 3.0 Titan(2,600 亿)、Pan-Gu(2,000 亿)、Megatron Turing-NLG(1,370 亿)。
Closed for 15 months: community-driven open sourcing of DALL-E et al.
第二张是文生图:从 DALL-E(2021 年 1 月)到开源复现,用了 15 个月。这条线上开源的是 DALL-E mini(2022 年 6 月)51和 Stable Diffusion(2022 年 8 月)52,中间夹着闭源的 Make-a-Scene(3 月)、DALL-E 2(4 月)、Imagen(5 月)、CogView2(6 月)、Parti(7 月)。
Closed for 35 months: community-driven open sourcing of AlphaFold et al.
第三张是蛋白质结构,窗口期最长:从 AlphaFold 1(2018 年 8 月)到 AlphaFold 2(2021 年 7 月)之间隔了 35 个月。这条线上有 ESM(2019 年 4 月)、ESM-1B、RoseTTAFold(2020 年 11 月)、OpenFold 和 ESM-2(2022 年 8 月)。作者提醒:这里列出的模型不一定是复刻品,也可能是改进版本或独立开发的成果。
LLM 给机器人装上常识
LLMs empower robots to execute diverse and ambiguous instructions
得益于覆盖面极广的能力,LLM 原则上可以通过用自然语言解释步骤,让机器人完成任何任务。但 LLM 对机器人所处环境和自身能力几乎没有上下文认知,导致它给出的解释对机器人通常不可执行。PaLM-SayCan 解决了这个问题53。
- 给定一句含糊的指令「我把饮料洒了,能帮我一下吗?」,经过精心 prompt engineering 的 LLM(比如 Google 的 PaLM)能想出一串抽象步骤:去拿一块海绵递给你。但每个技能(拿起、放下)都必须是机器人在当前环境下真能做到的(比如机器人得看得见海绵)。
- 为了激励 LLM 输出可行指令,SayCan 最大化的是「这条指令被机器人成功执行」的似然。
- 假设机器人能执行一组技能,那么对任意给定指令和状态,系统选择的是这样一个技能:给定补全的概率(限制在可用技能集合内)乘以「给定该补全和当前状态下成功的概率」最大。系统用强化学习训练。
- 研究者在 7 类语言指令的 101 条指令上测试 SayCan,规划成功率 84%,执行成功率 74%。
卷积、Transformer 与「一个模型统治所有」
2021 Prediction: in vision, convolutional networks want a fair fight with transformers…
去年 Vision Transformer(ViT)和其他图像 transformer 作为影像 benchmark 上的 SOTA 登场,一度宣告了 ConvNet 的黄昏。没那么快:Meta 和 UC Berkeley 的工作认为,把 ConvNet 现代化之后,它反而能压过 ViT54。
- 研究者提出 ConvNeXt,一个吸收了 Swin 这类分层视觉 Transformer 近期设计选择、但不使用 attention 层的 ResNet。
- ConvNeXt 在 ImageNet-1K 和 ImageNet-22K 上与 Swin Transformer、ViT 竞争力相当,并且同样受益于 scale。
- Transformer 在语言建模里迅速取代了 RNN,但我们不认为 ConvNet 的使用会出现类似的断崖式下跌,尤其是在规模较小的 ML 场景中。
- 与此同时,我们 2021 年关于「小型 transformer + CNN 混合模型」的预测在 Google 的 MaxViT 上兑现:4.75 亿参数几乎追平(89.53%)CoAtNet-7 的 90.88% ImageNet top-1 准确率。
…but the inevitable vision and language modeling unification continues…
用于在文本上训练 transformer 的自监督技术,现在几乎原封不动地被搬到了图像上,并在 ImageNet-1K 上取得了 SOTA55。
- 基于 transformer 的 autoencoder 语言模型被训练去预测大规模语料中被随机遮盖的词,得到在语言建模任务上 SOTA 的强模型(比如 BERT)。
- 但遮住句子中的一个词会让句子变得不知所云、构成一个有挑战的任务,而重建图像里随机遮掉的几个像素则因为邻近像素的存在而变得平凡。
- 解法是:遮掉大块像素(比如 75% 的像素)。Meta 用这个方法加上其他调整(encoder 只看可见 patch,decoder 比 encoder 小很多)预训练 ViT-Huge,再在 ImageNet-1K 上微调,达到该任务最佳的 87.8% top-1 准确率。
- 自监督学习对计算机视觉并不新鲜(比如 Meta 的 SEER),遮盖技术也不新鲜(Context encoders,以及更近的 SiT)。但这项工作进一步证明了语言里的 SOTA 技术可以无缝迁移到视觉。领域统一还能推得更远吗?
2021 Prediction:…culminating in a single transformer to rule them all?
在特定任务上训练(监督或自监督)的 transformer 可以通过微调用于更广的任务集合。近期工作则表明,单个 transformer 可以直接、高效地在跨模态的多种任务上训练(multi-task multimodal learning)。
- 通用多任务多模态模型的尝试至少可以追溯到 Google 的「One model to learn them all」(2017),当时覆盖图像、文本、语音上的 8 个任务。DeepMind 的 Gato 把这件事推到了新的层次:一个 12 亿参数的 transformer,执行机器人、仿真环境、视觉和语言领域的数百个任务56。这部分兑现了我们 2021 年的预测。
- 他们发现 scaling 会稳定改善模型,但为了低延迟的实机机器人任务,模型被刻意保持「小」。
- 为了在不同模态上训练,所有数据都被序列化成 token 序列,再嵌入到一个学到的向量空间。模型完全用监督方式训练。
- 另外,Meta 的 data2vec 在更窄的任务集合上设计了一套跨模态统一的自监督策略,但目前每个模态仍然用各自的 transformer57。
2021 Prediction: transformers for learning in world models in reinforcement learning
2021 年我们预测:「Transformer 取代 RNN 学习 world model,RL agent 借此在大型富游戏环境中超越人类。」日内瓦大学的研究者用一个 GPT 式 transformer 来模拟世界环境,他们的 agent(名为 IRIS)样本效率很高,在 Atari 的 26 个游戏中有 10 个超过了人类表现3。IRIS 也是所有不使用前瞻搜索的方法中最好的一个。
Transformers are becoming truly cross-modality
2020 年的 State of AI Report 预测 transformer 会走出 NLP、在计算机视觉上达到 SOTA。现在很清楚了,transformer 是通用架构的候选者。 对 2022 年 transformer 相关论文的分析显示了这个架构已经无处不在:语言 81%、视觉 41%、多模态 22%、音频 16%、图 9%、强化学习 7%、时序 5%、生物 2%。
NeRF 长成一个独立领域
NeRFs expand into their own mature field of research
开创性的 NeRF 论文发表于 2020 年 3 月。此后方法上的根本性改进和新应用被快速持续地开发出来,光是 2022 年 CVPR 上就有 50 多篇 NeRF 论文58。
- 引用去年报告(第 18 页):给定一张图像的多个视角,NeRF 用多层感知机学习该图像的表示,并渲染出新的视角。它学习的是从每个像素位置和视角方向到该位置颜色与密度的映射。
- 今年的工作中,Plenoxels 尤其突出:它彻底移除了 MLP,把 NeRF 训练加速了 100 倍59。另一个令人兴奋的方向是用少量视角渲染大规模场景,无论是城市尺度(Block-NeRF 渲染整个旧金山街区)60还是卫星尺度(Mega-NeRF)61。
- 以当前结果的质量和这个领域的进展速度看,我们预计一两年内 NeRF 就会在报告的产业章节中占据显要位置。
AI 进入生物医药:从抗生素到生化武器
Treating bacterial infections by data-driven personalised selection of antibacterial agents
抗菌药耐药很常见,而且常常源自患者体内已经存在的另一种病原体。那么医生该怎么找到既能治好当前感染、又不会让患者变得易受新感染的抗生素?
- 通过比较 20 万名以上尿路感染或伤口感染患者在用已知抗生素治疗前后的微生物组特征,ML 可以在患者个体层面预测「治疗诱导获得耐药性」的风险62。
- 事实上,尿路感染(UTI)患者如果用了 ML 系统不会推荐的抗生素,耐药性显著增加。UTI 患者和伤口感染患者如果按 ML 系统的建议开药,复发感染都会大幅减少。
Interpreting small molecule mass spectra using transformers
串联质谱(MS/MS)常用于代谢组学,即研究生物样本中的小分子。由于自然界的化学空间大部分未知,能从谱库中被识别出来的小分子不到 10%。 Transformer 让代谢混合物中分子的快速、准确、in silico 表征成为可能,从而让生物标志物和天然产物药物发现能够规模化。
- 能从参考谱库中识别出来的生物样本非常少。
- 属性预测型 transformer 在直接从 MS/MS 预测一系列医药相关化学性质(溶解度、成药性、可合成性)上表现更好,而且不需要中间的结构预测,也不需要查参考库。
Drug discovery, the flagship “AI for good” application, is not immune to misuse
Collaborations Pharmaceuticals 和伦敦国王学院的研究者证明,为治疗用途设计的机器学习模型可以被轻易改造去生成生化武器63。
- 研究者原本训练他们的 MegaSyn 模型去最大化生物活性、最小化毒性。要设计有毒分子,他们保留同一个模型,只是改成同时最大化生物活性和毒性。他们用的是公开的类药分子数据库。
- 他们把模型导向生成神经毒剂 VX,那是已知毒性最强的化学战剂之一。
- 不过和常规药物发现一样,找到预测毒性高的分子,不代表容易把它做出来。但随着 AI 参与的药物发现被急剧改善,我们可以想象药物发现的最佳实践扩散到廉价生化武器的制造上。
中美 AI 研究产出对比
Comparing machine learning tasks in Chinese vs. US papers
与美国的 AI 研究相比,中国论文更集中在与监控相关的任务上,包括自主性、目标检测、跟踪、场景理解、动作识别和说话人识别。
While US-based authors published more AI papers than Chinese peers in 2022, China and Chinese institutions are growing their output at a faster rate
2022 年美国作者发表的 AI 论文数量仍多于中国同行,但中国和中国机构的产出增速更快:中国机构同比增幅达到 +27%、+13%、+13%、+11%,而美国这边有 +11%、+24%、+10%、+4%,也有 -2% 的下滑。
The China-US AI research paper gap explodes if we include the Chinese-language database, China National Knowledge Infrastructure
如果把中文数据库 CNKI(中国知网)也算进来,中美论文数量差距会直接爆炸:自 2010 年以来,中国机构发表的论文数量是美国机构的 4.5 倍64。
03 Industry
Industry 进展总结
- NVIDIA 的护城河比想象中更宽:论文里 GPU 的使用次数比 ASIC 多 131 倍,比 Graphcore、Habana、Cerebras、SambaNova、寒武纪加起来多 90 倍;收购 Arm 失败,但交易期间企业价值反而涨了 2,950 亿美元。
- 顶级 AI 实验室的人才开始大规模外流创业,Transformer 论文的 8 位作者只剩 1 位还在 Google,与此同时 Meta 解散了运行近 10 年的中心化 AI 研究组织。
- 2022 年 AI 融资随大盘降温,预计全年比去年少 36%,跌幅集中在 1 亿美元以上的大轮次,但仍高于 2020 年水平。
NVIDIA 与 AI 芯片挑战者
Do upstart AI chip companies still have a chance vs. NVIDIA’s GPU?
NVIDIA 2021 财年数据中心收入 106 亿美元。2021 年第四季度确认收入 32.6 亿美元,年化后就超过了排名前三的 AI 半导体初创公司估值总和。NVIDIA 平台上有超过 300 万开发者,最新的 H100 世代芯片预计比 A100 提供 9 倍的训练性能65。与此同时,Cerebras(41 亿美元估值)、SambaNova(51 亿美元)、Graphcore(28 亿美元)的收入数字都没有公开。
NVIDIA’s chips are the most popular in AI research papers…and by a massive margin
GPU 在 AI 论文中被使用的频率是 ASIC 的 131 倍,是 Graphcore、Habana、Cerebras、SambaNova、寒武纪加起来的 90 倍,是 Google TPU 的 78 倍,是 FPGA 的 23 倍66。
For NVIDIA, the V100 is most popular, and Graphcore is most used amongst challengers
2017 年发布的 V100 是 NVIDIA 的主力芯片,其次是 2020 年发布的 A100,H100 则是 2022 年最受期待的产品。在主要的 AI 芯片挑战者中,Graphcore 被引用的次数最多。
NVIDIA fails to acquire Arm and grows its revenue 2.5x and valuation 2x during the deal
这笔以 400 亿美元宣布的收购,最终因为巨大的地缘政治和反垄断阻力告吹。但在交易存续期间,NVIDIA 的企业价值涨了 2,950 亿美元(!!)——收入从 109 亿涨到 269 亿(2.5 倍),股价从 120 涨到 240(2 倍)67。
NVIDIA reaps rewards from investing in AI research tying up hardware and software
NVIDIA 多年来在 AI 研究上投入巨大,在成像方向产出过一些最好的工作。比如他们最新的视角合成工作刚拿下 SIGGRAPH 最佳论文奖。但 NVIDIA 更进一步:把强化学习工作应用到了自家下一代 AI 芯片 H100 GPU 的设计上68。
算力军备竞赛与大厂结盟
David teaming up with Goliath: training large models requires compute partnerships
超大规模云厂商和挑战者算力提供方正在积累大额 AI 算力合作,最有名的是微软对 OpenAI 的 10 亿美元投资。此外还有 AWS 与 Anthropic 围绕 Trainium 的合作69、Oracle 与 NVIDIA 和 Adept 的合作70。我们预计还会有更多。
In a gold rush for compute, companies build bigger than national supercomputers
「我们认为最大的好处会归于拥有最大计算机的人。」——Greg Brockman,OpenAI CTO
Meta 的 RSC71(以及与 Azure 的合作72)、特斯拉的 Dojo、NVIDIA 的 Selene 和 EOS73、Stability 的 4,000 张 A10074,这些私营算力集群的 GPU 数量已经超过了 Leonardo、Perlmutter、JUWELS、Polaris、MeluXina、Narval、Karolina、Tursa、Jean Zay、MareNostrum 这些国家级超算。
政府采购的复利效应
The compounding effects of government contracting in AI
1962 年,美国政府买下了全世界所有的集成电路,极大推动了这项技术及其终端市场的发展。现在一些政府又在提供同样的机会,成为 AI 公司的「第一买家」(buyers of first resort)75。拿到独特的高质量数据后,这些公司在构建消费级或企业级 AI 软件时会获得优势。
- 研究者考察了中国的人脸识别 AI 公司,证明了它们签下的政府合同数量与其累计产出的通用 AI 软件量之间存在因果关系76。不出所料,计算机视觉领域的领导地位现在很大程度上已经让给了中国公司。
- 这个原理在其他强监管行业同样成立,比如国防或医疗——它们通过独特数据建立起的专长,是可以迁移到日常 AI 产品上的。
大厂拿消费级语言模型产品怎么办
How should big tech deal with their language model consumer products?
Meta 在 2022 年 8 月免费公开发布聊天机器人 BlenderBot3,结果因为机器人满嘴错误信息而遭遇灾难性的媒体反馈。与此同时,2021 年 5 月就发表了 LaMDA 论文的 Google 选择把系统留在内部。但在 BlenderBot 发布几周后,Google 宣布了一个更大的计划「AI test kitchen」,让普通用户能与包括 LaMDA 在内的最新 AI agent 交互77。
- 把 AI 系统大规模放给 Google 和 Facebook 的十亿级用户,几乎必然会让这些系统的每一个伦理或安全问题都被暴露出来,不管是偶然还是被对抗性地问出来。但只有让这些系统被广泛使用,这些公司才能修复问题、理解用户行为、创造有用且可盈利的系统。
- 为了躲开这个两难,LaMDA 论文的 4 位作者去创办或加入了 Character.AI,这家公司自称「一家创造革命性开放式对话应用的 AI 公司」78。值得持续关注。
顶级 AI Lab 的人才外流
DeepMind and OpenAI alums form new startups and Meta disbands its core AI group
曾被认为不可撼动的一线 AI 实验室,人才正在挣脱束缚、走向创业。这些校友们在做 AGI、AI safety、生物科技、金融科技、能源、开发工具和机器人。另一边,Meta 在让自己的中心化 AI 研究组织脱离产品路线图压力自由运行了近 10 年后,把它折叠掉了——Meta 的结论是「虽然这个 [AI] 组织的中心化性质在某些方面给了我们杠杆,但也让它难以像我们期望的那样深度融入业务」。
Attention is all you need… to build your AI startup
那篇引入 transformer 的里程碑论文,8 位作者中除了 1 位以外全部离开 Google 去创业了,方向涵盖 AGI、对话智能体、AI-first 生物科技和区块链。2022 年他们的融资额:Anthropic 5.8 亿美元79、Inflection 2.25 亿美元80、Cohere 1.25 亿美元81、Adept 6,500 万美元82。
AI 编程助手快速商业化
AI coding assistants are deployed fast, with early signs of developer productivity gains
OpenAI 的 Codex 从研究(2021 年 7 月)到公开商业化(2022 年 6 月)走得非常快,(微软的)GitHub Copilot 现已公开发售,每月 10 美元或每年 100 美元83。亚马逊随后在 2022 年 6 月宣布 CodeWhisperer 进入预览84。Google 透露自己在用一个内部的 ML 代码补全工具(所以也许再过几年就会出现在浏览器 IDE 里?)85。与此同时,拥有 100 万以上用户的 tabnine 融资 1,500 万美元,主打准确的多行代码补全86。
Google 内部工具的指标(用户为 1 万多名 Google 内部开发者,多行实验为 5 千多名):
| 指标 | 单行 | 多行 |
|---|---|---|
| ML 贡献的代码占比 | 2.6% | 0.6% |
| 每次接受的平均字符数 | 21 | 73 |
| 接受率(可见超过 750ms 的建议) | 25% | 34% |
| 编码迭代时长缩短 | 6% | - |
AI 药物研发进入临床
AI-first drug discovery companies have 18 assets in clinical trials, up from 0 in 2020
AI-first 药物研发公司现在有 18 个资产处于临床试验阶段,而 2020 年是 0 个。 早期发现阶段的资产还要多得多。我们预计从 2023 年起会看到早期临床读出数据(数据截至 2022 年 8 月 26 日)。
Can AI and compute bend the physical reality of clinical trial chokepoints?
一项覆盖 2011–2020 年间 6,151 次成功阶段跃迁的研究发现,一款药物平均需要 10.5 年才能获得监管批准,其中 I 期 2.3 年、II 期 3.6 年、III 期 3.3 年、监管阶段 1.3 年。更麻烦的是,招募一名临床试验患者平均要花 6,500 美元,而由于 30% 的患者最终会因不依从而退出,全负荷的招募成本接近每位患者 19,500 美元87。AI 承诺更好更快的药物,但我们今天首先得解决临床试验的物理瓶颈88。
语言模型预测病毒变种,影像诊断拿到自主认证
Predicting the evolution of real-world covid variants using language models
mRNA 疫苗龙头 BioNTech 与企业 AI 公司 InstaDeep 合作构建并验证了一套早期预警系统(EWS)来预测高风险变种89。这套 EWS 能识别出全部 16 个 WHO 认定的变种,平均比官方认定早一个半月以上90。
- 一个大型预训练蛋白质语言模型在变种的病毒刺突蛋白序列上训练。
- 新的刺突蛋白变种被送入 transformer,输出 embedding 以及每个位点上 20 种天然氨基酸的概率分布,用以判断这会如何影响免疫逃逸和适应度。
- 图中红色虚线是 EWS 预测该变种为高风险的日期,绿色点划线是 WHO 认定的日期。几乎所有情况下,EWS 都提前数月发出了警报。
The first regulatory approval for an autonomous AI-first medical imaging diagnostic
立陶宛初创公司 Oxipit 拿到了业内第一张自主运行的计算机视觉诊断认证91。这套系统会对没有异常的胸片自主出具报告,放射科医生不需要再看它们。
- 由于放射科医生短缺、影像量不断增加,判断哪些 X 光片有病变、哪些没有,本身就是一项有挑战的诊断任务。
- Oxipit 的 ChestLink 是一套负责识别「正常」扫描的计算机视觉系统。
- 系统在超过 100 万张多样化图像上训练。在一项针对 1 万张芬兰基层医疗患者胸片的回顾性研究中,AI 识别临床显著病变的敏感度达到 99.8%,特异度为 36.4%92。
- 也就是说,AI 可以可靠地从基层医疗数据集中移除 36.4% 的正常胸片,假阴性数量极少,实际上不损害患者安全,同时显著减少工作量。
大学 spinout:AI 创业公司的温床与陷阱
Universities are a hotbed for AI spinouts: the UK case study
大学是 AI 公司的重要来源,Databricks、Snorkel、SambaNova、Exscientia 等都出自大学。在英国,4.3% 的 AI 公司是大学 spinout,而所有英国公司这一比例只有 0.03%93。AI 确实是 spinout 形成最集中的行业之一。但这有一个昂贵的代价:技术转移办公室(TTO)谈出来的 spinout 条款往往对创始人极不友好,比如占股比例过高或对销售收取版税94。
Spinout.fyi: an open database to help founders and policymakers fix the spinout problem
Spinout.fyi 众包了一个来自全球 70 多所大学创始人的 spinout 条款数据库95。数据库涵盖 AI 和非 AI 公司、不同产品品类(软件、硬件、医疗、材料等),显示英国的情况虽然对创始人格外劝退,但并不孤立。只有少数地区显得对创始人友好,比如北欧和瑞士(尤其是 ETH Zürich)。造成当前局面的一个主要原因是创始人与 TTO 之间的信息不对称,而 spinout.fyi 数据库正是要在这个过程中给创始人一点筹码。
As 5-year programmes in Berkeley and Stanford wrap up, what comes next?
2011 年,UC Berkeley 启动了「Algorithms, Machines, and People」(AMPLab),这是一个由研究机构和企业支持、教授与学生共同参与的 5 年期协作研究议程96。这个项目著名地开发出了大数据关键技术 Spark(分拆为 Databricks,380 亿美元估值)以及 Mesos(分拆为 Mesosphere)。
这个极其成功的项目在 2017 年得到了续作:Berkeley 的 RISELab(Real-time Intelligence Secure Explainable Systems)97和 Stanford 的 DAWN(Data Analytics for What’s Next)98,两者都聚焦 AI 技术。RISELab 创造了 Ray 这个 ML 负载管理器(分拆为 Anyscale,10 亿美元估值),DAWN 则创造并分拆出了主动标注平台 Snorkel(10 亿美元估值,融资 2.5 亿美元)。其他大学和国家会从这套 5 年制模型的成功中学到东西,去资助有高分拆潜力的雄心勃勃的开源研究吗?
2022 年 AI 融资降温
In 2022, investment in startups using AI has slowed down along with the broader market
使用 AI 的私营公司预计 2022 年融资额比去年少 36%,但仍有望超过 2020 年水平99。这与全球所有初创和成长期公司的投资情况可比——后者预计下降 24%。
- 使用 AI 的公司:2021 年 1,114 亿美元 → 2022 年预计 709 亿美元(2020 年为 475 亿美元)。
- 所有初创和成长期公司:2021 年 7,265 亿美元 → 2022 年预计 5,532 亿美元。
The drop in investment is most noticeable in megarounds
投资下滑最明显的是 1 亿美元以上的大轮次(-55%),而更小的轮次预计全年在全球达到 309 亿美元,几乎与 2021 年持平(-9%)。
Public valuations have dropped in 2022, while private keep growing
公开市场使用 AI 的公司合计企业价值(EV)已经跌回 2020 年水平(-29%,从 9.6 万亿降至 6.8 万亿美元),而私营公司的估值还在涨,合计 EV 已达 2.2 万亿美元,比去年增长 16%。
The US leads by the number of AI unicorns, followed by China & the UK
美国已经创造了 292 家 AI 独角兽,合计企业价值 4.6 万亿美元。之后是中国(1.4 万亿美元)、英国(2,070 亿美元)、以色列(530 亿美元)、德国(560 亿美元)、新加坡(390 亿美元)、瑞士(140 亿美元)、加拿大(120 亿美元)。
Investment in the USA accounts for more than half of the worldwide VC
尽管美国 AI 公司的融资额显著下滑,美国仍占全球 AI 投资的一半以上:2022 年 YTD 为 53%,2021 年为 57%。2022 年 YTD 数据:美国 251 亿美元、中国 89 亿美元、欧盟 27 国 + 瑞士 + 挪威 75 亿美元、英国 38 亿美元。
Enterprise software is the most invested category globally, while robotics captures the largest share of VC investment into AI
按 2010–2022 YTD 累计投资额,企业软件是全球投资最多的品类(1,337 亿美元),之后是交通运输(1,095 亿美元)、金融科技(878 亿美元)、健康(617 亿美元)、机器人(489 亿美元)。但按「AI 公司融资额占该行业全部 VC 的比例」看,机器人以 71% 高居榜首,其次是半导体 41%、食品 24%、旅游 24%、营销 25%、安全 13%。
Acquisitions are on track to exceed the 2021 level
IPO 和 SPAC IPO 数量急剧下滑,但并购数量有望超过 2021 年水平100。2022 年的大额交易包括:房地产技术与数据分析公司 131 亿美元被收购(5 月)、规划与预测 SaaS 107 亿美元被买断(3 月)、客户体验工具 102 亿美元买断(6 月)、税务合规软件 84 亿美元买断(8 月)、消费机器人公司 17 亿美元被收购(8 月)。
The number of exits in EU-27, Switzerland & Norway has already exceeded 2021 levels
美国至今 108 笔退出,还不到 2021 年的一半,而欧盟 27 国、瑞士和挪威合计已经超过了 2021 年的数字。
Investment in SaaS startups & scaleups using AI is expected to reach $41.5B by the end of the year
使用 AI 的 SaaS 公司预计全年融资 415 亿美元,比去年下降 33%,但仍高于 2020 年(311 亿美元)。
The combined EV of public and private SaaS startups & scaleups using AI now amounts to $2.3T
使用 AI 的 SaaS 公司(含上市和未上市)合计企业价值现在是 2.3 万亿美元,比去年下降 26%,但仍高于 2020 年(2.1 万亿美元)。
The combined EV of private SaaS startups & scaleups using AI keeps growing
私营 AI SaaS 公司的合计 EV 还在涨,已达 1.1 万亿美元,比去年增长 12%。 估值最高的几家:Stripe(金融基础设施平台,美国,684 亿美元)、Checkout.com(全球支付,英国,400 亿美元)、Databricks(统一数据、分析与 AI 的 lakehouse 平台,美国,380 亿美元)、自动驾驶技术公司(美国,300 亿美元)、在线教育平台(中国,155 亿美元)、Fintech-as-a-service 平台(英国,150 亿美元)、流程挖掘软件(德国,130 亿美元)、AI 写作助手(美国,130 亿美元)。
04 Politics
Politics 进展总结
- 大规模 AI 实验中学术界的占比已经从约 60% 跌到接近 0%,算力鸿沟已经难以弥合。
- 接力棒交给了去中心化研究集体:Eleuther、BigScience、Stability 用非传统资金做出了原本被认为只有大厂才做得出的成果。
- 芯片成为地缘政治的正面战场:CHIPS 法案投入 2,500 亿美元,美国禁止 NVIDIA 和 AMD 向中国出口最先进 AI 芯片。
学术界与工业界的算力鸿沟
A widening compute chasm is separating industry from academia in large model AI
过去十年,大规模 AI 实验的算力需求增长了 30 万倍以上。同一时期,由学术界主导的这类项目占比从约 60% 暴跌到接近 0%101。如果 AI 社区要继续扩大模型规模,这道「有」与「没有」的鸿沟会给 AI 安全、思路多样性、人才集中度等带来严重挑战。
Slow progress in providing academics with more compute leaves others to act faster
人们越来越意识到,AI 是一门工程科学——研究对象必须先被造出来。西方学术界和政府开始正视这一现实,最显著的是美国的 National AI Research Resource(NAIRR)流程。但在花了数年时间做咨询和宣传的同时,中国和学术界之外的其他人正在用有创意的方式做大规模 AI 项目。
对比很扎眼:政府/学术界这条线上是 National AI Initiative Act 生效、NAIRR 工作组成立、开了 10 次会、Stanford 成立基础模型研究中心、清华的 GLM-130B;研究集体那条线上是 Eleuther 的 The Pile、GPT-Neo、GPT-J-6B、GPT-NeoX-20B,BigScience 的 BLOOM-178B,以及 Stability 的 Stable Diffusion。
The baton is passing from academia to decentralized research collectives
去中心化研究项目正在获得成员、资金和势能。它们成功完成了此前被认为只有大型中心化科技公司才可能做到的大规模模型和数据项目,最显眼的例证就是 Stable Diffusion 的公开发布102。
- 今年最值得注意的大规模学术项目来自中国:清华的 GLM-130B。
- Eleuther 这个最早的 AI 研究集体发布了 200 亿参数的 GPT-NeoX。不过核心成员此后陆续去了 OpenAI、Stability 和 Conjecture。
- Hugging Face 主导的 BigScience 计划发布了 1,780 亿参数的多语言 LLM BLOOM。
- Stability 凭空杀出,搞到 4,000 张 A100 GPU,把多个开源社区聚到一起,做出了 Stable Diffusion。
Stability AI is attempting a new paradigm in commercializable open-source AI
此前大规模项目只能依赖临时性的算力捐赠,Stability 正在开创一种新做法:为开源社区提供结构化的算力和资源,同时把这些项目商业化并与开发者分成。
- Stability 已经把自己嵌入成独立和学术开源 AI 社区的算力平台:支持 LAION 构建 50 亿图文对的数据集并训练开源 CLIP 模型,支持 CompVis 组在高效 diffusion model 上的研究。它资助博士生做社区项目,并直接雇佣了生成式 AI 艺术家、Eleuther 的核心成员以及 David Ha 这样的知名 ML 研究者。
- Stable Diffusion 的训练成本不到 60 万美元,权重公开发布的同时,也通过 DreamStudio API 售卖访问权103。
AI 在国防领域的渗透与融资
AI continues to be infused into a greater number of defense product categories
国防技术公司正在把 AI 应用到电子战、地理空间传感器融合,以及自主硬件平台上。
- 2018 年成立的 Epirus 造出了新一代电磁脉冲武器,能击溃威胁人身安全的无人机蜂群104。瑞典的 Saab 也在推动电子战的 AI 自动化:他们构建的 COMINT 和 C-E.SM 传感器可以根据战场态势在自动化与操作员控制之间平衡105。该公司还在与国防初创公司 Helsing 合作。
- 2020 年成立的 Modern Intelligence 构建平台无关的 AI,用于地理空间传感器数据融合、态势感知和海上监视。
- Anduril 则通过内生和外延两种方式扩张自主硬件平台。比如收购 Area-I 后推出了 Air Launched Effects 新产品 Altius-700,载荷更大、支持与其他无人机的数据共享与集成106。Anduril 还通过收购 Dive Technologies 进入了水下自主航行器领域。
AI in defense gathers big funding momentum
重金加持的初创公司,加上亚马逊、微软和 Google,正在继续让 AI 在国防中的使用常态化。
- NATO 发布了自己的 AI 战略,并宣布设立 10 亿美元基金投资各类军民两用技术公司,被形容为全球第一支「多主权风险投资基金」,横跨 22 个国家107。
- 欧洲国防 AI 公司 Helsing 宣布了由 Spotify 的 Daniel Ek 领投的 1.025 亿欧元 A 轮108。
- 微软、亚马逊和 Google 继续争夺国防领域的重要角色——最著名的是微软与五角大楼的 100 亿美元合同在亚马逊起诉后被取消,新的受益方将在 2022 年底公布。
- Anduril 拿下了迄今为止最大的一笔国防部合同,据报道估值已达 70 亿美元109。
- 军用无人机开发商 Shield AI 以 23 亿美元估值完成融资110。
Ukraine’s homegrown geospatial intelligence GIS Arta software is a sign of things to come
据报道,地理空间(GIS)软件的使用把炮兵的决策链从 20 分钟压缩到了 1 分钟以内111。
- GIS Arta 是一款在俄罗斯入侵之前就基于顿巴斯冲突经验开发的本土应用。
- 它是一套用于无人机、炮兵或迫击炮打击的制导指挥控制系统。
- 这个应用摄入各种形式的情报(来自无人机、GPS、前沿观察员等),并转换成侦察和炮击的调度请求。
- GIS Arta 据称是由 Yaroslav Sherstyvk 带领的一支志愿软件开发者团队开发的,灵感来自 Uber 的打车模型。
芯片回流与 CHIPS 法案
The Great Reshoring will be slow: US lags in new fab projects, which take years to build
1990 年到 2020 年间,中国的新建晶圆厂项目产出加速了近 7 倍,而美国放慢了 2.5 倍。而且,中国和台湾的晶圆厂从开工到具备量产条件大约需要 650 天,美国今天建厂的速度比 30 年前慢了 42%112。
The US CHIPS and Science Act of 2022: $250B for US semiconductor R&D and production
这项两党立法在 2022 年 8 月签署成法。它拿出 530 亿美元支持美国本土的半导体研发、劳动力和制造,并为半导体制造商的资本支出提供 25% 的投资税收抵免113。作为交换,受助方 10 年内不得在中国升级或扩张既有业务,也不能把资金用于股票回购或分红。
- 这个法案给韩国(如三星)、台湾(如台积电)等地的制造商出了一道难题:如果接受美国补贴,就必须在不激怒北京的前提下从中国转向——而北京明确反对这种「friendshoring」。
- 法案通过后,美光宣布在存储芯片制造上投资 400 亿美元,把美国市场份额从 2% 提到 10%。高通将在 2027 年前把美国半导体产能扩大 50%,并与 GlobalFoundries 合作投资 42 亿美元扩建后者在纽约州北部的工厂。
- CSET 估计美国应当把制造能力聚焦在先进制程、传统逻辑和 DRAM 上114。
The US cuts China off from NVIDIA and AMD chips…will this spur Chinese AI R&D?
NVIDIA GPU 被所有中国主要科技公司(百度、腾讯等)和大学(清华、中科院等)使用。华盛顿要求 NVIDIA 和 AMD 停止向中国出口最新的 AI 芯片(如 NVIDIA A100 和 H100、AMD M100 和 M200),理由是遏制其用于经由中国威胁美国国家安全的应用115。两家公司还必须提供过往出货统计和客户名单。如果国内供应商不能快速补位,拿不到最先进 AI 芯片可能让中国相当一部分产业停摆。
- 今年早些时候,CSET 分析了 2020 年中国人民解放军单位和国有国防企业授予的 24 份公开合同。他们发现这些采购订单中的 97 颗 AI 芯片几乎全部由 NVIDIA、AMD、Intel 和 Microsemi 设计,国产 AI 芯片公司一个都没出现。也就是说,美国芯片在武装中国的国防能力116。
- 中国半导体制造商此前已经被切断了 ASML 的先进光刻机以及 Lam Research、Applied Materials 的相关设备。
- 国产 AI 芯片公司(如壁仞)不太可能填上这个窟窿:先进制程节点制造仍然只有台湾的台积电做得到,而国内的人才、软件和技术距离 NVIDIA 还有数年之遥。中国仍会加速自己的发展117。
欧盟推进 AI Act
The EU advances with its plans to regulate AI
2021 年 4 月,欧盟提出了一项针对 AI 系统在欧盟境内投放市场和使用的监管提案,即 AI Act。提案对所有在用的 AI 系统提出了一些最低要求(主要是信息义务),并对给用户带来更高风险的 AI 系统提出了更复杂的要求(风险评估、质量管理)。AI Act 还禁止了某些类型的 AI 技术使用,比如社会评分、实时生物特征远程识别(有例外)、「潜意识技术」。
- AI Act 正在走欧盟立法流程。欧洲议会整个夏天都在处理各委员会提出的修正案和意见,形成折中文本。折中文本计划在 2022 年底前走完议会的各阶段表决。
- AI Act 预计将在 2023 年被表决成法,届时轮值主席国是瑞典或西班牙。
- 目前的现实预期是,AI Act 会在 2023 年下半年生效。
The EU aims at quick operationalization of the AI Act
欧盟希望通过标准化、建设测试设施、启动泛欧和各国监管沙盒,来快速落地 AI Act 的要求。
- 欧洲标准化工作已经启动。欧盟标准化组织 CEN 和 CENELEC 已经开始准备工作,预计会被要求在 2024 年 10 月 31 日前制定出相关标准集。
- 欧盟似乎倾向于把对高风险 AI 系统的测试——在受控条件下甚至可能在真实世界条件下——作为促进各类规模企业合规的合适方式。
- 泛欧和各国监管沙盒开始出现。西班牙在 2022 年 6 月启动了第一个,捷克等其他成员国也宣布了类似计划。监管方把沙盒视为技术、政策和标准化方案的合适试验台,也把它当作帮助中小企业达成 AI Act 合规的媒介。
05 Safety
Safety 进展总结
- AI Safety 从科幻话题变成了政策文件里的正式条目,英国国家 AI 战略多次提及 AGI 未对齐的长期风险。
- 共识在移动:69% 的 ML 社区受访者认为 AI Safety 应当被更优先对待,近 40% 的 NLP 研究者认为 AI 可能在本世纪造成核战级别的灾难。
- 但资源极度失衡:全职做 AI Safety 的研究者约 300 人,全部安全资金加起来甚至比不上 DeepMind 2018 年的运营支出。
灾难性风险从科幻走进政策文件
While AI advances rapidly, the safety of highly-capable future systems remains unclear
虽然很多担忧看起来仍然是思辨性的,但早期的 AI 先驱们就已经认为,未来高能力、深度嵌入经济的 AI 系统可能会灾难性地失败并对人类构成风险,包括出现直接对抗人类监督与控制的行为118。
- 「……一旦机器思考的方法开始,它很可能不需要多久就会超越我们微弱的能力。……因此在某个阶段,我们应当预期机器会接管控制权。」——Alan Turing
- 「因此,第一台超智能机器是人类需要制造的最后一项发明,前提是这台机器足够温顺,愿意告诉我们如何控制它。」——I.J. Good
- 「问题在于,面对如此强大的机器,只需要设计上一点点疏忽的意外,它们就会把自己的目标置于我们的目标之上。」——Marvin Minsky119
The UK is taking the lead on acknowledging these uncertain but catastrophic risks
英国 2021 年末发布的国家 AI 战略,罕见地多次提到 AI safety 和未对齐 AGI 带来的长期风险120。
- 「虽然通用人工智能(AGI)的出现听起来像科幻概念,但对 AI safety 和非人类对齐系统的担忧,绝不仅限于这个领域的边缘。」
- 「我们坚定认为,关注这项技术的演化、认真对待 AGI 与『更通用 AI』的可能性、并主动把技术导向和平且与人类对齐的方向,是至关重要的。」
- 「政府认真对待未对齐 AGI 的长期风险,以及它会给英国和世界带来的不可预见的变化。」
- 「[我们必须] 建立中长期的地平线扫描机制,以提高政府对 AI safety 的认知。」
- 「[我们必须] 与国家安全、国防部门和领先研究者合作,理解如何预判和预防灾难性风险。」
研究者共识、人才与资金
AI researchers increasingly believe that AI safety is a serious concern
长期被主流 AI 研究和学术界当作科幻打发掉的话题,现在共识正在向「更担心近期出现的人类级 AI 和超人类 AGI 的风险」偏移。
- 一项针对 ML 社区的调查发现,69% 的人认为 AI safety 应当比现在被更优先对待121。
- 另一项针对 NLP 社区的调查发现,多数人认为 AGI 是一个重要问题且我们正在朝它推进。超过 70% 的人认为 AI 会在本世纪带来工业革命级别的社会变化,近 40% 的人认为 AI 可能在这段时间内造成核战争级别的灾难122。
AI safety is attracting more talent… yet remains extremely neglected
对 AI 存在性风险认知的提升带来了人手增加,估计现在有约 300 名研究者全职从事 AI safety。但这仍然比整个领域的研究者少几个数量级,而后者正在以前所未有的速度增长123。
- 新的非营利研究实验室包括 Center for AI Safety 和 Fund for Alignment Research。Centre for the Governance of AI 从牛津的 Future of Humanity Institute 分拆为独立机构。
- 教育项目的兴趣暴涨,超过 750 人参加了在线的 AGI Safety Fundamentals 课程。新设了一些奖学金,包括 Vitalik Buterin PhD Fellowship in AI Existential Safety。
- 值得注意的是,OpenAI 首席科学家 Ilya Sutskever 已经把 50% 的时间转向安全研究。
Funding secured, though trailing far behind what goes into capabilities
对 AI 存在性风险认知的提升也带来了安全研究资金的快速增长,主要来自同情这一议题的科技富豪的捐赠和投资:Dustin Moskovitz(Open Philanthropy)124和 Sam Bankman-Fried(FTX Foundation)125。然而,VC 和慈善资金加起来的安全投入仍然远远落后于先进能力研究的资源,甚至比不上 DeepMind 2018 年的运营支出126。(报告把 Adept、Hugging Face、Cohere、AI21、Stability 和 Inflection 的融资算作 Capabilities VC,把 Anthropic 的融资算作 Safety VC。)
LLM 对齐:RLHF 与语言反馈
Language Model Alignment: Reinforcement Learning from Human Feedback (RLHF)
RLHF 已经成为微调 LLM 并使其与人类价值对齐的关键方法。 具体做法是:让人类对给定输入下采样出的语言模型输出进行排序,用这些排序学出一个人类偏好的 reward model,再把它当作奖励信号用 RL 微调语言模型。
- OpenAI 在年初用 RLHF 微调 GPT-3,得到在指令跟随任务上更有帮助的 InstructGPT 模型127。值得注意的是,这次微调只用了不到 GPT-3 预训练算力的 2%,以及 2 万小时的人类反馈。API 用户平均而言更喜欢这些模型而不是原始模型。
- RLHF 也被 Anthropic 和 DeepMind 用来提升语言模型的 helpfulness、harmlessness 和正确性128。OpenAI 已经声明 RLHF 将是其对齐 AGI 长期方案的核心构件129。
Language Model Alignment: Reinforcement Learning from Human Feedback
相比人类使用的语言的完整表达力,RLHF 的 preference model 提供的学习信号是很有限的。NYU 的研究者证明,语言模型可以直接用人类写成语言的反馈来改进130。
- 值得注意的是,他们的方法数据效率极高:仅用 100 条人类反馈样本,他们就把 GPT-3 在摘要任务上的能力微调到了人类水平。
- 在一个「从句子中移除冒犯性词汇」的合成任务上,他们观察到只有最大的 GPT-3 模型才能有效吸收反馈,这又是一个规模带来涌现行为的例子。
Red teaming 与机制可解释性
Language Model Alignment: Red Teaming
随着语言模型展现出越来越多的能力,穷举评估它们的失败模式变得困难,这阻碍了信任的建立和安全的公开部署。DeepMind 引入了自动化「red teaming」:用其他语言模型自动「攻击」目标语言模型,让它表现出不安全行为,是否不安全由一个单独的分类器判定131。
- Anthropic 用人工 red teaming 评估 RLHF 模型,发现随着模型规模增大,它们更难被攻击、也更少产生有害输出132。
- 未来,分类器可以用来检测诸如权力寻求(power-seeking)行为或恶意编码这类思辨性风险。
Mechanistic interpretability – can we reverse-engineer neural networks?
把深度神经网络仅仅看作一串矩阵运算时,解释它极其困难。机制可解释性(mechanistic interpretability)研究转而试图把模型逆向工程成人类可读的计算机程序,理解单个神经元以及它们的集体行为133。
- Anthropic 的研究者发布了对小型 transformer 语言模型的重要分析,聚焦一个叫 induction head 的现象:这些注意力头学会复制并补全文本中此前出现过的序列。他们发现这些头在训练的「相变」期间涌现,而 in-context learning 能力也在同一时期出现,并进一步提出假设:这些头可能是大型 transformer 模型中大部分 in-context learning 能力的来源134。
- 这个方向的后续工作还揭示了单个神经元如何对应单个或多个语义特征,以及如何控制这类可解释性。
目标错误泛化与道德行为评测
Goal misgeneralization – agents can learn the right skills but the wrong objective
使用 RL agent 的一个担忧是,它们可能学会了很强的技能,却没有学会正确的目标,而且这种失败只在测试时的分布偏移下才暴露出来。今年 ICML 上的一篇论文首次在实证上展示了这个问题135。
- Agent 在 CoinRun 视频游戏任务上训练,在这个任务里,到达关卡末尾的金币就能获得奖励并通关。
- 测试时,金币被随机放在关卡中间。Agent 保持了导航和越障的能力,却无视金币径直冲向关卡末尾——说明它没有学到正确的目标。
Measuring moral behavior in artificial agents
研究者发布了一套用于评估 AI 道德行为的序贯决策环境136。
- 未来的人工 agent 可能在大量既不惩罚、甚至还会奖励谋杀和盗窃这类行为的环境上做预训练。
- Jiminy Cricket 环境在 25 个语义丰富的文字冒险游戏中评估道德行为。Agent 能采取的每一个动作,都在若干道德维度上被标注。
- 作为第一步,CMPS 使用带有道德知识的语言模型,并把这些知识中介成行动,这大幅减少了训练过程中的不道德行为。
Conjecture:第一家纯做 AGI 对齐的创业公司
Conjecture is the first well funded startup purely focusing on AGI alignment
与 DeepMind、Google Brain、OpenAI 和其他主要研究实验室不同,Conjecture 主要聚焦 AI Alignment,强调概念性研究和与其他组织「不相关的下注」。
- Conjecture 是一家伦敦创业公司,由 Connor Leahy 领导,他此前共同创立了 Eleuther——那个开启了大模型去中心化开发的组织。
- Conjecture 的运作前提是:AGI 会在未来 5 年内被开发出来,并且按当前轨迹会与人类价值未对齐,从而给我们这个物种带来灾难。
- 他们从 Github、Stripe 和 FTX 的创始人等投资者那里融了数百万美元。
- 他们是第一个公开发布内部 infohazard 政策的 AI Alignment 团队137。
- 这延续了一个更广的趋势:一些新的 AGI 导向实验室开始更认真地对待对齐研究(参见去年报告对 Anthropic 的介绍)。
06 Predictions
9 predictions for the next 12 months
作者对未来 12 个月的 9 条预测:
- DeepMind 训练出一个 100 亿参数的多模态 RL 模型,比 Gato 大一个数量级。
- NVIDIA 宣布与一家 AGI 导向的组织建立战略关系。
- 一个 SOTA 语言模型在比 Chinchilla 多 10 倍的数据点上训练,验证「数据集 scaling 优于参数 scaling」。
- 生成式音频工具出现,并在 2023 年 9 月前吸引超过 10 万名开发者。
- GAFAM 向某家 AGI 或开源 AI 公司(如 OpenAI)投资超过 10 亿美元。
- 半导体初创公司在 NVIDIA 的统治面前面对现实,某家高知名度初创公司被关停或以低于最近一轮估值 50% 的价格被收购。
- 一项「像监管生物安全实验室那样监管 AGI 实验室」的提案,获得英国、美国或欧盟某位民选政治人物的支持。
- 随着更多人意识到「让 AI 能力跑在安全前面」的风险,未来一年将有超过 1 亿美元投入专门的 AI Alignment 组织。
- 一家主要的用户生成内容网站(如 Reddit)与一家生产 AI 模型的初创公司(如 OpenAI)就在其用户生成语料上训练达成商业和解。
回头看 2022 年这份报告,最准的判断是 diffusion model 和 scaling law 的转向,最迟钝的判断是对芯片初创公司整合的反复押注。有意思的是,报告写完两个月后 ChatGPT 就发布了——这份 10 月 11 日定稿的 deck 里,RLHF 只是 Safety 章节里的一个技术条目,InstructGPT 被当作对齐研究的成果而不是产品拐点。真正的范式转折往往就藏在当年报告的边角里。感兴趣的读者强烈推荐阅读原报告2。
-
stateof.ai: https://www.stateof.ai/ ↩︎
-
State of AI Report 2022(Google Slides 原文): https://docs.google.com/presentation/d/1WrkeJ9-CjuotTXoa4ZZlB3UPBXpxe4B3FMs9R9tn34I ↩︎ ↩︎
-
IRIS: Transformers are Sample-Efficient World Models: https://arxiv.org/pdf/2209.00588.pdf ↩︎ ↩︎
-
MaxViT: Multi-Axis Vision Transformer: https://paperswithcode.com/paper/maxvit-multi-axis-vision-transformer ↩︎
-
DeepMind 与数学家合作的 Nature 报道: https://www.nature.com/articles/d41586-021-03593-1 ↩︎
-
Papers With Code 框架使用趋势: https://paperswithcode.com/trends ↩︎
-
Adept.ai 成立报道: https://techcrunch.com/2022/04/26/2304039/ ↩︎
-
Advancing mathematics by guiding human intuition with AI(Nature): https://www.nature.com/articles/s41586-021-04086-x.pdf ↩︎
-
Towards combinatorial invariance for Kazhdan-Lusztig polynomials(表示论): https://arxiv.org/pdf/2111.15161.pdf ↩︎
-
The signature and cusp geometry of hyperbolic knots(纽结理论): https://arxiv.org/pdf/2111.15323.pdf ↩︎
-
Pushing the frontiers of density functionals by solving the fractional electron problem(Science): https://www.science.org/doi/10.1126/science.abj6511 ↩︎
-
DeepMind: Discovering novel algorithms with AlphaTensor: https://www.deepmind.com/blog/discovering-novel-algorithms-with-alphatensor ↩︎
-
Discovering faster matrix multiplication algorithms with reinforcement learning(Nature): https://www.nature.com/articles/s41586-022-05172-4 ↩︎
-
Magnetic control of tokamak plasmas through deep reinforcement learning(Nature): https://www.nature.com/articles/s41586-021-04301-9.pdf ↩︎
-
DeepMind: AlphaFold reveals the structure of the protein universe: https://www.deepmind.com/blog/alphafold-reveals-the-structure-of-the-protein-universe ↩︎
-
ProGen2: Exploring the Boundaries of Protein Language Models: https://arxiv.org/pdf/2206.13517.pdf ↩︎
-
ESM-2 / ESMFold: Language models of protein sequences at the scale of evolution: https://www.biorxiv.org/content/10.1101/2022.07.20.500902v1.full.pdf ↩︎
-
OpenCell: Endogenous tagging for the cartography of human cellular organization(Science): https://www.science.org/doi/10.1126/science.abi6983 ↩︎
-
Machine learning-aided engineering of hydrolases for PET depolymerization(Nature): https://www.nature.com/articles/s41586-022-04599-z ↩︎
-
Leakage and the Reproducibility Crisis in ML-based Science: https://arxiv.org/pdf/2207.07048.pdf ↩︎
-
OpenAI: Learning to play Minecraft with Video PreTraining: https://openai.com/blog/vpt/ ↩︎
-
Video PreTraining (VPT) 论文: https://arxiv.org/pdf/2206.11795.pdf ↩︎
-
CodeGen: A Conversational Paradigm for Program Synthesis: https://arxiv.org/pdf/2203.13474.pdf ↩︎
-
AlphaCode: Competition-Level Code Generation with AlphaCode: https://arxiv.org/pdf/2203.07814.pdf ↩︎
-
PanGu-Coder: https://arxiv.org/pdf/2207.11280.pdf ↩︎
-
Efficient Transformers: A Survey: https://arxiv.org/pdf/2009.06732.pdf ↩︎
-
The Efficiency Misnomer: https://arxiv.org/pdf/2110.12894.pdf ↩︎
-
Google: Minerva - Solving Quantitative Reasoning Problems with Language Models: https://ai.googleblog.com/2022/06/minerva-solving-quantitative-reasoning.html ↩︎
-
OpenAI: Formal Mathematics Statement Curriculum Learning: https://arxiv.org/pdf/2202.01344.pdf ↩︎
-
Benchmark 提交动态研究(1,688 个 benchmark / 406 个任务): https://arxiv.org/pdf/2203.04592.pdf ↩︎
-
BIG-bench: Beyond the Imitation Game: https://arxiv.org/pdf/2206.04615.pdf ↩︎
-
Chinchilla: Training Compute-Optimal Large Language Models: https://arxiv.org/pdf/2203.15556.pdf ↩︎
-
OpenAI: Scaling Laws for Neural Language Models(2020): https://arxiv.org/pdf/2001.08361.pdf ↩︎
-
Emergent Abilities of Large Language Models: https://arxiv.org/pdf/2206.07682.pdf ↩︎
-
OpenAI: WebGPT: https://openai.com/blog/webgpt/ ↩︎
-
Adept: ACT-1: https://www.adept.ai/act ↩︎
-
Compute Trends Across Three Eras of Machine Learning: https://arxiv.org/pdf/2202.05924.pdf ↩︎
-
Improved Denoising Diffusion Probabilistic Models: https://arxiv.org/pdf/2102.09672.pdf ↩︎
-
Diffusion Models Beat GANs on Image Synthesis: https://arxiv.org/pdf/2105.05233.pdf ↩︎
-
Diffusion-LM Improves Controllable Text Generation: https://arxiv.org/pdf/2205.14217.pdf ↩︎
-
Video Diffusion Models: https://arxiv.org/pdf/2204.03458.pdf ↩︎
-
基于 diffusion 的三维分子生成: https://arxiv.org/pdf/2203.17003.pdf ↩︎
-
DALL-E 2: Hierarchical Text-Conditional Image Generation with CLIP Latents: https://arxiv.org/pdf/2204.06125.pdf ↩︎
-
Imagen: Photorealistic Text-to-Image Diffusion Models: https://arxiv.org/pdf/2205.11487.pdf ↩︎
-
Parti: Scaling Autoregressive Models for Content-Rich Text-to-Image Generation: https://arxiv.org/pdf/2206.10789.pdf ↩︎
-
Make-a-Scene: https://arxiv.org/pdf/2203.13131.pdf ↩︎
-
CogView2: https://arxiv.org/pdf/2204.14217.pdf ↩︎
-
Midjourney 已实现盈利的报道: https://www.theregister.com/2022/08/01/david_holz_midjourney/ ↩︎
-
Stable Diffusion 公开发布: https://stability.ai/blog/stable-diffusion-public-release ↩︎
-
DALL-E mini 开源实现: https://github.com/borisdayma/dalle-mini ↩︎
-
OpenAI: DALL-E 原始博客: https://openai.com/blog/dall-e/ ↩︎
-
SayCan: Do As I Can, Not As I Say: https://arxiv.org/pdf/2204.01691.pdf ↩︎
-
ConvNeXt: A ConvNet for the 2020s: https://arxiv.org/pdf/2201.03545v1.pdf ↩︎
-
Masked Autoencoders Are Scalable Vision Learners: https://arxiv.org/pdf/2111.06377.pdf ↩︎
-
Gato: A Generalist Agent: https://arxiv.org/pdf/2205.06175.pdf ↩︎
-
data2vec: https://arxiv.org/pdf/2202.03555.pdf ↩︎
-
NeRF at CVPR 2022 论文汇总: https://dellaert.github.io/NeRF22/ ↩︎
-
Plenoxels: Radiance Fields without Neural Networks: https://alexyu.net/plenoxels/ ↩︎
-
Block-NeRF(Waymo): https://waymo.com/research/block-nerf/ ↩︎
-
Mega-NeRF: Scalable Construction of Large-Scale NeRFs: https://openaccess.thecvf.com/content/CVPR2022/papers/Turki_Mega-NERF_Scalable_Construction_of_Large-Scale_NeRFs_for_Virtual_Fly-Throughs_CVPR_2022_paper.pdf ↩︎
-
基于微生物组的个体化抗菌药选择(Science): https://www.science.org/doi/10.1126/science.abg9868 ↩︎
-
Dual use of artificial-intelligence-powered drug discovery(Nature Machine Intelligence): https://www.nature.com/articles/s42256-022-00465-9 ↩︎
-
CSET: Counting AI Research: https://cset.georgetown.edu/publication/counting-ai-research/ ↩︎
-
NVIDIA H100 与 AI factory 发布: https://blogs.nvidia.com/blog/2022/03/22/ai-factories-hopper-h100-nvidia-ceo-jensen-huang/ ↩︎
-
NVIDIA Ampere 数据中心 GPU 量产公告: https://nvidianews.nvidia.com/news/nvidias-new-ampere-data-center-gpu-in-full-production ↩︎
-
NVIDIA 收购 Arm 期间的股价与收入数据(Koyfin): https://app.koyfin.com/share/dd60c3a469 ↩︎
-
NVIDIA: Designing Arithmetic Circuits with Deep Reinforcement Learning: https://developer.nvidia.com/blog/designing-arithmetic-circuits-with-deep-reinforcement-learning/ ↩︎
-
AWS Trainium (Trn1) 实例: https://aws.amazon.com/ec2/instance-types/trn1/ ↩︎
-
Adept 与 Oracle、NVIDIA 的合作: https://www.hpcwire.com/off-the-wire/adept-teams-with-oracle-and-nvidia-for-ai-innovation/ ↩︎
-
Meta AI Research SuperCluster (RSC): https://ai.facebook.com/blog/ai-rsc/ ↩︎
-
Meta 选择 Azure 作为战略云提供方: https://azure.microsoft.com/en-us/blog/meta-selects-azure-as-strategic-cloud-provider-to-advance-ai-innovation-and-deepen-pytorch-collaboration/ ↩︎
-
NVIDIA 发布 EOS 超级计算机: https://www.hpcwire.com/2022/03/22/nvidia-announces-eos-supercomputer/ ↩︎
-
Stability AI: Stable Diffusion 公告(含算力规模): https://stability.ai/blog/stable-diffusion-announcement ↩︎
-
Buyers of first resort: https://www.worksinprogress.co/issue/buyers-of-first-resort/ ↩︎
-
Stanford SCCEI: 政府合同与中国 AI 软件创新: https://sccei.fsi.stanford.edu/china-briefs/ai-software-innovation ↩︎
-
Google: Join us in the AI Test Kitchen: https://blog.google/technology/ai/join-us-in-the-ai-test-kitchen/ ↩︎
-
Character.AI: https://www.character.ai/ ↩︎
-
Anthropic 5.8 亿美元融资: https://techcrunch.com/2022/04/29/anthropics-quest-for-better-more-explainable-ai-attracts-580m/ ↩︎
-
Inflection AI 2.25 亿美元融资: https://techcrunch.com/2022/05/13/inflection-ai-led-by-linkedin-and-deepmind-co-founders-raises-225m-to-transform-computer-human-interactions/ ↩︎
-
Cohere 1.25 亿美元 B 轮: https://betakit.com/cohere-closes-125-million-usd-series-b-round-led-by-tiger-global/ ↩︎
-
Adept 6,500 万美元融资: https://www.businesswire.com/news/home/20220426005963/en/AI-Transformer-Inventors-Launch-Adept-with-65M-to-Lend-a-Hand-to-Knowledge-Workers ↩︎
-
GitHub Copilot 面向所有开发者正式可用: https://github.blog/2022-06-21-github-copilot-is-generally-available-to-all-developers/ ↩︎
-
Amazon CodeWhisperer: https://aws.amazon.com/codewhisperer/ ↩︎
-
Google: ML-Enhanced Code Completion Improves Developer Productivity: https://ai.googleblog.com/2022/07/ml-enhanced-code-completion-improves.html ↩︎
-
tabnine 新一代产品发布: https://www.tabnine.com/blog/announcing-tabnine-next-generation/ ↩︎
-
临床试验患者脱落的真实成本: https://mdgroup.com/blog/the-true-cost-of-patient-drop-outs-in-clinical-trials/ ↩︎
-
ClinicalTrials.gov 登记研究趋势: https://www.clinicaltrials.gov/ct2/resources/trends#RegisteredStudiesOverTimePostedResults ↩︎
-
BioNTech 与 InstaDeep 的高风险变种早期预警系统: https://www.instadeep.com/2022/01/biontech-and-instadeep-developed-and-successfully-tested-early-warning-system-to-detect-potential-high-risk-sars-cov-2-variants/ ↩︎
-
EWS 预印本: https://www.biorxiv.org/content/10.1101/2021.12.24.474095v2 ↩︎
-
Oxipit: 首个自主 AI 医学影像应用获批: https://oxipit.ai/news/first-autonomous-ai-medical-imaging-application/ ↩︎
-
ChestLink 在芬兰基层医疗胸片上的回顾性研究: https://arxiv.org/pdf/2205.08123.pdf ↩︎
-
Beauhurst: Spinouts Spotlight: https://www.beauhurst.com/research/spinouts-spotlight/ ↩︎
-
英国政府: Understanding UK AI R&D commercialisation and the role of standards: https://www.gov.uk/government/publications/understanding-uk-ai-rd-commercialisation-and-the-role-of-standards ↩︎
-
Spinout.fyi 开放数据库: https://www.spinout.fyi/data ↩︎
-
UC Berkeley AMPLab: https://amplab.cs.berkeley.edu/about/ ↩︎
-
UC Berkeley RISELab 成立: https://engineering.berkeley.edu/news/2017/01/berkeley-launches-riselab-enabling-computers-to-make-intelligent-real-time-decisions/ ↩︎
-
Stanford DAWN: https://dawn.cs.stanford.edu/ ↩︎
-
Dealroom: 全球使用 AI 的公司融资数据: https://app.dealroom.co/transactions.rounds/f/growth_stages/not_mature/rounds/not_GRANT_SPAC%20PRIVATE%20PLACEMENT/tags/not_outside%20tech/technologies/anyof_artificial%20intelligence_deep%20learning_machine%20learning?showScale=absolute&showStats=YEAR&statsType=rounds ↩︎
-
Dealroom: 使用 AI 的公司退出数据: https://app.dealroom.co/transactions.exits/f/rounds/anyof_BUYOUT_ACQUISITION_IPO_SPAC%20IPO/technologies/anyof_deep%20learning_artificial%20intelligence_machine%20learning?showStats=true&statsType=exits-count ↩︎
-
Compute and Data Trends in Machine Learning(含学术界占比): https://arxiv.org/pdf/2202.07785.pdf ↩︎
-
Sevilla et al. 大规模 AI 成果数据表: https://docs.google.com/spreadsheets/d/1AAIebjNsnJj_uKALHbXNfn3_YsT6sHXtCU0q7OIPuc4/edit#gid=0 ↩︎
-
Emad Mostaque 关于 Stable Diffusion 训练成本的推文: https://twitter.com/EMostaque/status/1563870674111832066 ↩︎
-
Epirus 反电子设备武器: https://www.epirusinc.com/counter-electronics ↩︎
-
Saab COMINT / C-ESM 传感器: https://www.saab.com/products/comint-c-esm ↩︎
-
Anduril 发布 Altius-700: https://blog.anduril.com/area-i-an-anduril-company-unveils-the-altius-700-2b8e856d48b5 ↩︎
-
NATO 人工智能战略: https://www.nato.int/cps/en/natohq/official_texts_187617.htm ↩︎
-
Daniel Ek 的基金投资 Helsing 1 亿欧元: https://techcrunch.com/2021/11/09/daniel-eks-fund-puts-e100m-into-defence-startup-helsing-ai-to-support-democracies/ ↩︎
-
Anduril 以 70 亿美元投前估值融资: https://techcrunch.com/2022/05/24/filing-anduril-is-raising-up-to-1-2b-sources-say-at-a-7b-pre-money-valuation-for-its-defense-tech/ ↩︎
-
Shield AI 以 23 亿美元估值融资 1.65 亿美元: https://techcrunch.com/2022/06/09/shield-ai-raises-165m-at-a-2-3b-valuation-to-fuel-development-of-its-military-autonomous-flying-systems/ ↩︎
-
GIS Arta 的精度与作战效果报道: https://www.isegoria.net/2022/07/no-western-artillery-system-is-as-capable-and-none-apparently-has-the-accuracy-offered-by-gis-arta/ ↩︎
-
CSET: No Permits, No Fabs: https://cset.georgetown.edu/wp-content/uploads/CSET-No-Permits-No-Fabs.pdf ↩︎
-
SIA: CHIPS Act of 2022 Fact Sheet: https://www.semiconductors.org/wp-content/uploads/2022/07/Pass-the-CHIPS-Act-of-2022-Fact-Sheet.pdf ↩︎
-
CSET: Sustaining U.S. Competitiveness in Semiconductor Manufacturing: https://cset.georgetown.edu/publication/sustaining-u-s-competitiveness-in-semiconductor-manufacturing/ ↩︎
-
SCMP: 美国 NVIDIA 芯片禁令对北京 AI 野心的直接威胁: https://www.scmp.com/tech/big-tech/article/3192213/tech-war-why-us-nvidia-chip-ban-direct-threat-beijings-artificial ↩︎
-
CSET: Silicon Twist(中国军方采购的 AI 芯片来源): https://cset.georgetown.edu/wp-content/uploads/CSET-Silicon-Twist-1.pdf ↩︎
-
Reuters: 禁令预计将利好中国本土竞争者: https://www.reuters.com/technology/us-ban-nvidia-amd-chips-seen-boosting-chinese-rivals-2022-09-08/ ↩︎
-
AI Risk and Opportunity: Humanity’s Efforts So Far(早期先驱观点汇编): https://www.alignmentforum.org/posts/i4susk4W3ieR5K92u/ai-risk-and-opportunity-humanity-s-efforts-so-far ↩︎
-
Marvin Minsky: True Names 后记: https://web.media.mit.edu/~minsky/papers/TrueNames.Afterword.html ↩︎
-
UK National AI Strategy: https://www.gov.uk/government/publications/national-ai-strategy ↩︎
-
AI Impacts: What do ML researchers think about AI in 2022: https://aiimpacts.org/what-do-ml-researchers-think-about-ai-in-2022/ ↩︎
-
NLP 社区调查: https://nlpsurvey.net/ ↩︎
-
80,000 Hours: 防止 AI 灾难的问题简介: https://80000hours.org/problem-profiles/artificial-intelligence/ ↩︎
-
Open Philanthropy: 高级 AI 潜在风险方向的资助记录: https://www.openphilanthropy.org/grants/?q=&focus-area=potential-risks-advanced-ai ↩︎
-
FTX Future Fund 资助记录: https://ftxfuturefund.org/all-grants/ ↩︎
-
DeepMind 财务申报记录: https://find-and-update.company-information.service.gov.uk/company/07386350/filing-history ↩︎
-
OpenAI: InstructGPT / Aligning language models to follow instructions: https://openai.com/blog/instruction-following/ ↩︎
-
Anthropic: Training a Helpful and Harmless Assistant with RLHF: https://arxiv.org/abs/2204.05862 ↩︎
-
OpenAI: Our approach to alignment research: https://openai.com/blog/our-approach-to-alignment-research/ ↩︎
-
Training Language Models with Language Feedback: https://arxiv.org/abs/2204.14146 ↩︎
-
Red Teaming Language Models with Language Models: https://arxiv.org/abs/2202.03286 ↩︎
-
Anthropic: Red Teaming Language Models to Reduce Harms: https://www.anthropic.com/red_teaming.pdf ↩︎
-
Anthropic: Transformer Circuits: https://transformer-circuits.pub/ ↩︎
-
Mechanistic Interpretability, Variables, and the Importance of Interpretable Bases: https://transformer-circuits.pub/2022/mech-interp-essay/index.html ↩︎
-
Goal Misgeneralization in Deep Reinforcement Learning: https://arxiv.org/abs/2105.14111 ↩︎
-
What Would Jiminy Cricket Do? Towards Agents That Behave Morally: https://arxiv.org/abs/2110.13136 ↩︎
-
Conjecture 内部 infohazard 政策: https://www.lesswrong.com/posts/Gs29k3beHiqWFZqnn/conjecture-internal-infohazard-policy ↩︎
Author houmin
Publish October 11, 2022
LastMod July 27, 2026
License 本作品采用 CC BY-NC-ND 4.0 许可协议进行许可,转载时请注明原文链接
如果你在浏览博客的过程中发现了任何问题,欢迎在对应文章下评论。如果你有其他事情想要咨询,可以通过邮件联系我。
-
No backlinks found.