这场对谈爆发在一个颇具历史意义的时间节点。。。。。。
2026 年 8 月7日,,,,Asian American Pioneer Medal Symposium(亚裔先锋者论坛) 在美国斯坦福大学举行。。。。。。论坛由 Asian American Scholar Forum(AASF,,,,亚裔学者论坛) 主理,,,,旨在表扬亚裔科学家、工程师和企业家对美国科技立异的主要孝顺,,,,并围绕人工智能、生命科学、能源、半导体、科研政策等前沿议题睁开交流。。。。。。近年来,,,,Asian American Pioneer Medal 已逐渐成为美国亚裔科技界最具影响力的年度活动之一。。。。。。
本场对谈由加州大学伯克利分校教授、国际着名人工智能与盘算机清静专家 Dawn Song(宋晓冬) 主持。。。。。。Dawn Song 恒久从事人工智能、清静、可信 AI 和盘算机系统研究,,,,是全球 AI 清静领域最具影响力的学者之一。。。。。。
嘉宾 Jeff Dean 是 Google 首席科学家(Chief Scientist),,,,也是现代人工智能基础设施最主要的涤讪者之一。。。。。。在已往二十余年里,,,,他先后加入或主导了 MapReduce、Bigtable、TensorFlow、TPU、Mixture of Experts(MoE) 以及 Gemini 等一系列具有里程碑意义的手艺,,,,对现代大规模盘算和人工智能的生长爆发了深远影响。。。。。。
这场访谈距离 Jeff Dean 宣布脱离 Google 仅已往十余小时。。。。。。
在竣事长达 27 年的 Google 生涯后,,,,他刚刚宣布与四位恒久相助同伴配合开办新公司 Discovery Loop,,,,致力于使用 AI 自动化科学研究与工程立异,,,,加速人类科学发明。。。。。。因此,,,,这场对谈也成为 Jeff Dean 创业后的首次果真深度访谈。。。。。。
Jeff Dean 回首了 MoE、TensorFlow、Gemini 等要害手艺降生背后的思索,,,,也分享了他关于 AI Agent、递归式自我刷新(Recursive Self-Improvement)、科研自动化,,,,以及未来十年人工智能生长的最新判断。。。。。。
MoE的降生
Dawn Song:
在正式最先之前,,,,我想先分享一段我与 Jeff 相识的履历,,,,也是我职业生涯中最难忘的回忆之一。。。。。。
那已经是快要十年前的事情了,,,,或许是在 ICLR 2017。。。。。。现在的 ICLR 已经生长为全球最主要的人工智能聚会之一,,,,但其时的规;;购苄。。。。。。,,参会者只有几百人,,,,现在天已经生长到数万人。。。。。。
那一年,,,,我们团队的一篇关于神经程序合成(Neural Program Synthesis)泛化能力的论文获得了 ICLR 最佳论文奖。。。。。。那照旧 AI Coding 和代码天生尚未兴起的年月。。。。。。Jeff,,,,不知道你是否还记得。。。。。。其时你专程走过来向我体现祝贺,,,,还笑着说:“这一年一共有三篇最佳论文,,,,一篇来自你们,,,,两篇来自 Google。。。。。。”
直到今天,,,,我依然记得谁人瞬间。。。。。。更让我印象深刻的是,,,,祝贺之后,,,,你马上兴奋地向我先容了另一项刚刚完成的研究——Mixture of Experts(MoE)。。。。。。
那篇论文有一个令人过目难忘的问题:?Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer?
其时听完你的先容,,,,我只以为这个想法很是大胆,,,,也很是有趣。。。。。。但坦率地说,,,,我完全没有想到——也不知道其时的你是否已经预见——它厥后会对整个人工智能行业爆发云云深远的影响。。。。。。今天,,,,险些所有最前沿的大模子,,,,都已经接纳了 MoE 架构,,,,或者深受它的影响。。。。。。
Jeff Dean:
MoE 最初的想法着实并不重大。。。。。。我们一直希望模子能够拥有极大的容量,,,,由于容量越大,,,,模子能够学习和记着的信息就越多。。。。。。但与此同时,,,,我们也希望它坚持足够高的盘算效率。。。。。。于是,,,,我们最先思索:是否真的有须要让模子的所有参数,,,,在每一次推理时所有加入盘算??
谜底显然是否认的。。。。。。
于是,,,,我们提出了一种??榛募芄梗耗W幽诓坑涤行矶嗖畋鸬摹白遥‥xperts)”,,,,每位专家各自善于差别类型的问题。。。。。。训练历程中,,,,模子会逐渐学习每位专家的专长;;而在推理时,,,,它只需要激活最适合目今使命、目今 Token 的少数几个专家即可。。。。。。
这样,,,,模子既拥有极大的总体容量,,,,又无需肩负所有参数同时盘算所带来的本钱。。。。。。
这个思绪着实与人脑很是相似。。。。。。人的大脑有差别区域认真差别功效。。。。。。例如,,,,当你思索莎士比亚十四行诗时,,,,大脑中的一部分区域会被激活;;而当你正在开车,,,,一辆垃圾车突然倒车朝你驶来时,,,,认真危险感知的另一部分区域会连忙接受事情。。。。。。它们并不会一直同时势情。。。。。。
因此,,,,让模子只挪用真正需要的部分,,,,不但切合盘算效率,,,,也切合自然界节约能量的方式。。。。。。
我们其时之以是对 MoE 很是有信心,,,,尚有一个主要原因。。。。。。实验效果显示,,,,相比其时主流的 Dense Model,,,,MoE 在训练盘算效率(Training Compute Efficiency)上可以带来靠近 10 倍 的提升。。。。。。
在研究中,,,,当你看到一个想法能够带来一个数目级(Order of Magnitude)的刷新时,,,,你通;;嵋馐兜剑赫夂芸赡懿坏鍪且淮瓮ㄋ椎挠呕,,而是一个能够改变整个偏向的主要突破。。。。。。
以是,,,,其时我们就以为,,,,MoE 很可能会成为未来很是主要的一条手艺蹊径。。。。。。
Deep Learning 怎样统一整个领域
Dawn Song:
很是有意思。。。。。。
更让我惊讶的是,,,,今天再次听你诠释 MoE,,,,我发明与你十年前告诉我的内容险些完全一致。。。。。。这也说明,,,,一个真正优异的想法,,,,往往能够经得起时间的磨练。。。。。。
已往二十多年里,,,,你险些加入塑造了现代人工智能基础设施生长的每一个要害节点。。。。。。从 MapReduce、Bigtable、TensorFlow、TPU,,,,再到今天的 MoE 与 Gemini,,,,你的事情险些贯串了整个时代。。。。。。
因此,,,,我特殊想请你回首一下已往十几年的 AI 生长历程。。。。。。在你看来,,,,最让你感应意外的转变是什么??现在天,,,,又有哪些事情,,,,是整个行业依然低估了的??
Jeff Dean:
已往十几年,,,,最显着的转变虽然是,,,,全天下关于人工智能的关注水平爆发了重大的转变。。。。。。
若是把时间拨回去,,,,我们或许是在 2011 到 2012 年左右,,,,最先认真研究怎样把神经网络做得更大。。。。。。
谁人时间,,,,我们已经最先看到一些令人惊讶的效果。。。。。。例如,,,,我们训练的神经网络,,,,规??赡鼙却饲白畲蟮哪W踊挂蠹甘叮,,而图像分类的过失率会因此显著下降。。。。。。语音识别也是一样。。。。。。其时我们发明,,,,仅仅依赖扩大模子规模,,,,一个相对简朴的深度学习语音模子,,,,就能够带来险些相当于整个语音识别领域已往二十年累计取得的性能提升。。。。。。
正由于云云,,,,我们很早就意识到,,,,这不会只是某一个领域里的局部突破。。。。。。它会影响盘算机视觉、自然语言处理、语音识别,,,,以及更多已往恒久被以为十分难题的问题。。。。。。
我以为,,,,Deep Learning 最主要的一点,,,,是它逐渐统一了许多原内情互自力的研究偏向。。。。。。
已往,,,,盘算机视觉有自己的要领,,,,语音识别有自己的要领,,,,自然语言处理也有自己的一整套手艺系统。。。。。。差别领域的人,,,,很少会用统一种方式思索问题。。。。。。而深度学习带来了一个完全差别的视角。。。。。。它让各人最先相信,,,,只要拥有足够的数据和盘算能力,,,,就可以直接从原始数据中学习体现,,,,而不是依赖人为设计的大宗规则和特征工程。。。。。。
于是,,,,你会最先用一种越发统一的方式来看待这些问题。。。。。。无论输入的是图像、文本、语音,,,,照旧其他形式的数据,,,,它们实质上都可以被视为一种学习问题。。。。。。我以为,,,,这是已往十五年最主要的转变之一。。。。。。
随着这种范式逐渐成熟,,,,越来越多的人最先意识到,,,,它不但适用于古板意义上的 AI 研究。。。。。。它同样可以应用到医学、科学研究、消耗产品,,,,以及种种各样此前没有人想到的场景。。。。。。今天,,,,我们已经看到,,,,全天下在 AI 基础设施和盘算资源上的投入规模越来越大。。。。。。我以为,,,,这自己就是一个很是显着的信号。。。。。。
这意味着,,,,人们相信这项手艺未来能够带来的改变,,,,还远远没有竣事。。。。。。至少在我看来,,,,我们仍然处在这个历程的中途,,,,而不是终点。。。。。。
TensorFlow:最大的乐成,,,,与最大的遗憾
Dawn Song:
我们接下来聊一个许多开发者都很是熟悉的话题——TensorFlow。。。。。。
TensorFlow 让现代机械学习真正走向了全球开发者和研究者,,,,也资助许多人第一次接触到深度学习。。。。。。若是回到 TensorFlow 刚刚降生的时间,,,,你们其时最看重哪些设计原则??若是今天重新设计一次 TensorFlow,,,,你又会做哪些差别的选择??
Jeff Dean:
在 TensorFlow 之前,,,,我们在 Google 内部已经有一套深度学习系统,,,,叫 DistBelief。。。。。。它并没有开源,,,,但已经能够支持 Google 内部许多机械学习事情的开展。。。。。。DistBelief 最主要的一点,,,,是它能够把研究者形貌的神经网络盘算自动映射赴任别的硬件平台上。。。。。。无论是 CPU、GPU,,,,照旧由许多机械组成的大规模集群,,,,对使用者来说都应该是一件相对透明的事情。。。。。。
举个例子。。。。。。
作为一名机械学习研究者,,,,你真正体贴的是:我希望训练这个模子。。。。。。至于这个模子最终运行在一百台服务器上,,,,照旧五百块 GPU 上,,,,底层事实怎样举行使命切分、通讯和调理,,,,着实并不是研究者真正希望花时间思索的问题。。。。。。
我们一直希望能够建设这样一种笼统。。。。。。研究者只需要形貌模子自己,,,,而框架认真把它高效地映射究竟层硬件。。。。。。这是 TensorFlow 最主要的设计理念之一。。。。。。
我们希望,,,,人们可以专注于自己脑海里的机械学习模子,,,,而不是一直处理底层基础设施。。。。。。
另一个主要目的,,,,是建设一种越发通用的盘算笼统。。。。。。
我们最终接纳了 Computation Graph(盘算图) 的方式。。。。。。模子被体现成一张由种种运算组成的图,,,,其中包括矩阵乘法、向量运算以及其他机械学习中最常见的操作。。。。。。其时,,,,我们以为这种笼统足够通用,,,,也足够优雅。。。。。。今天转头来看,,,,我仍然以为这个偏向基本是准确的。。。。。。
除此之外,,,,我们尚有一个很是明确的目的:把 TensorFlow 开源。。。。。。
我们希望,,,,全天下任何研究者,,,,只要遇到机械学习问题,,,,都能够使用统一套框架来表达自己的想法。。。。。。这不但仅意味着各人拥有相同的工具。。。。。。更主要的是,,,,它让研究效果能够真正复现。。。。。。
已往,,,,许多论文只有文字形貌。。。。。。读者需要凭证论文重新实现算法,,,,而论文永远不可能把所有实现细节都写清晰。。。。。。效果往往是,,,,统一篇论文,,,,差别的人实现出来,,,,性能却完全差别。。。。。。若是论文能够直接提供 TensorFlow 实现,,,,那么其他研究者不但能够验证效果,,,,也能够在此基础上继续开展研究。。。。。。
我以为,,,,这是开源最大的价值之一。。。。。。
虽然,,,,若是今天重新转头看,,,,我们也确实犯过一些过失。。。。。。
其中一个,,,,就是 没有一最先就接纳 Eager Execution(即时执行)。。。。。。
早期 TensorFlow 使用的是静态盘算图。。。。。。这种方式在性能和安排方面有许多优势,,,,但关于研究者来说,,,,并不是最自然的编程方式。。。。。。厥后,,,,无论是 PyTorch,,,,照旧 JAX,,,,都推动了 Eager Execution 的普及。。。。。。TensorFlow 自己厥后也加入了这一能力。。。。。。若是重新最先,,,,我会更早接纳这种越发自然的执行方式。。。。。。我以为,,,,它让整个笼统又向前迈进了一步。。。。。。
尚有一个决议,,,,现在看来并不乐成。。。。。。
在 TensorFlow 开源时,,,,我们建设了一个叫 contrib 的目录。。。。。。其时凯时AG想法很简朴:希望更多外部开发者加入进来,,,,把种种有用的功效孝顺给 TensorFlow 社区。。。。。。
效果却恰恰相反。。。。。。随着越来越多的人孝顺代码,,,,contrib 很快变得越来越庞杂。。。。。。同样一件事情,,,,可能泛起五种、十种差别的实现方式。。。。。。社区最先一直讨论:究竟应该使用哪个版本??哪一个才是官方推荐??最后,,,,许多开发者反而因此感应疑心。。。。。。
若是今天重新设计,,,,我不会再这样做。。。。。。
TensorFlow 的焦点应该始终坚持尽可能精练、稳固。。。。。。至于种种实验性功效、更高层的工具库,,,,它们完全可以建设在 TensorFlow Core 之上,,,,而不是所有放进官方客栈。。。。。。
这是我们厥后才真正意识到的一课。。。。。。
不过,,,,总体来说,,,,我依然以为 TensorFlow 完成了它最初的使命。。。。。。它让全天下大宗研究者第一次真正接触机械学习,,,,也让越来越多人能够把机械学习应用到自己真正体贴的问题上。。。。。。
Dawn Song:
我很是认同这一点。。。。。。
现在许多学生可能已经很难想象,,,,在 TensorFlow 泛起之前,,,,仅仅是搭建一个能够举行漫衍式训练的系统,,,,自己就是一项很是重大的工程。。。。。。
许多研究者甚至还没有最先验证自己的想法,,,,就已经花了大宗时间在基础设施上。。。。。。
Jeff Dean:
若是每一个研究团队都必需先自己实现一套漫衍式系统,,,,整个领域的生长速率一定会慢得多。。。。。。一个好的框架,,,,实质上就是提供一种配合的笼统。。。。。。它让更多人能够把时间花在真正主要的问题上,,,,而不是重复解决已经解决过的基础设施问题。。。。。。
Dawn Song:
作为一名做编译器和系统研究的人,,,,我一直都很喜欢 TensorFlow 昔时的 Functional Graph 设计。。。。。。
Jeff Dean(笑):
听到这句话,,,,我很兴奋。。。。。。
不过,,,,每一个系统最终都会教会它的设计者一些新的工具。。。。。。TensorFlow 也是云云。。。。。。
真正主要的问题,,,,通常需要五年时间
Da wn Song:
回首你的职业生涯,,,,有一件事情让我印象特殊深。。。。。。
无论是 MapReduce、Bigtable、TensorFlow,,,,照旧厥后的 MoE,,,,这些事情都有一个配合特点:它们真正的主要性,,,,往往是在许多年之后才被整个行业熟悉到。。。。。。今天转头看,,,,它们都成为了基础设施;;但在它们刚刚泛起的时间,,,,许多人并没有意识到这一点。。。。。。
因此,,,,我相信现场许多人都想知道,,,,你事实是怎样判断,,,,一个偏向是真正具有恒久价值的基础性立异,,,,而另一个偏向可能只是短期热门??
这么多年下来,,,,有哪些工程原则始终没有改变??
另外,,,,随人工智能正在从纯粹的模子生长到越来越自主的 Agent,,,,你以为未来几年最值得关注的新笼统(abstraction)会是什么??
Jeff Dean:
这是一个很好的问题。。。。。。
若是一定要说,,,,我可能确实有一点运气。。。。。。
但除此之外,,,,我一直有一个习惯:尽可能一连关注许多差别偏向的生长,,,,而不是只盯着自己正在做的谁人领域。。。。。。
我经常跟学生说一句话:与其花许多时间精读一篇论文,,,,不如快速浏览十篇论文;;甚至,,,,不如浏览一百篇论文的摘要。。。。。。
许多人第一次听到都会以为有些希奇。。。。。。由于各人通常以为,,,,真正做研究,,,,就应该把每一篇论文都读得很是深入。。。。。。但我真正想建设的,,,,着实不是对某一篇论文的明确,,,,而是对整个领域的感知。。。。。。我希望脑子里能够一直积累许多“正在爆发的事情”。。。。。。这里有一种新的训练要领。。。。。。那里有人提出一种新的模子结构。。。。。。另一个偏向,,,,也许一种新的硬件最先变得可行。。。。。。
许多事情可能都还不可熟,,,,但它们配合组成了一张一直转变的地图。。。。。。真正主要的事情,,,,是让这些点逐渐连成线。。。。。。
当你面临一个真正难题的问题时,,,,这张地图会最先施展作用。。。。。。许多问题,,,,刚最先看上去像是七个完全无解的问题。。。。。。
若是你只是盯着这个问题自己,,,,很容易以为:这基础做不了。。。。。。但若是你脑子里始终装着整个领域最近几年爆发的转变,,,,你会最先发明一些差别的工具。。。。。。也许,,,,这七个问题内里,,,,着实已经有五个偏向最先泛起轮廓了。。。。。。它们还没有完全解决,,,,但已经有人提出了一些有希望的要领。。。。。。剩下的,,,,也许只有两个问题,,,,是真正没有谜底的。。。。。。
而那两个问题,,,,就是你需要自己去创立新要领的地方。。。。。。对我来说,,,,这是一种很是理想的研究状态。。。。。。
许多人会问我,,,,什么样的问题值得投入五年,,,,甚至更长时间??
我的谜底着实很简朴。。。。。。不要去做谁人你完全不知道从那里最先的问题。。。。。。那种问题,,,,也许二十年以后才华解决。。。。。。你甚至不知道第一步应该往那里走。。。。。。另一方面,,,,也不要去做谁人所有人都已经知道下一步是什么的问题。。。。。。那通常意味着,,,,它更像是一项两年的工程项目。。。。。。它虽然主要。。。。。。工程上的一连刷新始终主要。。。。。。可是,,,,它未必能够真正改变整个领域。。。。。。真正值得恒久投入的问题,,,,往往介于这两者之间。。。。。。你已经能够望见一部分蹊径。。。。。。但最要害的那一段,,,,还没有人走过。。。。。。
除了一直关注整个领域之外,,,,我尚有另一套一直很是依赖的工程习惯。。。。。。那就是第一性原理(First Principles)。。。。。。
更准确一点说,,,,是一直训练种种 back-of-the-envelope calculation。。。。。。
也就是,,,,许多事情,,,,不需要完整实现,,,,你先在脑子里算一遍:若是我要处理这么大都据,,,,会需要多久??若是我要把这些数据通过某种网络传输,,,,会爆发什么??这样的通讯本钱究竟是十秒钟,,,,照旧一百年??
许多时间,,,,仅仅这样估算一下,,,,你就已经知道某条蹊径是不是值得继续走下去。。。。。。
真正优异的工程师,,,,通常都会一直做这样的思索。。。。。。若是接纳方案 A,,,,会怎样??若是接纳方案 B,,,,又会怎样??为什么其中一个显着比另一个更合理??
这些能力,,,,并没有什么神奇的要领。。。。。。它们来自一直训练。。。。。。来自一次又一次解决问题。。。。。。也来自一直视察别人是怎样解决问题的。。。。。。
以是,,,,我并不以为自己有什么特殊神秘的要领。。。。。。我只是一直重复做这些事情。。。。。。虽然,,,,我也做过许多最终失败的项目。。。。。。(笑)
失败,,,,原来就是整个历程的一部分。。。。。。
Dawn Song:
我想,,,,若是把适才这些内容总结一下,,,,或允许以归纳成几个要害词。。。。。。
第一,,,,是始终坚持对整个领域足够普遍的视察,,,,而不是局限于自己的研究偏向。。。。。。
第二,,,,是选择一个合适时间标准的问题——既不是近在眼前、所有人都知道怎么做的事情,,,,也不是远到完全不知道怎样最先的问题。。。。。。
第三,,,,是坚持第一性原理,,,,坚持工程上的基本判断,,,,而不是依赖履历或者惯性。。。。。。
也许,,,,这几件事情配合组成了你已往二十多年一直推动基础性立异的要领。。。。。。
Jeff Dean:
我以为这是一个不错的总结。。。。。。
AI Agent、AI 清静与社会治理
Dawn Song:
让我们把眼光转向未来。。。。。。
已往几年,,,,Agentic AI 的生长速率令人赞叹。。。。。。就在上周末,,,,我们举行了 Agent AI Summit,,,,现场有近五千人加入,,,,线上也有凌驾十万人寓目。。。。。。整个行业都在庆祝 Agent 能力取得的重大前进。。。。。。
但与此同时,,,,越来越多人也最先讨论它所带来的风险。。。。。。
以我自己的研究为例,,,,我们一直在研究 AI 在网络清静领域的能力,,,,包括构建用于评估 AI 网络攻防能力的基准测试。。。。。。最近的一些实验中,,,,我们发明,,,,AI Agent 已经能够自主计齐整系列攻击方法。。。。。。例如,,,,在一次测试中,,,,Agent 为了获取完成使命所需的信息,,,,自主决议使用多个清静误差,,,,突破原本的隔离情形,,,,建设中心跳板,,,,并最终会见到目的基础设施。。。。。。
幸运的是,,,,这只是一次受控实验,,,,Agent 的目的只是获取与测试使命相关的数据,,,,并没有造成进一步的破损。。。。。。但若是未来类似的能力泛起在真实天下,,,,风险显然会更大。。。。。。与此同时,,,,我们也看到越来越多关于 AI 治理的讨论。。。。。。包括 Jensen Huang 提出的开放生态系统建议、越来越多关于开放模子和 AI 治理的讨论,,,,以及最近包括我在内的一千多位研究者配合提倡的有关前沿 AI 清静的果真建议。。。。。。
以是我很好奇,,,,你怎么看待 Agent 能力快速提升所带来的这些挑战??
Jeff Dean:
任何一种足够强盛的手艺,,,,都可以被用于差别的目的。。。。。。AI 也是云云。。。。。。
总体来说,,,,我以为绝大大都应用都会给天下带来起劲的影响。。。。。。例如,,,,医疗、教育、科学研究,,,,以伎帐助更多人解决他们原本无法自力完成的问题。。。。。。这些都是我以为很是令人兴奋的偏向。。。。。。
虽然,,,,同样的模子也能够资助人们发明软件中的清静误差。。。。。。这自己就是一把双刃剑。。。。。。
若是你是一名清静工程师,,,,你可以使用这些能力寻找系统中的误差,,,,并在真正遭到攻击之前修复它们。。。。。。现实天下里,,,,原来就保存大宗尚未发明的问题。。。。。。但另一方面,,,,若是你是一名恶意攻击者,,,,也完全可能使用同样的能力去寻找这些误差,,,,并加以使用。。。。。。
因此,,,,我们看到的是统一项能力,,,,同时增强了攻击方和防御方。。。。。。我并不以为,,,,这是 AI 独吞的问题。。。。。。已往,,,,履历富厚的清静专家同样能够完成许多重大的攻击。。。。。。今天,,,,模子最先具备类似的能力。。。。。。与此同时,,,,它们也最先具备资助防御者发明误差的能力。。。。。。以是,,,,未来网络清静领域的生长,,,,很洪流平上会酿成双方都拥有越来越强工具之后的一种一连竞争。。。。。。
我不是网络清静领域的专家,,,,因此不想对详细手艺问题做太多谈论。。。。。。但我以为,,,,这确实值得认真关注。。。。。。
另外,,,,我以为,,,,并不是所有我们希望限制的行为,,,,都必需依赖手艺来解决。。。。。。许多时间,,,,社会制度自己也是解决方案的一部分。。。。。。例如,,,,未经授权入侵盘算机系统,,,,原来就是违法行为。。。。。。未来随着 AI 能力一直增强,,,,我们虽然还需要继续讨论执法、羁系以及责任界线应该怎样演进。。。。。。这些未必都是手艺问题。。。。。。许多时间,,,,它们更像是整个社会配合面临的问题。。。。。。
Dawn Song:
以是,,,,一方面,,,,我们希望整个社会能够尽可能享受到 AI 带来的重大价值;;另一方面,,,,也必需同步建设手艺和制度两方面的治理能力。。。。。。
Jeff Dean:
我赞成。。。。。。
几年前,,,,我和 John Hennessy、James Manyika 等同事一起写过一篇关于 AI 恒久影响的论文。。。。。。
我们实验讨论未来几十年,,,,AI 最有可能深刻改变哪些领域。。。。。。其中许多偏向都非;F鹁ⅲ,,例如医疗、教育,,,,以伎帐助更多人获得知识和能力。。。。。。
虽然,,,,也有一些问题越发重大。。。。。。例如地缘政治、粮食清静,,,,以及就业结构转变。。。。。。
就业一直都是一个很是值得认真研究的话题。。。。。。随着 AI 能力一直提升,,,,它会对劳动力市场爆发怎样的影响,,,,经济系统又会怎样顺应这些转变,,,,这些都需要恒久研究。。。。。。我知道,,,,包括斯坦福在内,,,,许多研究者现在都在关注这些问题。。。。。。
那篇论文厥后甚至尚有了自己的网站。。。。。。(笑)
这是我写过唯逐一篇拥有自力网站的论文。。。。。。其中一位配相助者特殊起劲,,,,专门为它建了一个网站,,,,叫 ShapingAI。。。。。。以是,,,,若是各人感兴趣,,,,也可以去看看我们其时的一些思索。。。。。。
为何创业:想自动化的是科学研究与工程立异自己
Dawn Song:
另一个正在引发普遍讨论的话题,,,,是递归式自我刷新(Recursive Self-Improvement)。。。。。。
越来越多的人最先相信,,,,未来 AI 不但能够资助人类完成事情,,,,还能够加入刷新下一代 AI 自己。。。。。。若是这一历程真正形成闭环,,,,人工智能的生长速率可能还会进一步加速。。。。。。
我知道,,,,这个偏向也与你刚刚开办的新公司亲近相关。。。。。。你怎么看待递归式自我刷新??它距离真正成熟尚有多远??又会怎样改变未来的 AI 研发方式??
Jeff Dean:
着实,,,,用机械学习来资助机械学习,,,,自己并不是一个新的想法。。。。。。许多年前,,,,我们就在实验这件事情。。。。。。
例如,,,,我的同事、也是现在 Discovery Loop 的联合首创人 Quoc Le,,,,其时就在推动 Neural Architecture Search(NAS)。。。。。。它的焦点头脑着实很简朴。。。。。。与其由研究职员一直设计新的模子结构,,,,不如让一个模子去天生新的模子,,,,再由另一个历程评估这些模子的效果。。。。。。
系统一直获得反。。。。。。耗男┥杓朴杏??哪些设计没有价值??然后继续天生下一轮候选模子。。。。。。整个历程实质上就是一种自动化的搜索与优化。。。。。。经由一直迭代,,,,模子会越来越善于设计新的模子。。。。。。
厥后,,,,我们又做了许多类似的事情。。。。。。例如 Evolved Transformer。。。。。。它不是重新发明 Transformer,,,,而是在 Transformer 已有组件的基础上,,,,通过演化算法一直实验新的组合方式。。。。。。最后,,,,我们获得了一种比标准 Transformer 更高效的结构,,,,约莫提升了百分之三十左右的效率。。。。。。
这些事情,,,,着实都属于统一种思绪。。。。。。
所谓 Recursive Self-Improvement,,,,在我看来,,,,并不但仅意味着让模子自己设计模子。。。。。。真正主要的是:能否让整个模子研发流程,,,,都进入自动优化的循环。。。。。。
今天,,,,一个大型模子的研发涉及许多差别环节。。。。。。有人认真寻找更好的训练数据。。。。。。有人认真设计新的模子结构。。。。。。有人认真构建评测系统。。。。。。有人一直剖析实验效果,,,,再决议下一轮实验应该怎样调解。。。。。。
若是仔细视察,,,,你会发明,,,,这些事情着实都有相似的结构。。。。。。每一个环节,,,,都可以形成自己的反馈循环。。。。。。若是这些反馈循环都能够逐渐自动化,,,,那么整个模子研发历程,,,,就会越来越高效。。。。。。
事实上,,,,不但是机械学习。。。。。。若是你退一步看,,,,会发明今天大宗科学研究和工程研发,,,,实质上都遵照统一种模式。。。。。。
首先,,,,你面临一个很大的问题。。。。。。于是,,,,你把它拆分成许多更小的子问题。。。。。。然后,,,,为每一个子问题提出一种可能的解决方案。。。。。。实现它。。。。。。运行实验。。。。。。评估效果。。。。。。凭证实验效果调解下一轮方案。。。。。。继续实验。。。。。。整个科学研究,,,,着实一直都是这样事情的。。。。。。工程设计也是一样。。。。。。区别只在于,,,,已往,,,,这些循环主要依赖人来完成。。。。。。未来,,,,其中越来越多环节,,,,都会由 AI 协助完成。。。。。。
这也是我们开办 Discovery Loop 的原因。。。。。。凯时AG目的,,,,并不是简朴训练一个更大的模子。。。。。。我们真正想自动化的是科学研究与工程立异自己。。。。。。
虽然,,,,一最先我们会聚焦于少数几个领域。。。。。。任何创业公司都需要坚持足够的专注。。。。。。但从恒久来看,,,,我们以为,,,,差别科学领域之间着实保存大宗可以共享的要领和基础设施。。。。。。许多研究流程,,,,实质上是相似的。。。。。。若是模子能够明确多个差别领域,,,,它就能够资助研究职员更快地发明真正值得探索的问题。。。。。。
举个例子。。。。。。现实中,,,,一个人不可能同时拥有二十个差别学科的博士学位。。。。。。但模子未必有这样的限制。。。。。。若是一个模子能够同时明确多个领域,,,,它就更有时机发明差别学科之间已往没有建设起来的联系。。。。。。它可以资助研究职员识别真正主要的子问题。。。。。。把重大的问题拆分出来。。。。。。安排多个 Agent 划分解决差别部分。。。。。。然后,,,,再把这些效果重新组合起来。。。。。。最后,,,,凭证实验效果继续进入下一轮迭代。。。。。。
整个历程,,,,实质上就是一直重复科学研究最基本的要领。。。。。。
除了自动化之外,,,,尚有一个同样主要的目的:让整个实验循环变得越来越快。。。。。。若是已往完成一次实验需要一天、一周,,,,甚至一个月。。。。。。未来,,,,我们希望许多实验能够在一分钟、一小时之内完成。。。。。。与此同时,,,,并行运行成千上万个实验。。。。。。实验完成之后,,,,再凭证所有用果决议下一轮最值得继续探索的偏向。。。。。。
这样,,,,不但是实验速率提高了。。。。。。实验自己的质量,,,,也会一直提高。。。。。。我以为,,,,这两件事情连系起来,,,,会真正改变未来科学研究的方式。。。。。。
另外,,,,我们也希望建设一整套基础设施。。。。。。它能够一连治理所有可能举行的实验。。。。。。一直评估:哪一个实验最有价值??它乐成的概率是几多??需要几多盘算资源??应该优先投入哪些偏向??最终,,,,系统会资助研究职员决议下一步最值得做什么。。。。。。我以为,,,,这是未来很是值得探索的偏向。。。。。。
Discovery Loop 正是围绕这一目的建设的。。。。。。
我的四位联合首创人,,,,都是已往二十多年里恒久相助的同伴。。。。。。我们相互相助的时间,,,,从十四年到三十年不等。。。。。。已往,,,,我们曾一起加入过许多主要项目。。。。。。包括 MapReduce、Bigtable、TensorFlow、模子蒸馏,,,,以及 Mixture of Experts 等等。。。。。。今天,,,,我们希望再次聚在一起,,,,配合解决另一个更大的问题。。。。。。不是训练一个模子。。。。。。而是资助整个人类更快地完成科学发明。。。。。。
尚有一点,,,,对我们来说也很是主要。。。。。。Discovery Loop 从建设第一天最先,,,,就是一家 Public Benefit Corporation(公共利益公司)。。。。。。这意味着,,,,我们不但需要建设一家乐成的企业,,,,也希望真正推动科学前进自己。。。。。。未来,,,,若是某些决议虽然未必切合公司的短期商业利益,,,,却能够让更多科学家、更多研究机构因此受益,,,,我们仍然愿意认真思量这样的选择。。。。。。凯时AG目的,,,,是让科学发明能够更快地爆发,,,,也能够被更多人共享。。。。。。
Dawn Song:
今天上午,,,,你才正式最先创业。。。。。。到现在,,,,或许已经事情了十二个半小时。。。。。。
Jeff Dean(笑):
准确地说,,,,我只失业了一秒钟。。。。。。随后,,,,就重新最先事情了。。。。。。
脱离 Google:小公司才华更专注
现场观众提问:
Jeff,,,,你今天宣布脱离 Google,,,,引起了整个行业的关注。。。。。。
许多人都在讨论你的去职,,,,甚至有人把当天 Google 市值的波动也与这件事联系起来。。。。。。
我真正想问的是:有什么事情,,,,是你在一家创业公司能够做到,,,,而在 Google 做不到的??
另外,,,,Google 拥有天下顶级的人才、盘算资源和基础设施。。。。。。关于 Gemini 来说,,,,你以为 Google 接下来最主要的使命是什么??
Jeff Dean:
首先,,,,我不会把资源市场天天爆发的转变归因于某一个人。。。。。。
我在 Google 事情了二十七年。。。。。。那里有无数优异的同事,,,,也有很是精彩的团队。。。。。。今天,,,,他们仍然在推进许多很是主要的事情。。。。。。我相信,,,,他们会继续把 Gemini 做得越来越好。。。。。。以是,,,,我并不会把这件事情明确成一种脱离与否的对立。。。。。。
更多的是,,,,一个新的最先。。。。。。
至于为什么创业,,,,我以为谜底着实很简朴。。。。。。有时间,,,,一家规模很小、目的高度一致的公司,,,,可以拥有一种大型组织很难具备的专注。。。。。。若是整个团队天天醒来,,,,都只想着统一个问题,,,,所有资源都围绕统一件事情睁开,,,,那么许多原本保存于大型组织中的协调本钱、相同本钱,,,,以及州差别目的之间的平衡,,,,就会自然消逝。。。。。。
关于我们来说,,,,现在唯一需要思索的问题,,,,就是:怎样才华真正加速科学发明。。。。。。
除此之外,,,,没有第二个目的。。。。。。这种专注,,,,自己就是创业最大的价值之一。。。。。。
现场观众:
尚有一个问题。。。。。。
从许多角度来看,,,,今天的大模子竞争似乎自然属于大型科技公司。。。。。。训练最先进的模子,,,,需要重大的盘算资源,,,,需要巨额资笔僻出,,,,也需要天下级的数据中心。。。。。。凭证古板逻辑,,,,这些优势险些都集中在大型公司手里。。。。。。
但现实却恰恰相反。。。。。。越来越多顶尖 AI 人才最先流向创业公司。。。。。。越来越多前沿立异,,,,也最先泛起在创业公司。。。。。。
为什么会这样??
Jeff Dean:
我以为,,,,一个很是主要的转变,,,,是云盘算的生长。。。。。。
已往,,,,若是你想开办一家 AI 公司,,,,你险些必需自己建设大宗基础设施。。。。。。今天,,,,这已经不是必需的了。。。。。。
越来越成熟的云平台,,,,让一家规模很小的创业公司,,,,也能够获得天下级的盘算资源。。。。。。你不需要重新建设整个数据中心。。。。。。也不需要自己搭建完整的基础设施。。。。。。Google,,,,以及其他优异的云盘算平台,,,,都已经完成了这些事情。。。。。。
因此,,,,创业团队可以把更多精神放在真正希望解决的问题上。。。。。。
关于我们来说,,,,也是一样。。。。。。我们希望把所有注重力都放在科学研究自动化这一件事情上。。。。。。
若是是在一家大型公司,,,,这件事情虽然也可以做。。。。。。Google 完全有能力支持这样的研究。。。。。。但一家只有十个人左右的创业公司,,,,可以拥有一种很是纯粹的专注。。。。。。每个人天天讨论的,,,,都是统一个问题。。。。。。不会由于组织规模一直扩大,,,,而泛起越来越多特殊需要协调的事情。。。。。。
我以为,,,,这是一种很是特别的事情体验。。。。。。
虽然,,,,我并不想因此否认大型公司的价值。。。。。。恰恰相反。。。。。。已往二十七年里,,,,我之以是能够完成许多主要事情,,,,也正是由于 Google 提供了天下上最好的工程团队、盘算平台,,,,以及恒久投入基础研究的情形。。。。。。这些都是创业公司很难替换的。。。。。。
以是,,,,我并不以为这是一个非此即彼的问题。。。。。。
大型公司和创业公司,,,,各自都有最适合自己的事情。。。。。。大型公司善于建设平台、建设基础设施、一连投入恒久研发。。。。。。创业公司,,,,则更容易围绕一个很是明确的问题快速前进。。。。。。整个行业,,,,着实同时需要这两种实力。。。。。。
关于我个人来说,,,,脱离 Google 并不是由于那里缺少时机。。。。。。恰恰相反。。。。。。二十七年里,,,,我在那里拥有了最好的同事,,,,也加入了许多凌驾自己想象的主要事情。。。。。。
正由于云云,,,,我才以为,,,,现在是时间重新最先另一段旅程了。。。。。。
这几多有一点令人主要。。。。。。事实,,,,当你脱离一家事情了二十七年的公司,,,,最先面临完全差别的情形时,,,,总会有一些不确定性。。。。。。但与此同时,,,,也正由于云云,,,,它才令人兴奋。。。。。。
新的问题。。。。。。新的团队。。。。。。新的目的。。。。。。
我很期待,,,,看看接下来几年,,,,我们事实能够做到什么。。。。。。
Dawn Song:
Jeff,,,,很是谢谢今天与你一起回首已往,,,,也一起展望未来。。。。。。
祝贺你开启新的旅程。。。。。。
也期待 Discovery Group 能够真正资助科学研究进入一个新的时代。。。。。。
Jeff Dean:
也谢谢今天来到现场的所有人。。。。。。
我同样期待未来会爆发什么。。。。。。
点个“爱心”,,,,再走 吧