目录
从网络规模和计算规模还无人在意时做起
构建面向计算机视觉的神经网络
OpenAI:从100人到ChatGPT
OpenAI是如何训练一个大型神经网络的
再谈GPT-4
人工智能的未来
首页 科技周边 人工智能 GPT-4比ChatGPT有何进步?黄仁勋与OpenAI联合创始人进行了一次“炉边谈话”

GPT-4比ChatGPT有何进步?黄仁勋与OpenAI联合创始人进行了一次“炉边谈话”

Mar 31, 2023 pm 10:39 PM
chatgpt gpt-4 神经网络

ChatGPT与GPT-4之间最重要的区别在于在GPT-4的基础上构建预测下一个字符具有更高的准确度。神经网络越能预测文本中的下一个词,它就越能理解文本。

大数据文摘出品

作者:Caleb

英伟达碰上OpenAI会擦出怎样的火花?

就在刚刚,英伟达创始人兼首席执行官黄仁勋在GTC的炉边谈话中与OpenAI共同创办人Ilya Sutskever进行了一次深入交流。

图片

视频链接:

​​https://www.nvidia.cn/gtc-global/session-catalog/?tab.catalogallsessinotallow=16566177511100015Kus#/session/1669748941314001t6Nv​​

前两天,OpenAI推出了迄今为止最强大的人工智能模型GPT-4。OpenAI在官网上称GPT-4是“OpenAI最先进的系统”,“能够产生更安全、更有用的响应”。

Sutskever在谈话中也表示,与ChatGPT相比,GPT-4在许多方面标志着“相当大的改进”,并指出新模型可以读取图像和文本。他说,“在未来的某个版本中,[用户]可能会得到一张图表”以回应提问和查询。

毫无疑问,随着ChatGPT与GPT-4在全球范围内的爆火,这也成为了这次谈话的关注焦点,而除了GPT-4及其前身包括ChatGPT相关话题外,黄仁勋与Sutskever也聊到了深度神经网络的能力、局限性和内部运作方式,以及对未来AI发展的预测。

接下来就和文摘菌一起深入这场对话看看吧~

从网络规模和计算规模还无人在意时做起

可能不少人一听到Sutskever的名字最先想到的就是OpenAI及其相关的AI产品,但要知道,Sutskever的履历可以追溯到吴恩达的博士后、Google Brain的研究科学家,以及Seq2Seq模型的合作开发者。

可以说,从一开始,深度学习就与Sutskever绑定在了一起。

在谈及对深度学习的认识时,Sutskever表示,从现在来看,深度学习确实改变了世界。不过他个人的出发点更多是在于对AI存在的巨大影响潜力的直觉,对意识与人类体验的浓厚兴趣,以及认为AI的发展会帮助解答这些问题。

2002-03年期间,人们普遍认为学习是一件只有人类才能做到的事,计算机是无法学习的。而如果能让计算机具有学习的能力,那将是AI领域一次重大的突破。

这也成了Sutskever正式进军AI领域的契机。

于是Sutskever找到了同一所大学的Jeff Hinton。在他看来,Hinton所从事的神经网络正是突破口,因为神经网络的特性就在于能够学习,可以自动编程的并行计算机。

而彼时并没有人在意网络规模和计算规模的重要性,人们训练的神经网络只有50个或100个,数百个的规模已经算大的了,一百万的参数也被视为很庞大。

除此之外,他们还只能在没有优化过的CPU代码上跑程序,因为没人懂BLAS,多用优化后的Matlab做一些实验,比如用什么样的问题来提问比较好。

但问题是,这些都是很零散的实验,无法真正推动技术进步。

构建面向计算机视觉的神经网络

当时,Sutskever就察觉到,有监督学习才是未来前进的方向。

这不仅是一种直觉,也是无需争辩的事实。在神经网络足够深且足够大的基础上,那么它就有能力去解决一些有难度的任务。但人们还没有专注在深且大的神经网络上,甚至人们根本没有把目光放在神经网络上。

为了找到一个好的解决方案,就需要一个合适的大数据集以及大量的计算。

ImageNet就是那个数据。当时ImageNet是一个难度很高的数据集,但要训练一个大的卷积神经网络,就必须要有匹配的算力。

接下来GPU就该出场了。在Jeff Hinton的建议下,他们发现随着ImageNet数据集的出现,卷积神经网络是非常适合GPU的模型,所以能够让它变得很快,规模也就这么越来越大了。

随后更是直接大幅打破了计算机视觉的纪录,而这不是基于以往方法的延续,关键是在于这个数据集本身的难度与范围。

OpenAI:从100人到ChatGPT

在OpenAI初期,Sutskever坦言道,他们也不是完全清楚如何推动这个项目。

在2016年初,神经网络没有那么发达,研究人员也比现在少很多。Sutskever回忆称,当时公司只有100个人,大部分还都在谷歌或deepmind工作。

不过当时他们有两个大的思路。

其中一个是通过压缩进行无监督学习。2016年,无监督学习是机器学习中一个尚未解决的问题,没有人知道怎么实现。最近,压缩也并不是人们通常会谈到的话题,只是突然间大家突然意识到GPT实际上压缩了训练数据。

从数学意义上讲,训练这些自回归生成模型可以压缩数据,并且直观上也可以看到为什么会起作用。如果数据被压缩得足够好,你就能提取其中存在的所有隐藏信息。这也直接导致了OpenAI对情绪神经元的相关研究。

同时,他们对相同的LSTM进行调整来预测亚马逊评论的下一个字符时发现,如果你预测下一个字符足够好,就会有一个神经元在LSTM内对应于它的情绪。这就很好地展示了无监督学习的效果,也验证了下一个字符预测的想法。

但是要从哪里得到无监督学习的数据呢?Sutskever表示,无监督学习的苦难之处不在于数据,更多关于为什么要这么做,以及意识到训练神经网络来预测下一个字符是值得追求和探索的。于此它会学习到一个可以理解的表征。

另一个大的思路就是强化学习。Sutskever一直相信,更大的就是更好的(bigger is better)。在OpenAI,他们的一个目标就是找出规模扩展的正确途径。

OpenAI完成的第一个真正的大型项目是实施战略游戏Dota 2。当时OpenAI训练了一个强化学习的agent来与自己对抗,目标是达到一定水平能够和人类玩家游戏。

从Dota的强化学习转变为人类反馈的强化学习与GPT产出技术基座结合,就成了如今的ChatGPT。

OpenAI是如何训练一个大型神经网络的

当训练一个大型神经网络来准确预测互联网上不同文本中的下一个词的时候,OpenAI所做的是学习一个世界模型。

这看上去像是只在学习文本中的统计相关性,但实际上,学习这些统计相关性就可以把这些知识压缩得非常好。神经网络所学习的是生成文本的过程中的一些表述,这个文本实际上是世界的一个映射,因此神经网络便能够学习越来越多的角度来看待人类和社会。这些才是神经网络真正在准确预测下一个词的任务中学习到的东西。

同时,对下一个词的预测越准确,还原度就越高,在这个过程中得到的对世界的分辨率就越高。这是预训练阶段的作用,但这并不能让神经网络表现出我们希望它表现出的行为。

一个语言模型真正要做到的是,如果我在互联网上有一些随机文本,以一些前缀或提示开始,它会补全什么内容。

当然它也可以在互联网上找到文本进行填充,但这就不是最初构想的那样的,因此还需要额外的训练,这就是微调、来自人类老师的强化学习,以及其他形式的AI协助可以发挥作用的地方。

但这不是教授新的知识,而是与它交流,向它传达我们希望它变成什么样,其中也包括了边界。这个过程做得越好,神经网络就越有用越可靠,边界的保真度也就越高。

再谈GPT-4

ChatGPT成为用户增长最快的应用没多久,GPT-4就正式释出。

在谈到两者的区别时,Sutskever表示,GPT-4相较于ChatGPT在许多维度上都做到了相当大的改进。

ChatGPT与GPT-4之间最重要的区别在于在GPT-4的基础上构建预测下一个字符具有更高的准确度。神经网络越能预测文本中的下一个词,它就越能理解文本。

比如,你读了一本侦探小说,情节非常复杂,穿插了非常多的故事情节和人物,埋了很多神秘的线索。在书的最后一章,侦探收集了所有的线索,召集了所有人,说现在他将揭示谁是犯人,那个人就是……

这就是GPT-4能够预测的东西。

人们都说,深度学习不会逻辑推理。但不管是这个例子还是GPT能做到的一些事,都展现出了一定程度的推理能力。

Sutskever对此回应称,当我们在定义逻辑推理时,在进行下一步决策时如果你能够以某种方式思考一下或许能得到一个更好的答案。而神经网络能走多远也尚待考察,OpenAI目前还没有充分挖掘出它的潜力。

一些神经网络其实已经具备了这类能力,但是大多都还不够可靠。而可靠性是让这些模型有用的最大阻碍,这也是当前模型的一大瓶颈。这不关乎模型是否具备特定的能力,而是具备多少能力。

Sutskever也表示,GPT-4发布时并没有内置的检索功能,它只是一个能够预测下一个词的很好的工具,但可以说它完全具备这个能力,将检索变得更好。

GPT-4还有一个显著的改进就是对图像的响应和处理。多模态学习在其中发挥了重要的作用,Sutskever说到,多模态有两个维度,第一个在于多模态对神经网络是有用处的,尤其是视觉;第二个在于除了文本学习外,从图像中也可以学习到世界的知识。

人工智能的未来

再说到利用AI训练AI时,Sutskever表示这一部分的数据不应该被忽视。

预测未来语言模型的发展是一件困难的事,但是在Sutskever看来,有充分理由相信这个领域会持续进步,AI也将在自己的能力边界继续用实力震惊人类。AI的可靠性是由是否可以被信任决定的,未来肯定会达到可被完全信赖的地步。

如果它不能完全理解,它也会通过提问来弄清楚,或者告诉你它不知道,这些正是AI可用性影响最大的领域,未来会有最大的进步。

现在就面临这样一个挑战,你想让一个神经网络总结长文档或获取摘要,如何确定重要的细节没有被忽视?如果一个要点显然重要到每个读者都会对此达成一致,那么就可以承认神经网络总结的内容是可靠的。

在神经网络是否清楚地遵循用户意图这一点上也同样适用。

未来两年会看到越来越多这样的技术,让这项技术变得越来越可靠。

相关报道:​​https://blogs.nvidia.com/blog/2023/03/22/sutskever-openai-gtc/​​

以上是GPT-4比ChatGPT有何进步?黄仁勋与OpenAI联合创始人进行了一次“炉边谈话”的详细内容。更多信息请关注PHP中文网其他相关文章!

本站声明
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热门文章

<🎜>:泡泡胶模拟器无穷大 - 如何获取和使用皇家钥匙
4 周前 By 尊渡假赌尊渡假赌尊渡假赌
北端:融合系统,解释
4 周前 By 尊渡假赌尊渡假赌尊渡假赌
Mandragora:巫婆树的耳语 - 如何解锁抓钩
3 周前 By 尊渡假赌尊渡假赌尊渡假赌

热工具

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

Dreamweaver CS6

Dreamweaver CS6

视觉化网页开发工具

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

热门话题

Java教程
1675
14
CakePHP 教程
1429
52
Laravel 教程
1333
25
PHP教程
1278
29
C# 教程
1257
24
ChatGPT 现在允许免费用户使用 DALL-E 3 生成每日限制的图像 ChatGPT 现在允许免费用户使用 DALL-E 3 生成每日限制的图像 Aug 09, 2024 pm 09:37 PM

DALL-E 3 于 2023 年 9 月正式推出,是比其前身大幅改进的型号。它被认为是迄今为止最好的人工智能图像生成器之一,能够创建具有复杂细节的图像。然而,在推出时,它不包括

全球最强开源 MoE 模型来了,中文能力比肩 GPT-4,价格仅为 GPT-4-Turbo 的近百分之一 全球最强开源 MoE 模型来了,中文能力比肩 GPT-4,价格仅为 GPT-4-Turbo 的近百分之一 May 07, 2024 pm 04:13 PM

想象一下,一个人工智能模型,不仅拥有超越传统计算的能力,还能以更低的成本实现更高效的性能。这不是科幻,DeepSeek-V2[1],全球最强开源MoE模型来了。DeepSeek-V2是一个强大的专家混合(MoE)语言模型,具有训练经济、推理高效的特点。它由236B个参数组成,其中21B个参数用于激活每个标记。与DeepSeek67B相比,DeepSeek-V2性能更强,同时节省了42.5%的训练成本,减少了93.3%的KV缓存,最大生成吞吐量提高到5.76倍。DeepSeek是一家探索通用人工智

大模型一对一战斗75万轮,GPT-4夺冠,Llama 3位列第五 大模型一对一战斗75万轮,GPT-4夺冠,Llama 3位列第五 Apr 23, 2024 pm 03:28 PM

关于Llama3,又有测试结果新鲜出炉——大模型评测社区LMSYS发布了一份大模型排行榜单,Llama3位列第五,英文单项与GPT-4并列第一。图片不同于其他Benchmark,这份榜单的依据是模型一对一battle,由全网测评者自行命题并打分。最终,Llama3取得了榜单中的第五名,排在前面的是GPT-4的三个不同版本,以及Claude3超大杯Opus。而在英文单项榜单中,Llama3反超了Claude,与GPT-4打成了平手。对于这一结果,Meta的首席科学家LeCun十分高兴,转发了推文并

YOLO不死!YOLOv9出炉:性能速度SOTA~ YOLO不死!YOLOv9出炉:性能速度SOTA~ Feb 26, 2024 am 11:31 AM

如今的深度学习方法专注于设计最适合的目标函数,以使模型的预测结果与实际情况最接近。同时,必须设计一个合适的架构,以便为预测获取足够的信息。现有方法忽略了一个事实,即当输入数据经过逐层特征提取和空间变换时,大量信息将会丢失。本文将深入探讨数据通过深度网络传输时的重要问题,即信息瓶颈和可逆函数。基于此提出了可编程梯度信息(PGI)的概念,以应对深度网络实现多目标所需的各种变化。PGI可以为目标任务提供完整的输入信息,以计算目标函数,从而获得可靠的梯度信息以更新网络权重。此外设计了一种新的轻量级网络架

手机怎么安装chatgpt 手机怎么安装chatgpt Mar 05, 2024 pm 02:31 PM

安装步骤:1、在ChatGTP官网或手机商店上下载ChatGTP软件;2、打开后在设置界面中,选择语言为中文;3、在对局界面中,选择人机对局并设置中文相谱;4、开始后在聊天窗口中输入指令,即可与软件进行交互。

第二代Ameca来了!和观众对答如流,面部表情更逼真,会说几十种语言 第二代Ameca来了!和观众对答如流,面部表情更逼真,会说几十种语言 Mar 04, 2024 am 09:10 AM

人形机器人Ameca升级第二代了!最近,在世界移动通信大会MWC2024上,世界上最先进机器人Ameca又现身了。会场周围,Ameca引来一大波观众。得到GPT-4加持后,Ameca能够对各种问题做出实时反应。「来一段舞蹈」。当被问及是否有情感时,Ameca用一系列的面部表情做出回应,看起来非常逼真。就在前几天,Ameca背后的英国机器人公司EngineeredArts刚刚演示了团队最新的开发成果。视频中,机器人Ameca具备了视觉能力,能看到并描述房间整个情况、描述具体物体。最厉害的是,她还能

全球最强大模型一夜易主,GPT-4时代终结!Claude 3提前狙击GPT-5,3秒读懂万字论文理解力接近人类 全球最强大模型一夜易主,GPT-4时代终结!Claude 3提前狙击GPT-5,3秒读懂万字论文理解力接近人类 Mar 06, 2024 pm 12:58 PM

卷疯了卷疯了,大模型又变天了。就在刚刚,全球最强AI模型一夜易主,GPT-4被拉下神坛。Anthropic发布了最新的Claude3系列模型,一句话评价:真·全面碾压GPT-4!多模态和语言能力指标上,Claude3都赢麻了。用Anthropic的话说,Claude3系列模型在推理、数学、编码、多语言理解和视觉方面,都树立了新的行业基准!Anthropic,就是曾因安全理念不合,而从OpenAI「叛逃」出的员工组成的初创公司,他们的产品一再给OpenAI暴击。这次的Claude3,更是整了个大的

1.3ms耗时!清华最新开源移动端神经网络架构 RepViT 1.3ms耗时!清华最新开源移动端神经网络架构 RepViT Mar 11, 2024 pm 12:07 PM

论文地址:https://arxiv.org/abs/2307.09283代码地址:https://github.com/THU-MIG/RepViTRepViT在移动端ViT架构中表现出色,展现出显着的优势。接下来,我们将探讨本研究的贡献所在。文中提到,轻量级ViTs通常比轻量级CNNs在视觉任务上表现得更好,这主要归功于它们的多头自注意力模块(MSHA)可以让模型学习全局表示。然而,轻量级ViTs和轻量级CNNs之间的架构差异尚未得到充分研究。在这项研究中,作者们通过整合轻量级ViTs的有效

See all articles