这就是ChatGPT

写于

《这就是ChatGPT》 斯蒂芬·沃尔弗拉姆 25个笔记 点评 - 2024/02/18 认为好看

这本书是计算机大神(Mathematical软件发明者)在ChatGPT出来之后的三个月后,写的关于chat gbt原理及介绍的书籍内容。  
作者作为一个在神经网络有43年经验的计算机从业者,对chatgpt的描述是非常准确的,关于它的原理及概念描述的通读易懂。  
在书籍中,不仅仅是描述了这个gbt的原理,还讲解了人工智能和深度学习一些基本概念。作者通过图、代码和文字以及大量举例的方式,深入浅出的描述了神经网络chatgbt的相关原理和概念。  
全文的篇幅较少,只有两篇内容,第一篇讲解的是chatGpt的基本概念和原理,第二篇讲述的是wolfram与chatgbt结合使用。  
本书内容正如序言所说的,奇事奇人奇书。其实在于在的chatgpt本身就是奇事,可谓颠覆了人类目前的一些事情,而chatgbt刚公布三个月,作者就把这本书给写出来了。奇人在于作者是计算机的大神级人物,他是 mathematical这个软件的创始人,对计算机神经网络有非常深入的了解,这种大神级人物能够来写这个书是非常难得的。

第四章 奇人 - 万事皆计算,宇宙中的各种复杂现象,不论是人产生的还是自然中自发的,都可以用一些规则简单地计算和模拟 第五章 奇书 - 沃尔弗拉姆给出了如下建议。●最高效的方式是发掘新的可能性,定义对自己有价值的东西。●从现在的回答问题转向学会如何提出问题,以及如何确定哪些问题值得提出。也就是从知识执行转向知识战略。●知识广度和思维清晰度将很重要。●直接学习所有详细的知识已经变得不必要了:我们可以在更高的层次上学习和工作,抽象掉许多具体的细节。“整合”,而不是专业化。尽可能广泛、深入地思考,尽可能多地调用知识和范式。●学会使用工具来做事。过去我们更倚重逻辑和数学,以后要特别注意利用计算范式,并运用与计算直接相关的思维方式。的确,GPT可能对我们的工作、学习和生活方式产生巨大的影响,需要我们转换思维方式,需要新型的学习和交流方式。 第八章 概率从何而来 - ChatGPT总是根据概率选择下一个词,但是这些概率是从何而来的呢 - 2024/02/18 发表想法

chatgpt其实并不是那么神话,它仅仅是通过概率来获取信息,而概率如何获取呢?

> 原文:在网络爬取结果中可能有几千亿个词,在电子书中可能还有另外几百亿个词。但是,即使只有4万个常用词,可能的二元词的数量也已经达到了16亿,而可能的三元词的数量则达到了60万亿。因此,我们无法根据已有的文本估计所有这些三元词的概率。当涉及包含20个词的“文章片段”时,可能的20元词的数量会大于宇宙中的粒子数量,所以从某种意义上说,永远无法把它们全部写下来。  
>   
> 我们能做些什么呢?最佳思路是建立一个模型,让我们能够估计序列出现的概率—即使我们从未在已有的文本语料库中明确看到过这些序列。ChatGPT的核心正是所谓的“大语言模型”,后者已经被构建得能够很好地估计这些概率了。
  • 最佳思路是建立一个模型,让我们能够估计序列出现的概率—即使我们从未在已有的文本语料库中明确看到过这些序列。ChatGPT的核心正是所谓的“大语言模型”,后者已经被构建得能够很好地估计这些概率了。 第九章 什么是模型
  • 什么是模型假设你想(像16世纪末的伽利略一样)知道从比萨斜塔各层掉落的炮弹分别需要多长时间才能落地。当然,你可以在每种情况下进行测量并将结果制作成表格。不过,你还可以运用理论科学的本质:建立一个模型,用它提供某种计算答案的程序,而不仅仅是在每种情况下测量和记录 第一十一章 神经网络
  • 无论输入什么,神经网络都会生成一个答案。结果表明,它的做法相当符合人类的思维方式。正如上面所说的,这并不是我们可以“根据第一性原则推导”出来的事实。这只是一些经验性的发现,至少在某些领域是正确的。但这是神经网络有用的一个关键原因:它们以某种方式捕捉了“类似人类”的做事方式。 第一十二章 机器学习和神经网络的训练
  • 当构建一个神经网络来区分猫和狗的图像时,我们不需要编写一个程序来(比如)明确地找到胡须,只需要展示很多关于什么是猫和什么是狗的样例,然后让神经网络从中“机器学习”如何区分它们即可。重点在于,已训练的神经网络能够对所展示的特定例子进行“泛化”
  • 应该如何调整权重呢?基本思想是,在每个阶段看一下我们离想要的函数“有多远”,然后朝更接近该函数的方向更新权重
  • 换句话说,有时候用神经网络解决复杂问题比解决简单问题更容易—这似乎有些违反直觉。大致原因在于,当有很多“权重变量”时,高维空间中有“很多不同的方向”可以引导我们到达最小值;而当变量较少时,很容易陷入局部最小值的“山湖”,无法找到“出去的方向”。 第一十三章 神经网络训练的实践和学问
  • 未来,是否会有更好的方法来训练神经网络或者完成神经网络的任务呢?我认为答案几乎是肯定的。神经网络的基本思想是利用大量简单(本质上相同)的组件来创建一个灵活的“计算结构”,并使其能够逐步通过学习样例得到改进。在当前的神经网络中,基本上是利用微积分的思想(应用于实数)来进行这种逐步的改进。但越来越清楚的是,重点并不是拥有高精度数值,即使使用当前的方法,8位或更少的数也可能已经足够了 第一十四章 “足够大的神经网络当然无所不能!”
  • 但我们的现代技术世界是建立在工程学的基础上的,而工程学利用了数学计算,并且越来越多地利用了更一般的计算。看看自然界,会发现它充满了不可约计算—我们正在慢慢地理解如何模拟和利用它们来达到我们的技术目的 第一十五章 “嵌入”的概念
  • 严格来说,ChatGPT并不处理词,而是处理“标记”(token)—这是一种方便的语言单位,既可以是整个词,也可以只是像pre、ing或ized这样的片段。使用标记使ChatGPT更容易处理罕见词、复合词和非英语词,并且会发明新单词(不论结果好坏) 第一十六章 ChatGPT的内部原理
  • 从根本上说,ChatGPT是一个庞大的神经网络— GPT-3拥有1750亿个权重。它在许多方面非常像我们讨论过的其他神经网络,只不过是一个特别为处理语言而设置的神经网络。它最显著的特点是一个称为Transformer的神经网络架构
  • Transformer的思想是,为组成一段文本的标记序列做与此相似的事情。但是,Transformer不是仅仅定义了序列中可以连接的固定区域,而是引入了“注意力”的概念—即更多地“关注”序列的某些部分,而不是其他部分
  • ChatGPT(或者说它基于的GPT-3网络)到底是在做什么呢?它的总体目标是,根据所接受的训练(查看来自互联网的数十亿页文本,等等),以“合理”的方式续写文本。所以在任意给定时刻,它都有一定量的文本,而目标是为要添加的下一个标记做出适当的选择。
  • 关键是,这条流水线的每个部分都由一个神经网络实现,其权重是通过对神经网络进行端到端的训练确定的。换句话说,除了整体架构,实际上没有任何细节是有“明确设计”的,一切都是从训练数据中“学习”来的。
  • 对于每个产生的标记,仍然需要进行1750亿次计算(并在最后进行一些额外的计算)—因此,不难理解使用ChatGPT生成一段长文本需要一些时间。 第一十七章 ChatGPT的训练
  • 那1750亿个神经元的权重是如何确定的呢?基本上,这是基于包含人类所写文本的巨型语料库(来自互联网、书籍等),通过大规模训练得出的结果。
  • ChatGPT内部并没有直接存储来自互联网、书籍等的所有文本。因为ChatGPT内部实际上是一堆数(精度不到10位),它们是所有文本的总体结构的某种分布式编码 第一十九章 真正让ChatGPT发挥作用的是什么
  • 但是有了ChatGPT之后,我们得到了一条重要的新信息:一个连接数与大脑神经元数量相当的纯粹的人工神经网络,就能够出色地生成人类语言 第二十一章 语义语法和计算语言的力量
  • 我强烈怀疑ChatGPT的成功暗示了一个重要的“科学”事实:有意义的人类语言实际上比我们所知道的更加结构化、更加简单,最终可能以相当简单的规则来描述如何组织这样的语言。 第二十二章 那么,ChatGPT到底在做什么?它为什么能做到这些?
  • ChatGPT的基本概念在某种程度上相当简单:首先从互联网、书籍等获取人类创造的海量文本样本,然后训练一个神经网络来生成“与之类似”的文本。特别是,它能够从“提示”开始,继续生成“与其训练数据相似的文本”。 第二十八章 前方的路
  • 机器学习是一种强大的方法,特别是在过去十年中,它取得了一些非凡的成功— ChatGPT是最新的成功案例。除此之外,还有图像识别、语音转文字、语言翻译……在每个案例中,都会跨越一个门槛—通常是突然之间。一些任务从“基本不可能”变成了“基本可行”。但结果从来不是“完美”的。也许有的东西能够在95% 的时间内运作良好。但是不论怎样努力,它的表现在剩下的5% 时间内仍然难以捉摸。 来自微信读书