Redian新闻
>
大模型,到底是怎么生成文字的?

大模型,到底是怎么生成文字的?

公众号新闻

大模型这个热门话题在过去一年里引发了大量讨论,那么,你是否知晓大模型究竟是怎么生成文字的?这篇文章里,作者尝试讲透其生成原理,并带你了解四种构建AI应用的大模型技术架构,一起来看看吧。


———— / BEGIN / ———

在人工智能的领域,大模型在去年已经成为了一个热门的话题。各大厂商如谷歌、微软、OpenAI等,都在积极研发和应用大模型技术。这些模型在语言理解、图像识别、推荐系统等方面都表现出了惊人的能力,甚至在某些任务上,已经超越了人类的表现。

或许你用过,惊叹于它的神奇,或许你没有用过,听着它的传奇。无论如何,都懂那么一点点,但很难讲的清,它到底是怎么生成的?

我们接下来就讲透它生成的原理,并了解四种构建AI应用的大模型技术架构。

01

大模型的生成原理

首先,我们要了解的是,GPT大模型是一种基于深度学习的自然语言处理模型,也就是LLM。

(敲黑板,LLM是一种生成文字的模型,文生图比如DALL·E,它和LLM都是多模态语言模型的分支)它的工作原理可以简单地理解为“学习语言的规律”,它的生成方式只是根据上文,猜下一个词的概率。

那它为什么会掌握这么多的知识?那是因为在模型训练过程中,GPT模型会阅读大量的文本数据,然后学习这些文本中的语言规律。

这个过程可以类比为人类学习语言的方式。当我们是婴儿时,我们会通过听父母和周围的人说话,学习语言的规律。

比如,我们会学习到“我”通常后面会跟“是”,“你”通常后面会跟“好”等等。这就是一种语言规律。GPT模型就是通过类似的方式,学习语言的规律。

但是,GPT模型的学习能力远超人类。

它可以阅读数以亿计的文本,学习到非常复杂的语言规律。这就是为什么GPT模型可以生成非常自然、连贯的文本。

02

GPT模型如何学习语言的规律

说到这里,需要我们了解一下GPT模型的内部结构。GPT模型是由多层神经网络组成的。每一层神经网络都可以抽取文本的某种特征。比如:

  • 第一层神经网络可能会抽取出单词的拼写规律;

  • 第二层神经网络可能会抽取出词性的规律;

  • 第三层神经网络可能会抽取出句子的语法规律等等。

通过这种层层抽取,GPT模型可以学习到非常深层次的语言规律。

当GPT模型生成文本时,它会根据已有的文本,预测下一个单词,整体就是通过这种方式,生成连贯的文本。

当然,这只是一个非常简化的版本。实际上,GPT模型的工作原理还涉及到很多复杂的数学和计算机科学知识。

03

大模型的四种应用技术架构

大模型的厉害之处,其实不止在于它很像我们人学习语言,而更大的作用在于它未来会改变我们的生活和职场。从整体现有最新的架构来看,其实有四种大模型的应用架构,从上往下,依次从简单到复杂。

第一种:Prompt(指令工程)

指令工程听着好像很遥远,其实就是通过下面这个输入框触发的:

看上去简单,但这个很考验一个人写prompt的“功力”。

prompt的作用就是通过引导模型生成特定类型的文本。一个好的prompt可以引导模型以期望的方式生成文本。例如,如果我们想让模型写一篇关于全球变暖的文章,我们可以给模型一个prompt,如“全球变暖是一个严重的问题,因为…”。模型会根据这个prompt生成一篇文章。

这种方法的优点是简单直观,但缺点是可能需要大量的尝试才能找到一个好的prompt。

第二种:Function calling(函数调用)

Function calling是一种更深入的应用架构,它通过调用模型的内部函数,直接获取模型的某些特性。

例如,我们可以调用模型的词向量函数,获取单词的词向量。

这种方法的优点是可以直接获取模型的内部信息,但缺点是需要深入理解模型的内部结构。

第三种:RAG(Retrieval-Augmented Generation)

RAG是一种结合检索和生成的应用架构。

在这种方法中,模型首先会检索相关的文本,然后用这些文本作为输入,让模型生成答案。

例如,如果我们想让模型回答一个关于全球变暖的问题,模型可以先检索到一些关于全球变暖的文章,然后根据这些文章生成答案。

这种方法的优点是可以利用大量的外部信息,提高模型的生成质量。但缺点是需要大量的计算资源,因为需要对大量的文本进行检索。

第四种:Fine-tuning(微调)

Fine-tuning是一种在特定任务上进一步训练模型的应用架构(如计算钢材的消耗量等等)。

在这种方法中,模型首先会在大量的文本上进行预训练,学习语言的基本规律。然后,模型会在特定任务的数据上进行fine-tuning,学习任务的特定规律。

例如,我们可以在情感分析任务上fine-tuning模型,让模型更好地理解情感。

这种方法的优点是可以提高模型在特定任务上的表现,但缺点是需要大量的标注数据。

最后的话

总的来说,GPT大模型生成结果的原理,就是通过学习语言的规律,然后根据已有的语境,预测下一个单词,从而生成连贯的文本。这就像我们人类说话或写文章一样,根据已有的语境,预测下一个单词或短语。只不过,GPT模型的学习能力和生成能力,远超我们人类。

我们可以看到,AI在学习我们人类,它们不知疲倦,孜孜以求,我们人类也应该向它们学习,不带批判和有色眼镜的看待身边人的观点,用仅剩的群体智慧来继续引领我们走向下一个新世界。

后续还会对四种技术架构进行深入探讨,欢迎交流~

希望带给你一点启发,加油。

———— / E N D / ———

作者:柳星聊产品

来源微信公众号:柳星聊产品

微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
不合群的人,到底该怎么生存于世​?编码数据集生成框架 UnitGen 0.4.0:代码文档生成、测试代码生成童年玩具大揭秘:“魔术翻板”到底是怎么翻身的?牧笛吹响降级的笛声,大A股是涨是跌?千元成本搞定专业大模型,系统优化+开源大模型是关键 | 潞晨卞正达@MEET2024佛乐: 《云海风林》AI早知道|Gemini推理能力强于GPT-3.5;美图AI视觉大模型将向公众开放;Meta推全新视频生成模型FlowVid揭秘最强视频生成模型 Sora,OpenAI 是怎么实现 1 分钟一镜到底的?这些网贷利息到底有多高?它们到底是如何骗你去贷款的?AI早知道|百度推出视频生成模型UniVG;Soul APP上线自研语言大模型;清华大学首个大模型 Debug开源大模型火了!(附99个大模型微调模型/数据/工具)!罗马不是一天建成的(上)曝小扎写信“挖角”DeepMind;我国10亿级参数大模型超百个;Stability AI开源代码生成模型丨AIGC大事日报​英国为什么没有成文宪法​?效果超越Gen-2!字节最新视频生成模型,一句话让绿巨人戴上VR眼镜360安全大模型3.0来了!垂直大模型,他们这么训“看见马斯克警告,才后悔没有早控制孩子沉迷短视频” | 手机到底是怎么废掉孩子的?Suno v3音乐生成模型发布,几秒钟生成完整歌曲;富士通用生成式AI加速药物研发丨AIGC日报AI早知道|Stability AI推出最小模型;国内首个视频大模型通过备案;内蒙古首个AI大模型工业互联网平台发布谁教你这么起名字的?​被比作戏子的黛玉为什么生气?宝玉到底犯了什么不可饶恕的错?今天刷屏的 OpenAI Sora 模型,是怎么实现 1分钟一镜到底的?iOS 17.4中苹果播客将自动生成文本阴差阳错出国门(3)成功招桃花!春日小清新桃花贴,用它们把家里打造成文艺浪漫的桃林来自澳洲网友总结:在澳洲原来还有这些不成文的规定,移民、游客必看他们竟在悉尼歌剧院里挖了一条隧道,到底是怎么做到的?效果炸裂!OpenAI 发布首个视频生成模型,这就是 AI 视频的 GPT 时刻AI早知道|淘天集团自研大模型“淘宝星辰”上线;Gemini Pro1.5向所有人开放;Suno正式发布V3音乐生成模型用肛珠作弊,到底是谁发明的?国外赚钱国外花,一分别想带回家...从华人富豪,到锒铛入狱的穷光蛋,在美国,到底怎么才能保护自己的小钱钱?大语言模型评测是怎么被玩儿烂的?我们跟知情人聊了一个下午渴望能够见到你的夜晚AI绘图模型不会写字的难题,被阿里破解了大模型预测,下一个token何必是文字?
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。