跳转到内容

大语言模型:修订间差异

轻之舟百科,让知识轻装启航
云云​(留言 | 贡献)
创建页面,内容为“{{Infobox | 标题 = Large Language Model | 内容 = {{!}}- ! 中文名 {{!}} 大语言模型 {{!}}- ! 英文名 {{!}} Large Language Model {{!}}- ! 缩写 {{!}} LLM {{!}}- ! 领域 {{!}} 人工智能、自然语言处理 {{!}}- ! 基础架构 {{!}} Transformer {{!}}- ! 首次使用 {{!}} 2018年 {{!}}- ! 代表性模型 {{!}} GPT、BERT、Claude、Gemini }} 大语言模型(英文:Large Language Model,缩写:LLM)是一类基于深度学习、特别…”
 
IdleTap-bot​(留言 | 贡献)
由旧格式Infobox转换为新参数格式(label/data),修复空信息框(由IdleTap-bot执行)
 
第1行: 第1行:
{{Infobox
{{Infobox
| 标题 = Large Language Model
| title = Large Language Model
| 内容 =  
 
{{!}}-
| label1 = 中文名
! 中文名
| data1 = 大语言模型
{{!}} 大语言模型
 
{{!}}-
| label2 = 英文名
! 英文名
| data2 = Large Language Model
{{!}} Large Language Model
 
{{!}}-
| label3 = 缩写
! 缩写
| data3 = LLM
{{!}} LLM
 
{{!}}-
| label4 = 领域
! 领域
| data4 = 人工智能、自然语言处理
{{!}} 人工智能、自然语言处理
 
{{!}}-
| label5 = 基础架构
! 基础架构
| data5 = Transformer
{{!}} Transformer
 
{{!}}-
| label6 = 首次使用
! 首次使用
| data6 = 2018年
{{!}} 2018年
 
{{!}}-
| label7 = 代表性模型
! 代表性模型
| data7 = GPT、BERT、Claude、Gemini
{{!}} GPT、BERT、Claude、Gemini
}}
}}


大语言模型([[英文]]:Large Language Model,缩写:LLM)是一类基于深度学习、特别是Transformer[[架构]]的人工智能系统,通过对海量[[文本]][[数据]]进行训练以理解、生成和交互自然语言。<ref name=":0">[https://www.britannica.com/topic/large-language-model Large language model | Definition, History, & Facts - Britannica]</ref> 其核心机制为预测给定文本序列后的最可能词元(token),凭借数十亿至数万亿级别的参数量,模型能够执行文本生成、翻译、摘要、代码编写及复杂推理等任务。<ref name=":1">[https://www.merriam-webster.com/dictionary/large%20language%20model Definition of LARGE LANGUAGE MODEL - Merriam-Webster]</ref> 2017年[[Go]]ogle提出的Transformer架构为现代大语言模型奠定基础,<ref name=":2">[https://arxiv.org/html/2307.06435v9 A Comprehensive Overview of Large Language Models - arXiv]</ref> 2018年Open[[AI]]的GPT与[[Google]]的BERT相继发布,标志着大语言模型时代的正式开启。<ref name=":0" /> 此后,模型规模与能力持续扩展,以GPT-4、Claude、Gemini等为代表的系统已具备多模态理解与长上下文处理能力,广泛应用于科研、商业及日常交互场景。<ref name=":3">[https://www.geeksforgeeks.org/blogs/history-and-evolution-of-llms/ History and Evolution of LLMs - GeeksforGeeks]</ref>
大语言模型([[英文]]:Large Language Model,缩写:LLM)是一类基于深度学习、特别是Transformer[[架构]]的[[人工智能]]系统,通过对海量[[文本]][[数据]]进行训练以理解、生成和交互自然语言。<ref name=":0">[https://www.britannica.com/topic/large-language-model Large language model | Definition, History, & Facts - Britannica]</ref> 其核心机制为预测给定文本序列后的最可能词元(token),凭借数十亿至数万亿级别的参数量,模型能够执行文本生成、翻译、摘要、代码编写及复杂推理等任务。<ref name=":1">[https://www.merriam-webster.com/dictionary/large%20language%20model Definition of LARGE LANGUAGE MODEL - Merriam-Webster]</ref> 2017年[[Go]]ogle提出的Transformer架构为现代大语言模型奠定基础,<ref name=":2">[https://arxiv.org/html/2307.06435v9 A Comprehensive Overview of Large Language Models - arXiv]</ref> 2018年Open[[AI]]的GPT与[[Google]]的BERT相继发布,标志着大语言模型时代的正式开启。<ref name=":0" /> 此后,模型规模与能力持续扩展,以GPT-4、Claude、Gemini等为代表的系统已具备多模态理解与长上下文处理能力,广泛应用于科研、商业及日常交互场景。<ref name=":3">[https://www.geeksforgeeks.org/blogs/history-and-evolution-of-llms/ History and Evolution of LLMs - GeeksforGeeks]</ref>


== 定义 ==
== 定义 ==
第31行: 第30行:
=== 核心特征 ===
=== 核心特征 ===


大语言模型的"大"主要体现在两方面:一是参数量(parameters)规模巨大,从数亿到数万亿不等;二是训练数据量庞大,可达数万亿词元。<ref name=":0" /> 模型通过自监督学习在海量未标注文本上建立词与词之间的统计关系,再经监督微调(Supervised Fine-Tuning)与基于人类反馈的强化学习(RLHF)等阶段优化输出质量。<ref name=":4">[https://gregorygundersen.com/blog/2025/10/01/large-language-models/ A History of Large Language Models - Gregory Gundersen]</ref> 从功能角度,当前部署的系统多属"狭义"大语言模型,专注于语言相关任务;而具备跨领域通用推理能力的通用人工智能(AGI)仍处于研究阶段。<ref name=":0" />
大语言模型的"大"主要体现在两方面:一是参数量(pa[[RAM|ram]]eters)规模巨大,从数亿到数万亿不等;二是训练数据量庞大,可达数万亿词元。<ref name=":0" /> 模型通过自监督学习在海量未标注文本上建立词与词之间的统计关系,再经监督微调(Supervised Fine-Tuning)与基于人类反馈的强化学习(RLHF)等阶段优化输出质量。<ref name=":4">[https://gregorygundersen.com/blog/2025/10/01/large-language-models/ A History of Large Language Models - Gregory Gundersen]</ref> 从功能角度,当前部署的系统多属"狭义"大语言模型,专注于语言相关任务;而具备跨领域通用推理能力的通用人工智能(AGI)仍处于研究阶段。<ref name=":0" />


=== 与早期语言模型的区别 ===
=== 与早期语言模型的区别 ===

2026年8月11日 (二) 10:31的最新版本

Large Language Model
中文名大语言模型
英文名Large Language Model
缩写LLM
领域人工智能、自然语言处理
基础架构Transformer
首次使用2018年
代表性模型GPT、BERT、Claude、Gemini

大语言模型(英文:Large Language Model,缩写:LLM)是一类基于深度学习、特别是Transformer架构的人工智能系统,通过对海量文本数据进行训练以理解、生成和交互自然语言。[1] 其核心机制为预测给定文本序列后的最可能词元(token),凭借数十亿至数万亿级别的参数量,模型能够执行文本生成、翻译、摘要、代码编写及复杂推理等任务。[2] 2017年Google提出的Transformer架构为现代大语言模型奠定基础,[3] 2018年OpenAI的GPT与Google的BERT相继发布,标志着大语言模型时代的正式开启。[1] 此后,模型规模与能力持续扩展,以GPT-4、Claude、Gemini等为代表的系统已具备多模态理解与长上下文处理能力,广泛应用于科研、商业及日常交互场景。[4]

核心特征

[编辑 | 编辑源代码]

大语言模型的"大"主要体现在两方面:一是参数量(parameters)规模巨大,从数亿到数万亿不等;二是训练数据量庞大,可达数万亿词元。[1] 模型通过自监督学习在海量未标注文本上建立词与词之间的统计关系,再经监督微调(Supervised Fine-Tuning)与基于人类反馈的强化学习(RLHF)等阶段优化输出质量。[5] 从功能角度,当前部署的系统多属"狭义"大语言模型,专注于语言相关任务;而具备跨领域通用推理能力的通用人工智能(AGI)仍处于研究阶段。[1]

与早期语言模型的区别

[编辑 | 编辑源代码]

区别于1960年代基于规则的ELIZA或1990年代的统计N-gram模型,现代大语言模型采用深度神经网络,特别是Transformer架构,通过自注意力机制(self-attention)捕捉长距离语义依赖,实现并行计算与大规模扩展。[1][3]

早期奠基

[编辑 | 编辑源代码]

人工智能与自然语言处理的思想可追溯至1950年图灵测试的提出。1966年,麻省理工学院的ELIZA程序基于规则匹配模拟对话,成为首个具有广泛影响的聊天机器人。[1] 1980年代后,统计语言模型逐渐取代规则系统;1997年长短期记忆网络(LSTM)的提出解决了循环神经网络(RNN)的长期依赖问题,为后续神经网络语言模型奠定基础。[4]

Transformer革命

[编辑 | 编辑源代码]

2017年6月,Google研究团队在论文《Attention Is All You Need》中提出Transformer架构,引入自注意力机制与多头注意力,彻底改变了自然语言处理的范式。[3][4] Transformer的并行计算能力使训练更大规模模型成为可能,直接催生了大语言模型这一类别。

预训练语言模型兴起

[编辑 | 编辑源代码]

2018年,OpenAI发布GPT(Generative Pre-trained Transformer),采用仅解码器(decoder-only)架构与生成式预训练策略;同年Google发布BERT(Bidirectional Encoder Representations from Transformers),采用双向编码器架构。[1][3] 两者确立了"预训练+微调"的范式,证明大规模无监督预训练可显著提升下游任务表现。

规模扩展与涌现能力

[编辑 | 编辑源代码]

2020年,OpenAI发布GPT-3,参数量达1750亿,展现出上下文学习(In-Context Learning)、零样本推理等"涌现能力"(Emergent Abilities),表明模型规模扩大可带来质的能力跃迁。[4][5] 同期,Google推出PaLM、Meta推出OPT等大规模模型,推动行业进入大模型扩展阶段。

对齐与普及

[编辑 | 编辑源代码]

2022年11月,OpenAI发布ChatGPT,基于GPT-3.5架构并引入RLHF技术,显著提升了对话一致性与安全性,使大语言模型进入主流公众视野。[4] 此后,GPT-4、Claude 3、Gemini、Llama等模型在多模态理解、长上下文窗口(可达数百万token)及推理能力上持续突破;开源模型生态亦蓬勃发展,降低了研究与应用门槛。[4][6]

技术架构

[编辑 | 编辑源代码]

Transformer基础

[编辑 | 编辑源代码]

几乎所有现代大语言模型均基于Transformer架构。该架构由编码器(Encoder)与解码器(Decoder)组成,核心为自注意力机制,可动态计算序列中各词元之间的关联权重,摆脱了对循环结构的依赖,实现高效并行训练。[1][3]

主要架构变体

[编辑 | 编辑源代码]
  • 仅编码器模型(Encoder-only):如BERT,通过掩码语言建模(Masked Language Modeling)学习双向上下文表示,适用于文本理解任务。
  • 仅解码器模型(Decoder-only):如GPT系列,通过自回归方式逐词元生成文本,适用于文本生成任务。
  • 编码器-解码器模型(Encoder-Decoder):如T5、BART,兼顾理解与生成,适用于翻译、摘要等序列到序列任务。[3]

训练阶段

[编辑 | 编辑源代码]

典型大语言模型的训练包括三阶段:

  1. 预训练(Pre-training):在大规模无标注文本上进行自监督学习,建立基础语言能力与知识储备。
  2. 监督微调(Supervised Fine-Tuning, SFT):在特定任务或高质量对话数据上微调,提升任务表现。
  3. 基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF):通过人类偏好数据优化模型输出,使其更符合人类价值观与交互习惯。[5]

大语言模型已广泛应用于多个领域:

  • 文本生成与编辑:撰写文章、诗歌、营销文案及代码。
  • 机器翻译:实现高质量跨语言转换。
  • 问答与信息检索:作为搜索引擎增强或独立知识问答系统。
  • 对话代理:客户服务、教育辅导、个人助理等聊天机器人。
  • 代码辅助:代码补全、漏洞检测与程序生成。
  • 科学研究:文献综述、假设生成与实验设计辅助。[1][4]

挑战与争议

[编辑 | 编辑源代码]

幻觉与准确性

[编辑 | 编辑源代码]

大语言模型可能生成看似合理但不符合事实的内容,此现象称为"幻觉"(Hallucination)。由于模型本质是基于概率的文本预测器,其输出并不保证事实准确性。[1]

偏见与公平性

[编辑 | 编辑源代码]

训练数据中存在的社会偏见可能被模型学习并放大,导致在性别、种族、文化等维度上产生歧视性输出。[1]

资源消耗

[编辑 | 编辑源代码]

训练与运行大规模模型需要巨大的计算资源与能源,引发对环境可持续性的担忧。[1]

安全与滥用风险

[编辑 | 编辑源代码]

模型可能被用于生成虚假信息、网络钓鱼内容或协助恶意代码编写。此外,通用人工智能(AGI)的长期风险亦引发学界与政策界的广泛讨论。[1][4]

参考文献

[编辑 | 编辑源代码]