GPT开山论文:通过生成式预训练(GPT)提升语言理解能力

发布时间:2026/7/31 12:58:29
GPT开山论文:通过生成式预训练(GPT)提升语言理解能力 这篇论文是GPTGenerative Pre-Training生成式预训练系列的开篇论文GPT-1提出了后来影响整个大语言模型领域的“无监督预训练 有监督微调Pre-training Fine-tuning”范式。作者Alec Radford、Karthik Narasimhan、Tim Salimans、Ilya Sutskever发表于 OpenAI摘要自然语言理解涵盖了广泛且多样化的任务例如文本蕴含判断、问答、语义相似度评估以及文档分类等。尽管大规模的无标注文本语料库非常丰富但用于学习这些特定任务的标注数据却十分有限这使得采用判别式训练方法的模型难以取得理想效果。本文证明通过以下方式可以显著提升这些任务的性能首先在大量、多样化的无标注文本语料库上对语言模型进行生成式预训练然后针对每一个具体任务利用标注数据进行判别式微调discriminative fine-tuning。与以往方法不同的是我们在微调阶段采用了任务感知的输入转换方法task-aware input transformations从而实现了有效的知识迁移同时只需要对模型架构进行极少的修改。我们在多个自然语言理解基准测试任务中验证了该方法的有效性。我们提出的这种通用任务无关模型general task-agnostic model超越了那些针对每个任务专门设计架构、并采用判别式训练的模型。在本文研究的 12 项任务中该模型在其中 9 项任务上显著超过了当前最先进水平state of the art。例如在常识推理任务Stories Cloze Test中取得了8.9% 的绝对性能提升在问答任务RACE中取得了5.7% 的绝对性能提升在文本蕴含任务MultiNLI中取得了1.5% 的绝对性能提升。1 引言从原始文本中有效学习的能力对于减少自然语言处理NLP领域对监督学习的依赖至关重要。目前大多数深度学习方法都需要大量人工标注数据这限制了它们在许多缺乏标注资源领域中的应用。在这些情况下能够利用无标注数据中的语言信息进行学习的模型为获取更多人工标注数据提供了一种有价值的替代方案因为人工标注过程通常既耗时又昂贵。此外即使在拥有大量监督数据的情况下以无监督方式学习良好的数据表示也能够显著提升模型性能。到目前为止最有说服力的证据来自于预训练词嵌入pre-trained word embeddings的大规模应用。研究表明通过在无标注文本数据上训练得到的词向量可以有效提升多种自然语言处理任务的性能。然而要从无标注文本中学习超过词语层面的信息仍然面临两个主要挑战。首先目前尚不清楚哪一种优化目标最适合学习能够有效迁移到其他任务中的文本表示。近期研究探索了多种不同的学习目标例如语言建模language modeling机器翻译machine translation篇章连贯性建模discourse coherence但不同方法往往只在不同任务上表现更好尚未形成统一结论。其次对于如何将学习得到的文本表示迁移到目标任务目前也没有统一有效的方法。现有技术通常需要针对具体任务修改模型架构使用复杂的训练策略添加额外的辅助学习目标。这些方法增加了模型设计和训练过程的复杂度使得构建有效的半监督学习方法变得困难。本文提出了一种用于自然语言理解任务的半监督学习方法semi-supervised approach该方法结合无监督预训练unsupervised pre-training监督微调supervised fine-tuning我们的目标是学习一种通用文本表示universal representation使其能够经过少量调整后迁移到各种不同任务中。我们的假设是可以获得大量无标注文本语料同时拥有若干包含人工标注训练样本的数据集即目标任务。值得注意的是我们的方法并不要求目标任务与无标注训练语料来自同一个领域。我们的训练过程包含两个阶段第一阶段语言模型预训练首先我们利用无标注文本数据通过语言建模目标训练一个神经网络模型使模型学习语言结构并获得初始化参数。第二阶段目标任务微调随后我们利用对应任务的监督学习目标对这些参数进行调整使模型适应具体任务。这种两阶段训练方式使模型能够首先学习通用语言知识然后将这些知识迁移到具体自然语言理解任务中。在模型架构方面我们采用Transformer。Transformer 已经在多个任务中表现出强大的能力例如机器翻译文档生成句法分析。选择 Transformer 的原因在于相比循环神经网络Recurrent NetworksTransformer 能够更好地处理文本中的长期依赖关系因此能够在多种任务之间实现更加稳定的知识迁移。在迁移学习阶段我们采用了一种基于任务特征的输入转换方法。该方法将不同任务中的结构化文本输入转换为统一的连续 Token 序列使预训练模型能够直接处理。通过这种方式我们避免了针对不同任务大量修改模型架构从而只需要对预训练模型进行少量调整即可完成微调。我们在四类自然语言理解任务上评估该方法自然语言推理Natural Language Inference问答Question Answering语义相似度分析Semantic Similarity文本分类Text Classification实验结果表明我们的通用任务无关模型general task-agnostic model超过了那些针对单个任务专门设计架构并进行判别式训练的模型。在本文研究的 12 个任务中该模型在 9 个任务上显著超过当前最佳水平。例如在 GLUE 多任务基准测试中提升5.5%。此外我们还分析了预训练模型在四种不同零样本zero-shot场景中的表现证明该模型能够通过预训练获得对下游任务有价值的语言知识。