内容简介:
2022年底,ChatGPT的诞生引发变革,以GPT系列模型为代表的大语言模型(Large Language Model,LLM)成为人工智能领域的研究热点,LLM在此背景下基于预训练语言模型取得突破性进展。本书分为基础知识与实战应用两大部分,基础知识部分包含第1~4章,首先介绍NLP的基本任务及文本表示的发展历程,接着阐述LLM基本架构Transformer和经典PLM架构,最后详述LLM的特点、能力和训练过程;实战应用部分包含第5~7章,依次讲解基于PyTorch搭建LLM的全流程,借助主流框架实现LLM训练,以及LLM的各类应用,帮助读者构建完整的LLM知识体系。 本书适合具备一定编程经验(尤其对Python编程语言有所了解)、掌握深度学习相关知识且了解NLP领域相关概念和术语的大学生、研究人员及LLM爱好者阅读。