图书前言

行业名家推荐

随着AI在日常生活中的越发普遍,我一直在寻找一本可以向我周边的非科班的朋友推荐的大模型科普著作,以跟他们解释这背后的种种为什么。这本书恰好是那个合适的著作,它用通俗语言拆解大模型的底层逻辑,把复杂技术讲得清晰易懂,是普通人也能读懂的AI入门佳作;译者也以扎实的专业功底与细腻的文字表达,用中文赋予了原著同样的流畅度与温度。

——朱颢,蔚来汽车「SkyOS·天枢」负责人,软件平台助理副总裁

作为数据领域从业者,近几年深刻感受到大语言模型对于行业的冲击,无论是用户业务还是数据系统,大模型都在重塑整个链条。面对各种新名词的持续涌现,浮躁与焦虑也随之而来。这本书能帮人沉下心来,建立对大模型更全面的认知,既不回避技术细节,也不让人迷失在公式里,并能就风险与局限进行坦诚讨论。译者翻译同样令人放心,专业、流畅,没有让好内容折损在语言转换上。这是一本我会推荐给团队每个成员的书。

——王烨,字节跳动数据BP团队负责人

这本书以严谨且通俗的方式梳理了大模型的关键原理与发展脉络,对核心概念、技术逻辑和应用边界都作了清晰说明。对于希望系统理解大模型的人而言,这是一本兼具专业性、准确性与可读性的优秀读物。 

——赵龙,前知乎搜索技术负责人

真正懂AI的人往往不会无脑推崇最强模型,而是深刻理解区别和边界。这本书最大的价值,就是不带任何滤镜地向你展示大模型能做什么和不能做什么。 当理解了大模型的局限和自动化的风险后,你才能真正将“超级大脑”变成解决具体业务场景的利器。

——行一,国内头部视频生成大模型团队,数据策略专家

大语言模型驱动的AI浪潮已席卷社会的方方面面,然而我们对它的真实了解,恐怕比自己以为的要少得多。普通用户容易高估或低估它在工作生活中的实际价值;而即便是业内最资深的专家,也无法完整解释其底层运作机制——什么是智能、 当今的大语言模型是否指向真正的智能,至今仍是未有定论的争议。正因如此,这个时代的每个人都值得认真了解大语言模型。本书难得地兼顾了两类读者:初学者可以从原理出发,跳出神话与恐慌,建立理性、清醒的认知;有一定基础的读者则能借此进一步思考训练与推理效率、能力边界乃至技术伦理等更深层的议题。 

——任鑫宇杨,字节跳动资深技术专家

序    言

本书的创作框架雏形形成于21世纪第二个十年末期。彼时,人工智能(AI)领域涌现出多项重大突破,我们预见到,这些技术进展很快就会催生一场颠覆性变革。新型计算机硬件的迭代、海量数据的可获取性,再加上神经网络技术的蓬勃发展,正迅速汇聚到一个临界点——机器学习算法终于能够以惊人的精准度,捕捉到语言的细微差别与深层含义。我们深知,一旦这些技术突破实现有效融合,将会催生出全新的应用领域。为此,我们开展相关研究、搭建原型系统,与同事、客户及家人深入交流,力求讲述清楚这些技术进步将如何改变世界,以及支撑这些变革的底层技术原理。

2022年11月底,OpenAI公司发布了ChatGPT,这一潜在的技术变革瞬间成为现实。通过向公众开放这项技术,任何人都能直接与大语言模型驱动的聊天机器人互动,亲身体验其强大能力。与任何新技术问世时的情形一样,人们对于ChatGPT为何能实现高保真度的交互、生成高质量的内容有着种种猜测。我们观察到,许多人使用ChatGPT后,往往会高估其背后的技术复杂度,甚至有人认为,通用AI的时代已触手可及——那种能够胜任所有任务的智能系统即将诞生。而我们的讨论重心也随之转变:聚焦于LLM应用的实际落地可能性,合理管控公众预期,梳理技术风险,验证模型行为边界,在技术可行性与安全责任红线之间探索可行路径。

时间来到2025年,我们已全面进入生成式AI与智能体AI的时代。各类模型、应用与功能呈爆发式增长,可处理的数据类型也日益丰富。几乎所有主流科技厂商都推出了集成大语言模型的产品,无论是可供对话的聊天机器人,还是能辅助文稿审阅、代码编写、图像生成的智能体,应有尽有。这些技术应用引发了诸多争议,围绕数据使用的新讨论层出不穷,也促使我们重新审视技术与创造力之间的关系。但无论如何,支撑这些应用的核心技术原理是共通的。本书的写作目标就是以通俗易懂的方式,向各行各业的读者阐释这些核心原理。

无论你是企业首席执行官、机器学习工程师、业余程序员,还是仅希望用好这项技术的普通用户,我们都希望你能从本书中有所收获,读懂驱动大语言模型运行的算法与技术。本书凝聚了我们在自然语言处理、机器学习及算法研究领域的实践经验,力求以深入浅出的方式分享知识,让绝大多数读者都能轻松理解。本书将为你揭开大语言模型的神秘面纱,阐明其技术局限性,并深入探讨这项迷人新技术所带来的深远影响。期待与你一同开启这段探索之旅。

致    谢

本书的付梓离不开众多人士的鼎力支持,包括我们的同事、合作伙伴,以及AI领域无数乐于分享技术和成果的研究者。

我们衷心感谢博思艾伦咨询公司(Booz Allen Hamilton)的各位同事对本书创作的支持,他们是John Larson、Steve Escaravage、Justin Neroda、Catherine Ordun、Jessica Reinhart和Katrina Jacobs。特别要感谢Andre Nguyen和Matt Keating,我们曾围绕LLM的本质及其安全考量展开过多次深入探讨,他们的见解极具价值。

同时,感谢曼宁出版社的优秀团队:策划编辑Frances Lefkowitz和技术编辑Shreesha Jagadeesh。他们提出了诸多深刻的问题,通过给予富有建设性的反馈,从多个维度对本书进行了打磨与完善。此外,还要感谢责任编辑Andy Waldron、出版经理Rebecca Rinehart,以及负责本书营销工作的Aira Ducic。

我们同样要感谢Melissa Ice和Radmila Ercegovac,她们在全书撰写过程中精心组织了多轮评审工作;也感谢所有匿名评审专家,他们提出的宝贵意见让本书臻于完善。

对于所有在本书出版过程中耐心付出的工作人员,我们致以诚挚的谢意,包括Aleksandar Dragosavljevic和Andy Marinkovich,负责文字编辑的Alisa Larson,以及承担最终校对工作的Melody Dolab。Sam Wood和Marija Tudor主导了本书封面的设计工作,Azra Dedic则负责全书图表的制作。

感谢所有参与评审的专家:Abdullah Al Imran、Adrian M. Rossi、Allan Makura、Ankit Virmani、Bhagvan Kommadi、Cristina-Ioana Casapu、David Cronkite、David Yakobovitch、Doug Puenner、Doyle Turner、Emanuele Piccinelli、Federico Grasso、Florian Braun、Georg Sommer、George Onofrei、Girish Ahankari、Harsh Ranjan、Holger Voges、Ivan A. Fernandez、Jaganadh Gopinadhan、Jeremy Zeidner、John R. Donoghue、John Guthrie、Jose Morales、Kartik Dutta、Kelvin Chappell、Louis Luangkesorn、Mark Graham、Mattia Zoccarato、Matt Sarmiento、Mikael Dautrey、Mike Taylor、Mostofa Adib Shakib、Neeraj Gupta、Oliver Korten、Raj G、Sashank Dara、Simeon Leyzerzon、Simone Sguazza、Slavomir Furman、Sudharshan Tumkunta、Tony Holdroyd、Vincent Joseph和Walter Alexander Mata López。正是你们的建议,让本书变得更加完善。

还要感谢Al Krinker,他曾是博思艾伦咨询公司的同事,也是我们在曼宁出版社的首任编辑,在本书创作初期给予了诸多指导,帮助我们顺利开启了写作之旅。

最后,也是最重要的,感谢家人与朋友的支持与鼓励。正是他们的陪伴,让我们得以在无数个夜晚与周末潜心创作,完成了本书的撰写。

前    言

本书是我们倾注了无数时间用于研究、探索、研讨,以及构建和评估大型语言模型,并搭建基于这类模型的问题求解系统后的心血凝结之作;也是我们几位作者多年深耕机器学习、自然语言处理与软件工程领域的经验结晶。我们希望通过本书分享所学知识,将复杂的技术内容转化为通俗易懂的语言,从大语言模型的底层原理讲起,逐步深入探讨那些尚未被广泛理解的前沿话题。在此过程中,我们将澄清一些常见的误解,揭示技术的真实面貌。

需要说明的是,本书并不涉及如何通过代码实现类似ChatGPT的大语言模型。相反,本书聚焦于大语言模型运行的核心原理,以及这项技术的机遇与局限性。我们将帮助读者理解其底层算法的工作机制,进而让读者明白大语言模型为何会采用当前的实现架构,以及如何运用它们解决各类实际问题。我们的目标是将多年来大语言模型的研究成果,转化为一本能让领域新人轻松读懂的入门读物。

全书的内容架构遵循由浅入深的原则:首先从基础知识讲起,帮助读者建立对大语言模型内部运行机制的基本认知;随后逐步过渡到更高级的主题,包括超越大语言模型本身的延伸性议题。在这个过程中,我们将剖析关于大语言模型的常见误解,阐明其技术边界,探讨构建与使用过程中的伦理问题,同时介绍如何将大语言模型作为技术方案,有效解决各类复杂难题。

目标读者 

本书的目标读者群体十分广泛,既包括刚接触大语言模型的新手,也涵盖经验丰富的软件开发人员与数据科学家;同时,也面向企业技术负责人、决策者及高管——他们正面临着制定战略,将大语言模型与生成式AI融入业务的挑战。我们撰写本书的初衷是打造一本兼具通俗性与深度的读物,以严谨且不失趣味的方式解读大语言模型。

或许你曾以学生或爱好者的身份修读过机器学习入门课程,但尚未构建起扎实的理论基础;又或许你在工作或生活中使用过OpenAI的ChatGPT、谷歌的Gemini、Anthropic的Claude或微软的Copilot等工具,并对它们的生成原理充满好奇。无论你拥有何种背景与经验,我们相信,本书都有适合你的内容。

读完本书后,你将掌握以下知识。

●  大语言模型如何处理人类语言数据,以及哪些任务使用大语言模型可能会失败。

●  数据在大语言模型中的流转过程,Transformer架构与注意力机制的作用、高层运作原理、重要性,以及它们与其他机器学习算法的关联。

●  大语言模型的训练流程,包括参数、梯度下降、预训练等核心概念,以及模型规模至关重要的原因。

●  如何为企业应用选择合适的大语言模型部署策略。

●  如何识别大语言模型无法实际解决的任务与场景。

●  使用与构建大语言模型的潜在风险与伦理考量,以及这项技术的适用与禁用场景。

本书框架

本书将从大语言模型处理人类语言的基本原理、支撑其运行的核心算法,以及模型从数据中学习的机制讲起。在此基础上,进一步探索大语言模型在文本之外的应用领域,最后深入讨论大语言模型的实际应用及其技术影响。

第1章用通俗易懂的语言,帮助读者建立对大语言模型与生成式AI的宏观认知。该章对比了人类与机器处理语言的不同方式,初步揭示大语言模型强大能力背后的奥秘,同时点明其技术局限性与使用过程中需要警惕的问题。

第2~5章深入剖析大语言模型的底层运行机制,重点讲解技术原理而非数学公式。其中第2章阐述大语言模型如何对文本进行预处理,为后续计算做准备;第3章则进一步揭秘输入大语言模型的内容最终如何转化为生成式输出。第4章探讨这一切得以实现的基础——如何利用海量文本训练大语言模型,以及训练过程中未能达到预期效果的原因。第5章介绍如何针对特定应用场景,对大语言模型及其输出进行控制与约束。

第6章将视野拓展到语言处理之外,探讨大语言模型在软件开发、形式化数学等领域的应用,同时涵盖文本、图像、音频、视频等多模态处理场景。

讲解完技术原理后,第7~9章将聚焦大语言模型在实际应用中需要考量的问题。第7章首先梳理关于大语言模型的常见误解,明确其能力边界与技术局限。第8章讨论基于大语言模型设计解决方案的不同场景,并指出一些看似合理的选择可能并非最优方案。第9章则必不可少地探讨了构建与使用大语言模型的伦理问题——这是任何相关技术讨论都无法回避的话题。大语言模型是否会对人类构成生存性风险?从互联网上大规模抓取数据用于训练,背后存在哪些伦理争议与影响?跟随本书的脉络,你将找到这些问题的答案,同时掌握批判性审视这项颠覆性技术所需的知识。

本书参考了大量文献,包括我们所涉及的大语言模型各领域的深度资料。这些文献可以扫二维码获取,以方便读者集中查阅。我们鼓励你通过这些资料继续探索,深入钻研自己感兴趣的主题。

关于本书封面

本书封面上的插图名为“夏尔·德·克莱沃,勒泰勒伯爵”(Charles de Cleves,Count of Rethel),创作于1852年,出自欧洲图书馆馆藏,由里昂公共图书馆提供。

在那个时代,人们仅凭衣着就能轻易分辨出一个人的居住地、职业或社会地位。曼宁出版社通过这种封面设计,展示了几百年前地区文化的丰富多元性,并通过这些珍贵藏品插图让昔日的文化风貌重焕生机,彰显计算机行业的创造力与开创精神。

作 者 简 介

爱德华·拉夫(Edward Raff)是博思艾伦咨询公司新兴人工智能部门总监,负责领导机器学习研究团队。他的研究领域涵盖医疗保健、自然语言处理、计算机视觉、网络安全及人工智能/机器学习基础研究。作为Inside Deep Learning一书的作者,拉夫博士在顶级AI会议上发表了百余篇研究论文。他是Java统计分析工具库的开发者,人工智能促进协会(AAAI)[  人工智能促进协会成立于1979年,前身为美国人工智能协会,是AI领域历史最悠久、涵盖内容最广泛的国际顶级学术会议之一。]高级会员,并曾两度担任“应用机器学习与信息技术会议”及“人工智能与网络安全研讨会”的主席。拉夫博士的研究成果已被全球多家杀毒软件公司采用并落地应用。

德鲁·法里斯(Drew Farris)是博思艾伦咨询公司首席顾问,专注于人工智能与机器学习领域,拥有14年以上为公共部门客户构建高级分析解决方案的经验。加入博思艾伦前,他曾与学术研究团队及初创企业合作,从事信息检索、自然语言处理和大规模数据管理平台的研发。他与人合著了多部著作,包括博思艾伦的Field Guide to Data Science和Machine Intelligence,以及荣获Jolt奖[  Jolt奖是计算机软件领域的知名奖项,由Dr. Dobb’s Journal杂志于1990年创设。该奖项覆盖的领域包括软件开发工具、软件开发书籍、软件开发方法和技术等。]的计算文本处理专著Taming Text。此外,他还是Apache软件基金会成员,曾为Apache Mahout、Lucene和Solr等开源项目贡献代码。

斯特拉·比德曼(Stella Biderman)是博思艾伦咨询公司的机器学习研究员,同时担任EleutherAI[  EleutherAI是一个去中心化的开源AI研究组织,致力于开发和推广LLM,并推动AI技术的开放性和民主化。该组织最著名的成果是在2021年发布了GPT-Neo系列模型,重构了GPT-3架构并提供开源实现。]非营利研究中心执行董事。她是开源AI的核心倡导者,曾主导训练多款全球最强大的开源AI算法。她拥有佐治亚理工学院计算机科学硕士学位,以及芝加哥大学数学与哲学双学位。