正版全新
-
作者:
(美)爱德华·拉夫(EdwardRaff)德鲁·法里斯(DrewFarris)斯特拉·比德曼(StellaBiderman)
-
出版社:
清华大学出版社
-
ISBN:
9787302719823
-
出版时间:
2022-12
-
装帧:
其他
-
纸张:
胶版纸
-
作者:
(美)爱德华·拉夫(EdwardRaff)德鲁·法里斯(DrewFarris)斯特拉·比德曼(StellaBiderman)
-
出版社:
清华大学出版社
-
ISBN:
9787302719823
-
出版时间:
2022-12
售价
¥
42.01
7.0折
定价
¥59.80
品相
全新
上书时间2026-09-06
卖家超过10天未登录
-
-
商品描述:
-
【书 名】 智能体的超级大脑:大模型工作原理揭秘
【书 号】 9787302719823
【出 版 社】 清华大学出版社
【作 者】 (美)爱德华·拉夫(EdwardRaff)德鲁·法里斯(DrewFarris)斯特拉·比德曼(StellaBiderman)
【出版日期】 2026-07-01
【定 价】 59.80元
【编辑推荐】
无论你是企业首席执行官、机器学习工程师、业余程序员,还是仅希望用好这项技术的普通用户,我们都希望你能从本书中有所收获,读懂驱动大语言模型运行的算法与技术。本书凝聚了我们在自然语言处理、机器学习及算法研究领域的实践经验,力求以深入浅出的方式分享知识,让绝大多数读者都能轻松理解。本书将为你揭开大语言模型的神秘面纱,阐明其技术局限性,并深入探讨这项迷人新技术所带来的深远影响。期待与你一同开启这段探索之旅。
【内容简介】
大语言模型(LLM)让人工智能真正“智能”起来。通过连接数十亿份文档中的词语、概念和模式,LLM能够生成类似人类的回应——这也是我们在ChatGPT、Claude和DeepSeek等工具使用过程中习以为常的体验。在这本兼具知识性与趣味性的书中,博思艾伦咨询公司(BoozAllenHamilton)全球顶*的机器学习研究员们,深入探讨了LLM的基础概念、发展机遇与局限性,以及将人工智能融入企业组织和应用程序的*佳实践方法。这本书带你走进LLM的内部世界,一步步解析自然语言提示词如何转化为清晰、易读的文本补全结果。全书以通俗易懂的语言撰写,无须任何机器学习或人工智能基础,你就能学会LLM的构建原理、出错原因,以及如何设计可靠的人工智能解决方案。阅读过程中,你还会了解LLM的“思考”方式、如何设计基于LLM的智能体与问答系统等应用,以及如何应对人工智能领域的伦理、法律和安全问题。主要内容?为特定应用定制LLM?降低劣质输出与算法偏见的风险?破除关于LLM的种种误区?超越传统自然语言处理的技术边界
【目录】
目 录
第1章 宏观视角:什么是大语言模型 1
1.1 生成式AI的定位 2
1.2 本书能带给你什么 5
1.3 LLM工作原理初探 7
1.4 到底什么是智能 9
1.5 人类与机器表征语言的方式有何不同 10
1.6 GPT及其同类模型 12
1.7 LLM为何表现如此出色 13
1.8 LLM实战:优势、缺陷与隐患 15
本章小结 16
第2章 分词器:LLM如何“看见”世界 19
2.1 词元:文本的数值表征形式 20
2.2 语言模型只能“看见”词元 21
2.2.1 分词的基本流程 23
2.2.2 分词过程中的词汇量控制 25
2.2.3 分词原理详解 27
2.2.4 分词的潜在风险 31
2.3 分词与LLM的能力边界 33
2.3.1 LLM不擅长文字游戏 34
2.3.2 LLM在数学任务上表现不佳 35
2.3.3 LLM与语言公平性问题 36
2.4 自测小练习 37
2.5 分词的整体定位 38
本章小结 38
第3章 Transformer:从输入到输出 41
3.1 Transformer模型 42
3.2 Transformer架构深度解析 46
3.2.1 嵌入层 47
3.2.2 Transformer层 53
3.2.3 反嵌入层 56
3.3 创造性与主题相关性的权衡 60
3.4 Transformer的整体定位 61
本章小结 62
第4章 LLM如何学习 65
4.1 梯度下降 66
4.1.1 损失函数的定义 67
4.1.2 什么是梯度下降 70
4.2 LLM如何模仿人类文本 74
4.3 LLM与新颖任务 79
4.3.1 任务识别失败问题 82
4.3.2 LLM缺乏规划能力 83
4.4 若LLM外推能力有限,还能使用它们吗 84
4.5 模型越大越好吗 86
本章小结 87
第5章 如何约束LLM的行为 89
5.1 约束LLM行为的核心动因 91
5.1.1 基础模型的实用性局限 93
5.1.2 模型的部分输出结果不合预期 93
5.1.3 特定场景对输出格式有严格要求 95
5.2 微调:改变LLM行为的核心方法 95
5.2.1 有监督微调 96
5.2.2 基于人类反馈的强化学习 98
5.2.3 微调技术全景 101
5.3 RLHF的工作机制 101
5.3.1 朴素版RLHF的初步探索 101
5.3.2 质量奖励模型 103
5.3.3 平衡质量与相似性的RLHF目标 104
5.4 定制LLM行为的其他关键因素 105
5.4.1 调整训练数据 106
5.4.2 优化基础模型训练流程 107
5.4.3 调整输出结果 108
5.5 将LLM集成至复杂工作流 109
5.5.1 基于检索增强生成的LLM定制 109
5.5.2 通用LLM编程 112
本章小结 114
第6章 超越自然语言处理 117
6.1 用于软件开发的LLM 119
6.1.1 改进LLM以适配代码任务 122
6.1.2 验证LLM生成的代码 123
6.1.3 通过格式化优化代码 124
6.2 面向形式化数学的LLM 126
6.2.1 输入预处理的挑战 127
6.2.2 数字理解的优化 128
6.2.3 数学领域的LLM也会使用工具 131
6.3 Transformer与计算机视觉 133
6.3.1 图像与补丁的相互转换 134
6.3.2 结合图像与文本的多模态模型 137
6.3.3 既往知识的适用性 138
本章小结 140
第7章 LLM的常见误解、能力局限与卓越优势 141
7.1 人类与LLM学习速度的对比 142
7.1.1 自我改进的局限性 146
7.1.2 少样本学习 150
7.2 工作效率对比:10瓦的人类大脑与2000瓦的计算机 151
7.2.1 能源消耗 152
7.2.2 延迟、可扩展性与可用性 153
7.2.3 优化改进 153
7.3 语言模型并非世界模型 154
7.4 计算局限性:难题依旧难解 157
7.4.1 用“模糊算法”解决“模糊问题” 161
7.4.2 对于难题,有时近似解就已足够 162
本章小结 163
第8章 基于LLM设计解决方案 165
8.1 直接开发一个聊天机器人 166
8.2 自动化偏见 169
8.2.1 调整流程 171
8.2.2 当LLM自主运行风险过高时 172
8.3 结合多种工具降低风险 174
8.3.1 LLM嵌入向量与其他工具的结合 174
8.3.2 基于嵌入向量的解决方案设计 177
8.4 技术呈现方式至关重要 179
8.4.1 如何实现透明度 181
8.4.2 与用户利益对齐 181
8.4.3 建立反馈循环 182
本章小结 183
第9章 构建与使用LLM的伦理问题 185
9.1 为何要构建LLM 186
9.1.1 LLM“无所不能”的利弊 187
9.1.2 要将人类所有工作都自动化吗 189
9.2 LLM是否构成生存性风险 193
9.2.1 自我改进与迭代式S曲线 196
9.2.2 对齐问题 197
9.3 数据获取与复用的伦理问题 200
9.3.1 什么是合理使用 201
9.3.2 向内容创作者支付报酬面临的挑战 203
9.3.3 公共领域数据的局限性 204
9.4 LLM输出内容的伦理担忧 205
9.4.1 LLM输出内容的许可协议影响 206
9.4.2 LLM的输出内容是否会毒化数据源 208
9.5 LLM伦理的其他探索方向 211
本章小结 212
【前言】
行业名家推荐
随着AI在日常生活中的越发普遍,我一直在寻找一本可以向我周边的非科班的朋友推荐的大模型科普著作,以跟他们解释这背后的种种为什么。这本书恰好是那个合适的著作,它用通俗语言拆解大模型的底层逻辑,把复杂技术讲得清晰易懂,是普通人也能读懂的AI入门佳作;译者也以扎实的专业功底与细腻的文字表达,用中文赋予了原著同样的流畅度与温度。
——朱颢,蔚来汽车「SkyOS·天枢」负责人,软件平台助理副总裁
作为数据领域从业者,近几年深刻感受到大语言模型对于行业的冲击,无论是用户业务还是数据系统,大模型都在重塑整个链条。面对各种新名词的持续涌现,浮躁与焦虑也随之而来。这本书能帮人沉下心来,建立对大模型更全面的认知,既不回避技术细节,也不让人迷失在公式里,并能就风险与局限进行坦诚讨论。译者翻译同样令人放心,专业、流畅,没有让好内容折损在语言转换上。这是一本我会推荐给团队每个成员的书。
——王烨,字节跳动数据BP团队负责人
这本书以严谨且通俗的方式梳理了大模型的关键原理与发展脉络,对核心概念、技术逻辑和应用边界都作了清晰说明。对于希望系统理解大模型的人而言,这是一本兼具专业性、准确性与可读性的优秀读物。
——赵龙,前知乎搜索技术负责人
真正懂AI的人往往不会无脑推崇*强模型,而是深刻理解区别和边界。这本书*大的价值,就是不带任何滤镜地向你展示大模型能做什么和不能做什么。 当理解了大模型的局限和自动化的风险后,你才能真正将“超级大脑”变成解决具体业务场景的利器。
——行一,国内头部视频生成大模型团队,数据策略专家
大语言模型驱动的AI浪潮已席卷社会的方方面面,然而我们对它的真实了解,恐怕比自己以为的要少得多。普通用户容易高估或低估它在工作生活中的实际价值;而即便是业内*资深的专家,也无法完整解释其底层运作机制——什么是智能、 当今的大语言模型是否指向真正的智能,至今仍是未有定论的争议。正因如此,这个时代的每个人都值得认真了解大语言模型。本书难得地兼顾了两类读者:初学者可以从原理出发,跳出神话与恐慌,建立理性、清醒的认知;有一定基础的读者则能借此进一步思考训练与推理效率、能力边界乃至技术伦理等更深层的议题。
——任鑫宇杨,字节跳动资深技术专家
序 言
本书的创作框架雏形形成于21世纪第二个十年末期。彼时,人工智能(AI)领域涌现出多项重大突破,我们预见到,这些技术进展很快就会催生一场颠覆性变革。新型计算机硬件的迭代、海量数据的可获取性,再加上神经网络技术的蓬勃发展,正迅速汇聚到一个临界点——机器学习算法终于能够以惊人的精准度,捕捉到语言的细微差别与深层含义。我们深知,一旦这些技术突破实现有效融合,将会催生出全新的应用领域。为此,我们开展相关研究、搭建原型系统,与同事、客户及家人深入交流,力求讲述清楚这些技术进步将如何改变世界,以及支撑这些变革的底层技术原理。
2022年11月底,OpenAI公司发布了ChatGPT,这一潜在的技术变革瞬间成为现实。通过向公众开放这项技术,任何人都能直接与大语言模型驱动的聊天机器人互动,亲身体验其强大能力。与任何新技术问世时的情形一样,人们对于ChatGPT为何能实现高保真度的交互、生成高质量的内容有着种种猜测。我们观察到,许多人使用ChatGPT后,往往会高估其背后的技术复杂度,甚至有人认为,通用AI的时代已触手可及——那种能够胜任所有任务的智能系统即将诞生。而我们的讨论重心也随之转变:聚焦于LLM应用的实际落地可能性,合理管控公众预期,梳理技术风险,验证模型行为边界,在技术可行性与安全责任红线之间探索可行路径。
时间来到2025年,我们已全面进入生成式AI与智能体AI的时代。各类模型、应用与功能呈爆发式增长,可处理的数据类型也日益丰富。几乎所有主流科技厂商都推出了集成大语言模型的产品,无论是可供对话的聊天机器人,还是能辅助文稿审阅、代码编写、图像生成的智能体,应有尽有。这些技术应用引发了诸多争议,围绕数据使用的新讨论层出不穷,也促使我们重新审视技术与创造力之间的关系。但无论如何,支撑这些应用的核心技术原理是共通的。本书的写作目标就是以通俗易懂的方式,向各行各业的读者阐释这些核心原理。
无论你是企业首席执行官、机器学习工程师、业余程序员,还是仅希望用好这项技术的普通用户,我们都希望你能从本书中有所收获,读懂驱动大语言模型运行的算法与技术。本书凝聚了我们在自然语言处理、机器学习及算法研究领域的实践经验,力求以深入浅出的方式分享知识,让绝大多数读者都能轻松理解。本书将为你揭开大语言模型的神秘面纱,阐明其技术局限性,并深入探讨这项迷人新技术所带来的深远影响。期待与你一同开启这段探索之旅。
致 谢
本书的付梓离不开众多人士的鼎力支持,包括我们的同事、合作伙伴,以及AI领域无数乐于分享技术和成果的研究者。
我们衷心感谢博思艾伦咨询公司(Booz Allen Hamilton)的各位同事对本书创作的支持,他们是John Larson、Steve Escaravage、Justin Neroda、Catherine Ordun、Jessica Reinhart和Katrina Jacobs。特别要感谢Andre Nguyen和Matt Keating,我们曾围绕LLM的本质及其安全考量展开过多次深入探讨,他们的见解极具价值。
同时,感谢曼宁出版社的优秀团队:策划编辑Frances Lefkowitz和技术编辑Shreesha Jagadeesh。他们提出了诸多深刻的问题,通过给予富有建设性的反馈,从多个维度对本书进行了打磨与完善。此外,还要感谢责任编辑Andy Waldron、出版经理Rebecca Rinehart,以及负责本书营销工作的Aira Ducic。
我们同样要感谢Melissa Ice和Radmila Ercegovac,她们在全书撰写过程中精心组织了多轮评审工作;也感谢所有匿名评审专家,他们提出的宝贵意见让本书臻于完善。
对于所有在本书出版过程中耐心付出的工作人员,我们致以诚挚的谢意,包括Aleksandar Dragosavljevic和Andy Marinkovich,负责文字编辑的Alisa Larson,以及承担*终校对工作的Melody Dolab。Sam Wood和Marija Tudor主导了本书封面的设计工作,Azra Dedic则负责全书图表的制作。
感谢所有参与评审的专家:Abdullah Al Imran、Adrian M. Rossi、Allan Makura、Ankit Virmani、Bhagvan Kommadi、Cristina-Ioana Casapu、David Cronkite、David Yakobovitch、Doug Puenner、Doyle Turner、Emanuele Piccinelli、Federico Grasso、Florian Braun、Georg Sommer、George Onofrei、Girish Ahankari、Harsh Ranjan、Holger Voges、Ivan A. Fernandez、Jaganadh Gopinadhan、Jeremy Zeidner、John R. Donoghue、John Guthrie、Jose Morales、Kartik Dutta、Kelvin Chappell、Louis Luangkesorn、Mark Graham、Mattia Zoccarato、Matt Sarmiento、Mikael Dautrey、Mike Taylor、Mostofa Adib Shakib、Neeraj Gupta、Oliver Korten、Raj G、Sashank Dara、Simeon Leyzerzon、Simone Sguazza、Slavomir Furman、Sudharshan Tumkunta、Tony Holdroyd、Vincent Joseph和Walter Alexander Mata López。正是你们的建议,让本书变得更加完善。
还要感谢Al Krinker,他曾是博思艾伦咨询公司的同事,也是我们在曼宁出版社的首任编辑,在本书创作初期给予了诸多指导,帮助我们顺利开启了写作之旅。
*后,也是*重要的,感谢家人与朋友的支持与鼓励。正是他们的陪伴,让我们得以在无数个夜晚与周末潜心创作,完成了本书的撰写。
前 言
本书是我们倾注了无数时间用于研究、探索、研讨,以及构建和评估大型语言模型,并搭建基于这类模型的问题求解系统后的心血凝结之作;也是我们几位作者多年深耕机器学习、自然语言处理与软件工程领域的经验结晶。我们希望通过本书分享所学知识,将复杂的技术内容转化为通俗易懂的语言,从大语言模型的底层原理讲起,逐步深入探讨那些尚未被广泛理解的前沿话题。在此过程中,我们将澄清一些常见的误解,揭示技术的真实面貌。
需要说明的是,本书并不涉及如何通过代码实现类似ChatGPT的大语言模型。相反,本书聚焦于大语言模型运行的核心原理,以及这项技术的机遇与局限性。我们将帮助读者理解其底层算法的工作机制,进而让读者明白大语言模型为何会采用当前的实现架构,以及如何运用它们解决各类实际问题。我们的目标是将多年来大语言模型的研究成果,转化为一本能让领域新人轻松读懂的入门读物。
全书的内容架构遵循由浅入深的原则:首先从基础知识讲起,帮助读者建立对大语言模型内部运行机制的基本认知;随后逐步过渡到更高级的主题,包括超越大语言模型本身的延伸性议题。在这个过程中,我们将剖析关于大语言模型的常见误解,阐明其技术边界,探讨构建与使用过程中的伦理问题,同时介绍如何将大语言模型作为技术方案,有效解决各类复杂难题。
目标读者
本书的目标读者群体十分广泛,既包括刚接触大语言模型的新手,也涵盖经验丰富的软件开发人员与数据科学家;同时,也面向企业技术负责人、决策者及高管——他们正面临着制定战略,将大语言模型与生成式AI融入业务的挑战。我们撰写本书的初衷是打造一本兼具通俗性与深度的读物,以严谨且不失趣味的方式解读大语言模型。
或许你曾以学生或爱好者的身份修读过机器学习入门课程,但尚未构建起扎实的理论基础;又或许你在工作或生活中使用过OpenAI的ChatGPT、谷歌的Gemini、Anthropic的Claude或微软的Copilot等工具,并对它们的生成原理充满好奇。无论你拥有何种背景与经验,我们相信,本书都有适合你的内容。
读完本书后,你将掌握以下知识。
● 大语言模型如何处理人类语言数据,以及哪些任务使用大语言模型可能会失败。
● 数据在大语言模型中的流转过程,Transformer架构与注意力机制的作用、高层运作原理、重要性,以及它们与其他机器学习算法的关联。
● 大语言模型的训练流程,包括参数、梯度下降、预训练等核心概念,以及模型规模至关重要的原因。
● 如何为企业应用选择合适的大语言模型部署策略。
● 如何识别大语言模型无法实际解决的任务与场景。
● 使用与构建大语言模型的潜在风险与伦理考量,以及这项技术的适用与禁用场景。
本书框架
本书将从大语言模型处理人类语言的基本原理、支撑其运行的核心算法,以及模型从数据中学习的机制讲起。在此基础上,进一步探索大语言模型在文本之外的应用领域,*后深入讨论大语言模型的实际应用及其技术影响。
第1章用通俗易懂的语言,帮助读者建立对大语言模型与生成式AI的宏观认知。该章对比了人类与机器处理语言的不同方式,初步揭示大语言模型强大能力背后的奥秘,同时点明其技术局限性与使用过程中需要警惕的问题。
第2~5章深入剖析大语言模型的底层运行机制,重点讲解技术原理而非数学公式。其中第2章阐述大语言模型如何对文本进行预处理,为后续计算做准备;第3章则进一步揭秘输入大语言模型的内容*终如何转化为生成式输出。第4章探讨这一切得以实现的基础——如何利用海量文本训练大语言模型,以及训练过程中未能达到预期效果的原因。第5章介绍如何针对特定应用场景,对大语言模型及其输出进行控制与约束。
第6章将视野拓展到语言处理之外,探讨大语言模型在软件开发、形式化数学等领域的应用,同时涵盖文本、图像、音频、视频等多模态处理场景。
讲解完技术原理后,第7~9章将聚焦大语言模型在实际应用中需要考量的问题。第7章首先梳理关于大语言模型的常见误解,明确其能力边界与技术局限。第8章讨论基于大语言模型设计解决方案的不同场景,并指出一些看似合理的选择可能并非*优方案。第9章则必不可少地探讨了构建与使用大语言模型的伦理问题——这是任何相关技术讨论都无法回避的话题。大语言模型是否会对人类构成生存性风险?从互联网上大规模抓取数据用于训练,背后存在哪些伦理争议与影响?跟随本书的脉络,你将找到这些问题的答案,同时掌握批判性审视这项颠覆性技术所需的知识。
本书参考了大量文献,包括我们所涉及的大语言模型各领域的深度资料。这些文献可以扫二维码获取,以方便读者集中查阅。我们鼓励你通过这
孔网啦啦啦啦啦纺织女工火锅店第三课
开播时间:09月02日 10:30
即将开播,去预约

直播中,去观看