企业级可扩展图学习
企业级可扩展图学习
Ahmed Menshawy, Sameh Mohamed, Maraim Rizk Masoud
侯荣涛, 侯硕楠, 周利锋 译
出版时间:2026年08月(预计)
页数:351(预计)
“本书是一本关于构建可扩展、适配企业需求的图学习流程的全面且注重实践的指南。本书为你提供了全面知识与工具,助力你将前沿的图技术引入企业环境。”
——Lipi Patnaik
Zeta公司高级软件开发工程师
“在这个无界互联的时代,本书将循序渐进地引导你构建可扩展的图表征学习体系,以揭示潜藏于复杂网络中的结构与深层语义。”
——Emir Munoz博士
Genesys云服务部AI/机器学习高级经理

直面与企业级图表示及学习相关的核心挑战。借助这本实操指南,应用数据科学家、机器学习工程师及实践者将掌握如何构建端到端的图学习流程。你将深入探索流程各阶段的核心挑战,从数据采集与表示,到实时推理及反馈环路驱动的再训练。
基于构建可扩展、生产就绪型图学习流程的实战经验,本书作者将带你在动态演化的图世界中,逐步打造稳健的图学习系统。
● 理解图学习对提升企业级应用的重要性。
● 应对开发和部署适用于企业的图学习及推理流程所面临的挑战。
● 运用传统与先进的图学习技术解决图应用场景问题。
● 使用并贡献于开源图库 PyGraf,在构建图应用时融入最佳实践。
● 利用公开可用且结构化的数据设计和实现图学习算法。
● 将隐私保护技术应用于图学习过程。
  1. 前言
  2. 第1章 图导论
  3. 1.1 大规模企业级图学习与推理的力量
  4. 1.2 概览全书:章节导航
  5. 1.3 图与图学习
  6. 1.3.1 什么是图
  7. 1.3.2 图数据表示
  8. 1.3.3 图学习
  9. 1.3.4 可扩展的图学习:满足关键需求
  10. 1.3.5 可扩展图学习在企业中的优势
  11. 1.4 现实世界企业中的大规模图应用:用例
  12. 1.4.1 谷歌地图的行程时间预测
  13. 1.4.2 药物研发:哈立嗪案例
  14. 1.4.3 欺诈检测
  15. 1.5 图与图学习的演进:从早期起源到现代应用
  16. 1.5.1 时代1:图论与算法的奠基(1736—1970)
  17. 1.5.2 时代2:图算法与技术的进一步发展(1970—1999)
  18. 1.5.3 时代3:图数据库与图查询语言的兴起(2000—2006)
  19. 1.5.4 时代4:图分析与传统机器学习(2007—2011)
  20. 1.5.5 时代5:图神经网络的崛起(2012—2018)
  21. 1.5.6 时代6:可扩展性、鲁棒性与企业级应用(2019年至今)
  22. 1.5.7 企业级图学习系统面临的挑战
  23. 1.5.8 数据协调挑战
  24. 1.5.9 计算密集型工作负载
  25. 1.5.10 动态演化图
  26. 1.5.11 主动监控与漂移检测
  27. 1.5.12 实时推理
  28. 1.6 总结
  29. 第2章 图机器学习处理流程
  30. 2.1 图数据处理流程
  31. 2.1.1 图数据与图数据层级的定义
  32. 2.1.2 图数据的采集与认知
  33. 2.1.3 图数据预处理
  34. 2.2 图训练与推理流程
  35. 2.2.1 GML训练流程概览
  36. 2.2.2 GML推理流程概览
  37. 2.3 总结
  38. 第3章 图的传统机器学习方法
  39. 3.1 图机器学习的研究路径
  40. 3.1.1 传统基于图的机器学习
  41. 3.1.2 非传统的基于图的机器学习
  42. 3.2 传统机器学习的表征图
  43. 3.2.1 图表征
  44. 3.2.2 将亚马逊共购网络表征为图
  45. 3.2.3 畅游亚马逊共购数据集中的图任务
  46. 3.3 图特征工程
  47. 3.3.1 重要性与挑战
  48. 3.3.2 图特征类型
  49. 3.3.3 实战操作:提取亚马逊共购图的特征
  50. 3.4 图特征在机器学习建模中的应用
  51. 3.5 借助预测模型预判高评分产品
  52. 3.6 基于节点嵌入的特征学习
  53. 3.6.1 随机游走算法
  54. 3.6.2 亚马逊共现购买数据集与节点嵌入技术
  55. 3.7 总结
  56. 第4章 PyGraf:端到端的图学习与服务
  57. 4.1 图数据库概览
  58. 4.1.1 开源图库的挑战:PyGraf的机遇
  59. 4.1.2 PyGraf:高效实现图学习与服务的解决方案
  60. 4.2 PyGraf入门
  61. 4.2.1 PyGraf核心特性
  62. 4.2.2 PyGraf宗旨:赋能动态环境
  63. 4.3 架构与核心能力
  64. 4.3.1 核心组件层
  65. 4.3.2 适配与集成层
  66. 4.3.3 最佳实践层
  67. 4.4 对核心库组件的深入探索
  68. 4.4.1 数据组件
  69. 4.4.2 训练组件
  70. 4.4.3 服务组件
  71. 4.4.4 隐私保护组件
  72. 4.5 使用PyGraf的端到端示例:亚马逊共购数据集
  73. 4.5.1 预处理与转换
  74. 4.5.2 模型训练
  75. 4.5.3 评估与模型选择
  76. 4.5.4 部署与监控
  77. 4.6 总结
  78. 第5章 图神经网络
  79. 5.1 图神经网络入门
  80. 5.1.1 图神经网络在图学习中的重要性
  81. 5.1.2 GNN的典型应用场景解析
  82. 5.1.3 图神经网络基础
  83. 5.1.4 图卷积网络
  84. 5.1.5 从传统图学习到GCN的演进
  85. 5.1.6 GCN如何简化特征工程
  86. 5.2 使用PyG和PyGraf接口的端到端实践示例
  87. 5.2.1 PyG:空手道俱乐部示例
  88. 5.2.2 Cora节点分类
  89. 5.2.3 PyGraf API接口
  90. 5.3 基于GCN架构的局限性
  91. 5.4 总结
  92. 第6章 图学习中的高级技术
  93. 6.1 不同类型图
  94. 6.1.1 同质性图
  95. 6.1.2 异质性图
  96. 6.1.3 时序图
  97. 6.2 图嵌入模型
  98. 6.2.1 知识图谱嵌入如何工作
  99. 6.2.2 训练知识图谱嵌入模型
  100. 6.2.3 嵌入交互方法
  101. 6.2.4 训练目标
  102. 6.2.5 图嵌入模型的优势
  103. 6.2.6 示例:在Freebase数据集上进行学习
  104. 6.3 图上的注意力机制
  105. 6.3.1 特征向量
  106. 6.3.2 注意力机制
  107. 6.3.3 多头注意力机制
  108. 6.3.4 示例:引用网络
  109. 6.4 CiteSeer应用案例示例
  110. 6.4.1 数据预处理与可视化
  111. 6.4.2 使用PyG进行模型训练
  112. 6.4.3 模型测试
  113. 6.4.4 嵌入向量可视化
  114. 6.5 总结
  115. 第7章 可扩展的图神经网络
  116. 7.1 扩展图学习模型的挑战
  117. 7.1.1 计算挑战
  118. 7.1.2 内存限制
  119. 7.1.3 数据复杂性与规模问题
  120. 7.2 图神经网络中的小批量训练
  121. 7.2.1 定义与重要性
  122. 7.2.2 高效小批量训练的技术方法
  123. 7.3 高效利用内存的训练技术
  124. 7.3.1 梯度检查点技术
  125. 7.3.2 子图采样方法
  126. 7.3.3 分层相关性传播
  127. 7.4 分布式数据与计算策略
  128. 7.4.1 分布式执行策略
  129. 7.4.2 图划分策略
  130. 7.4.3 分布式图学习工具
  131. 7.5 基于PyG的分布式训练
  132. 7.5.1 准备与划分图数据
  133. 7.5.2 分布式训练的手动执行
  134. 7.5.3 使用PyG进行分布式训练的关键组件
  135. 7.6 用于扩展图神经网络的高级架构
  136. 7.6.1 稀疏性利用
  137. 7.6.2 近似技术
  138. 7.6.3 外部内存的使用
  139. 7.7 总结
  140. 第8章 图的企业级应用
  141. 8.1 客户与市场洞察
  142. 8.1.1 客户分群
  143. 8.1.2 社交网络分析
  144. 8.1.3 推荐引擎
  145. 8.2 运营与供应链管理
  146. 8.2.1 供应链中的网络优化
  147. 8.2.2 库存管理
  148. 8.2.3 风险管理与供应链韧性
  149. 8.2.4 实际应用场景
  150. 8.3 安全与风险管理
  151. 8.3.1 威胁检测与分析
  152. 8.3.2 身份与访问管理(IAM)
  153. 8.3.3 欺诈检测
  154. 8.3.4 网络安全事件响应
  155. 8.3.5 风险管理与合规性
  156. 8.4 医疗健康与生命科学
  157. 8.4.1 患者诊疗路径图与个性化医疗
  158. 8.4.2 药物研发
  159. 8.4.3 临床试验优化
  160. 8.4.4 基因组学与个性化医疗
  161. 8.4.5 广受欢迎的生命科学产品
  162. 8.5 总结
  163. 第9章 隐私保护型图学习
  164. 9.1 图学习中隐私保护的重要性
  165. 9.2 企业案例与应用场景
  166. 9.3 隐私保护技术概述
  167. 9.3.1 图学习中的隐私威胁
  168. 9.3.2 隐私泄露案例研究
  169. 9.4 图数据的隐私保护技术
  170. 9.4.1 图数据匿名化
  171. 9.4.2 图数据中的k-匿名性与t-接近度
  172. 9.4.3 图修改技术
  173. 9.4.4 边差分隐私
  174. 9.4.5 节点差分隐私
  175. 9.4.6 合成图数据生成
  176. 9.5 隐私保护型图计算
  177. 9.5.1 面向图的安全多方计算
  178. 9.5.2 同态加密在图学习中的应用
  179. 9.5.3 差分隐私学习算法
  180. 9.6 联邦图学习
  181. 9.6.1 原理与架构
  182. 9.6.2 联邦图神经网络
  183. 9.6.3 训练与通信协议
  184. 9.6.4 联邦图学习中的隐私增强技术
  185. 9.7 隐私保护型图学习的应用
  186. 9.7.1 社交网络分析中的隐私保护技术
  187. 9.7.2 应用场景
  188. 9.8 案例研究:基于Epinions数据的FedGraphNN推荐系统应用
  189. 9.8.1 数据集
  190. 9.8.2 应用联邦学习的重要性
  191. 9.8.3 数据处理
  192. 9.8.4 联邦训练逻辑
  193. 9.8.5 运行联邦学习流程
  194. 9.9 总结
  195. 第10章 图推理与部署策略
  196. 10.1 部署策略
  197. 10.1.1 金丝雀部署:试水策略
  198. 10.1.2 蓝绿部署:平滑过渡
  199. 10.1.3 阴影部署:静默试运行
  200. 10.1.4 边缘部署:直抵边缘前沿
  201. 10.1.5 A/B测试部署:可控实验
  202. 10.1.6 渐进式发布:逐步扩大规模
  203. 10.1.7 容器化部署
  204. 10.1.8 硬件考量
  205. 10.2 推理运行时环境
  206. 10.2.1 推理框架与库
  207. 10.2.2 预计算与缓存
  208. 10.2.3 在线推理与离线推理
  209. 10.3 模型优化技术
  210. 10.3.1 量化
  211. 10.3.2 剪枝
  212. 10.3.3 知识蒸馏
  213. 10.4 大规模图的推理扩展
  214. 10.4.1 分布式推理系统
  215. 10.4.2 用于可扩展推理的图划分技术
  216. 10.4.3 增量式推理
  217. 10.5 总结
  218. 第11章 监测与反馈循环
  219. 11.1 监控图模型的挑战
  220. 11.1.1 图特定指标
  221. 11.1.2 动态图
  222. 11.1.3 规模与复杂性
  223. 11.1.4 系统与部署问题
  224. 11.2 设计监控框架
  225. 11.2.1 应对不断变化的连接关系(图拓扑结构)
  226. 11.2.2 检查“语义内涵”(评估嵌入向量)
  227. 11.2.3 平衡之道(系统性能与图任务的权衡)
  228. 11.2.4 数据收集机制
  229. 11.2.5 监控已部署的图模型
  230. 11.2.6 告警阈值
  231. 11.2.7 可视化工具
  232. 11.3 图系统中的反馈循环
  233. 11.3.1 用户反馈:从交互中学习
  234. 11.3.2 系统反馈:优化模型性能
  235. 11.3.3 数据反馈:适应不断变化的世界
  236. 11.3.4 反馈循环的协同效应
  237. 11.3.5 闭环系统:自动化适配
  238. 11.3.6 自适应重训练流程
  239. 11.3.7 通知系统
  240. 11.4 总结
  241. 第12章 未来趋势:图学习与大语言模型
  242. 12.1 图增强大语言模型导论
  243. 12.1.1 大语言模型及其变革性影响
  244. 12.1.2 引入外部记忆的必要性:RAG架构解析
  245. 12.1.3 图增强RAG架构的优势
  246. 12.2 基于图结构的检索增强技术
  247. 12.2.1 传统检索增强生成的挑战
  248. 12.2.2 图结构集成
  249. 12.3 GraphRAG方法论与处理流程
  250. 12.3.1 索引构建流程
  251. 12.3.2 查询处理流程
  252. 12.3.3 强化能力与全数据集推理
  253. 12.3.4 实施考量
  254. 12.3.5 基础RAG与GraphRAG对比
  255. 12.4 基于知识图谱的检索增强生成系统在客服问答中的应用
  256. 12.5 总结
  257. 作者介绍
  258. 封面介绍
书名:企业级可扩展图学习
译者:侯荣涛, 侯硕楠, 周利锋 译
国内出版社:中国电力出版社
出版时间:2026年08月(预计)
页数:351(预计)
书号:978-7-5239-1123-5
原版书书名:Scaling Graph Learning for the Enterprise
原版书出版商:O'Reilly Media
Ahmed Menshawy
 
Ahmed Menshawy现任万事达卡公司人工智能工程副总裁。
 
 
Sameh Mohamed
 
Sameh Mohamed现任微软公司高级应用科学家,在机器学习与卫生信息学领域颇具专长。
 
 
Maraim Rizk Masoud
 
Maraim Rizk Masoud担任首席机器学习工程师。
 
 
本书封面动物为一只长尾穿山甲(学名:Phataginus tetradactyla),又称非洲树穿山甲。这是一种罕见且独特的穿山甲物种,主要栖息于中非和西非的茂密热带雨林地区,包括喀麦隆、赤道几内亚和刚果民主共和国等国家。
与其他陆栖近亲不同,长尾穿山甲几乎完全树栖生活,凭借其超乎寻常的长而卷曲的尾巴(通常超过身体长度)灵活抓握树枝,敏捷穿梭于树冠层间。其躯体覆盖着重叠排列的角质鳞片以抵御捕食者,并生有强劲的弧形利爪用于攀爬树木及剥取树皮觅食。相较于其他穿山甲体型较小,体重通常不足5.5磅(约2.5公斤)。
该物种主要以蚂蚁和白蚁为食,通过细长黏性的舌头进行捕食。属独居夜行性动物,但在未受干扰的栖息地也可能表现出昼间活动迹象。雌性经过约140天的妊娠期后诞下单一幼崽。由于其隐秘习性导致野外观测数据有限,目前对其自然寿命尚无确切记录,但圈养条件下穿山甲普遍可存活长达20年。根据世界自然保护联盟(IUCN)红色名录,长尾穿山甲现被列为易危物种,主要威胁来自森林砍伐及针对野味贸易和传统医药用途的非法捕猎。尽管相关保护措施正在推进,但该物种仍因行踪诡秘且研究匮乏而面临严峻生存挑战,亟须针对性保护行动。
O’Reilly书籍封面所使用的多数动物均为濒危物种;它们对所有生态系统均具有重要价值。
购买选项
定价:128.00元(预计)
书号:978-7-5239-1123-5
出版社:中国电力出版社