成功加入购物车

去购物车结算 X
经管法律专营店
  • 多模态智能信息处理
图文详情

多模态智能信息处理

举报

正版全新

  • 装帧:    其他
  • 开本:    16开
  • 纸张:    胶版纸
  • 出版时间: 
  • 装帧:  其他
  • 开本:  16开
  • 纸张:  胶版纸

售价 48.51 7.0折

定价 ¥69.00 

品相 全新

优惠 满减券
    发货
    承诺48小时内发货
    运费
    本店暂时无法向该地区发货

    延迟发货说明

    时间:
    说明:

    上书时间2026-08-27

    数量
    库存11
    微信扫描下方二维码
    微信扫描打开成功后,点击右上角”...“进行转发

    卖家超过10天未登录

    六年老店
    店铺等级
    资质认证
    90天平均
    成功完成
    78.05% (90笔)
    好评率
    100%
    发货时间
    18.12小时
    地址
    天津市南开区
    • 商品详情
    • 店铺评价
    立即购买 加入购物车 收藏
    手机购买
    微信扫码访问
    • 商品分类:
      计算机与互联网
      货号:
      5058191
      商品描述:
      【书    名】 多模态智能信息处理
      【书    号】 9787302712510
      【出 版 社】 清华大学出版社
      【作    者】 邓成、杨二昆、杨旭、闫杰熹、魏坤
      【出版日期】 2026-08-01
      【开    本】 16开
      【定    价】 69.00元

      【编辑推荐】 
      《多模态智能信息处理》系统梳理了多模态智能信息处理从底层特征提取到高层语义理解的完整技术路线,既重点讲解基于深度学习的前沿研究,覆盖视觉问答、时域语言定位等新兴方向,也完整保留经典传统非深度方法,搭建起从传统经典技术到当下先进技术的过渡桥梁。全书内容丰富、结构清晰,理论讲解由浅入深,兼顾易读性、知识全面性与技术先进性,是相关领域研究人员、技术工程师、高年级本研学生及行业决策者的优质参考读物。

      【内容简介】 
      《多模态智能信息处理》系统地介绍了多模态智能信息处理从底层特征提取到高层语义理解的完整技术路线,重点关注基于深度学习技术的多模态智能信息研究,包含了*新出现的视觉问答及时域语言定位等多模态信息理解新方向,同时介绍了经典的传统非深度方法,力图搭建从传统经典技术到现有先进技术的过渡桥梁,进而加深对传统技术的理解,并促进对当前技术的进一步思考。
        《多模态智能信息处理》内容丰富,结构清晰,理论由浅入深,具有内容的易读性、知识的全面性以及技术的先进性等特点。适合作为相关领域学术研究人员、技术工程师与开发者、高年级本科生与研究生、行业决策者与管理者的有益参考。

      【目录】 
      CONTENTS

      目录

      第 1章绪论 1 

      1.1概述 1 

      1.2理论基础 1 

      1.2.1卷积神经网络 1 

      1.2.2池化 4 

      1.2.3注意力机制 5 

      1.2.4 Transformer网络 8 

      1.3技术难点与挑战 9 

      1.3.1输入处理 10 

      1.3.2信息融合 11 

      1.3.3其他问题与挑战 11 

      1.4典型应用 12 

      1.4.1图像描述 12 

      1.4.2文图生成 13 

      1.4.3视觉问答 17 

      1.4.4视觉推理 19 

      1.5伦理与社会影响 21 

      1.5.1隐私与数据安全挑战 21 

      1.5.2社会公平与道德考量 22 

      1.5.3社会影响与接受度 23

      第 2章多模态表示学习 24 

      2.1理论基础 24 

      2.1.1关于表示学习 24 

      2.1.2多模态表示学习 26 

      2.1.3不同模态的表示映射 27 

      2.2基本框架 28 

      2.2.1联合表示框架 28 

      多模态智能信息处理 

      2.2.2协同表示框架 30 

      2.2.3编码器-解码器框架 34 

      2.3经典模型 36 

      2.3.1概率图模型 36 

      2.3.2多模态自动编码器 37 

      2.3.3典型相关分析 39 

      2.4多模态大规模预训练 41 

      2.4.1 CLIP的横空出世 41 

      2.4.2基于 CLIP的改进方法 43 

      2.4.3其他多模态预训练方法 45 

      2.5多模态大语言模型 48 

      2.5.1模型简介 48 

      2.5.2模型架构 50 

      2.5.3训练流程 53 

      2.5.4新技术的涌现 53

      第 3章多模态信息融合 56 

      3.1基于规则的融合 56 

      3.1.1线性加权融合 57 

      3.1.2多数投票融合 58 

      3.2基于滤波的融合 59 

      3.2.1卡尔曼滤波 59 

      3.2.2粒子滤波 61 

      3.3基于分类的融合 62 

      3.3.1支持向量机 62 

      3.3.2 Dempster–Shafer理论 64 

      3.3.3贝叶斯推断 66 

      3.3.4动态贝叶斯网络 67 

      3.3.5*大熵模型 68 

      3.4深度融合 69 

      3.4.1深度置信网络 69 

      3.4.2递归神经网络 70 

      3.4.3编码器-解码器网络 72 

      目录 

      3.4.4 Transformer网络 74 

      3.4.5图神经网络 76

      第 4章多模态信息检索 80 

      4.1基于树的*近邻检索 80 

      4.1.1 K维树 80 

      4.1.2 Ball-树 81 

      4.1.3 K-means层次树 82 

      4.1.4 Annoy检索算法 82 

      4.2基于图的*近邻检索 83 

      4.2.1 K-Graph 83 

      4.2.2 NSW图 84 

      4.2.3 HNSW图 84 

      4.3基于量化的近似*近邻检索 86 

      4.3.1乘积量化 86 

      4.3.2加性量化 89 

      4.3.3复合量化 90 

      4.4基于哈希的近似*近邻检索 92 

      4.4.1基于传统模型的哈希学习框架 93 

      4.4.2基于类别特定中心的双流哈希 94 

      4.4.3基于成对约束的跨模态哈希 98 

      4.4.4基于语义结构的无监督哈希 100 

      4.4.5基于渐近演化的深度哈希 104 

      4.4.6汉明空间检索中的对抗样本 108

      第 5章多模态内容理解 113 

      5.1图像描述任务 114 

      5.1.1序列生成网络 115 

      5.1.2序列化描述生成 117 

      5.1.3基于注意力的生成 119 

      5.2视觉问题 124 

      5.2.1基于多模态融合的问答 126 

      5.2.2基于注意力机制的问答 129 

      5.2.3基于组合推理的问答 134 

      多模态智能信息处理 

      5.3场景图生成 138 

      5.3.1融合上下文信息的生成 140 

      5.3.2融入先验知识的生成 146 

      5.4基于多模态预训练模型的内容理解 151 

      5.4.1图像-文本预训练模型 152 

      5.4.2视频-文本预训练模型 152 

      5.5未来发展方向 153

      第 6章多模态内容生成 154 

      6.1图像内容生成 155 

      6.1.1基础理论 155 

      6.1.2文图生成 162 

      6.1.3基于手绘草图的图像内容生成 165 

      6.1.4图像风格迁移 169 

      6.2文本内容生成 172 

      6.2.1文本内容生成的理论基础 172 

      6.2.2图像描述生成 177 

      6.2.3视频摘要生成 178 

      6.3视频内容生成 179 

      6.3.1无条件视频生成 180 

      6.3.2文本到视频生成 182 

      6.3.3视频到视频生成 184 

      6.3.4其他条件到视频生成 184

      第 7章多模态脑机智能与应用 187 

      7.1脑机接口技术的背景和现状 187 

      7.1.1技术背景 188 

      7.1.2发展现状 190 

      7.2脑信号采集与表示 194 

      7.2.1非侵入式脑信号采集与表示 194 

      7.2.2侵入式脑信号采集与表示 196 

      7.3多模态脑机智能的应用 200 

      7.3.1医学领域的应用 200 

      7.3.2非医学领域的应用 203 

      目录 

      7.4基于脑信号的视觉内容重建 209 

      7.4.1人脑的 fMRI数据 210 

      7.4.2自然场景数据集(NSD) 211 

      7.4.3基于预训练大模型的重建方法 211 

      7.4.4基于条件扩散模型的重建方法 213

      第 8章发展趋势分析 215

      参考文献 219

      【前言】 
      PREFACE

      前言

      人工智能( AI)正以前所未有的广度和深度深刻改变着人类社会生活,改变着世界。近年来,随着算法、数据和算力的协同发展,人工智能进入了快速突破与广泛应用并进的新阶段。2014年生成对抗网络的提出,标志着 AI生成内容( AIGC)时代的开启; 2017年诞生的 Transformer架构,已经成为大语言模型( LLM)的基础框架; 2023年被视为大语言模型元年,全球范围密集发布了上百个大模型,国内更是掀起“百模大战”。伴随技术突破,大语言模型从单模态向多模态甚至全模态持续扩展,推动人工智能从“理解单一信息”向“认知物理世界”的关键跨越。这一进程,已经成为通向通用人工智能( AGI)的必由之路。从概念的发展逻辑来看,多模态已不再局限于文本、音频、图像、视频等传统形态,逐步拓展至草图、激光雷达、脑电波等特定数据形式;从技术的底层逻辑来看,多模态智能信息处理的理论、方法和技术在现代人工智能的发展进程中始终发挥着重要作用——这也正是本书以“多模态智能信息处理”为题目的初衷。

      本书章节的组织遵循两条脉络——模态扩展和技术演进。全书共分为 8章。第 1章绪论,主要介绍多模态智能信息处理的基本概念、理论基础、技术难点、典型应用,以及伦理与社会影响,为后续内容奠定整体认知框架。第 2章围绕多模态表示学习,系统介绍多模态表示的基本思想、典型框架、经典模型,以及多模态大规模预训练和多模态大语言模型的相关内容。第 3章聚焦多模态信息融合,介绍基于传统的和深度学习的融合方法,帮助读者理解不同模态之间的信息协同机制。第 4章探讨多模态信息检索,重点介绍近似*近邻检索及跨模态哈希等关键技术。第 5章围绕多模态内容理解,包括图像描述生成、视觉问答、场景图生成,以及基于多模态预训练模型的内容理解方法。第 6章介绍多模态内容生成,涵盖图像生成、文本生成和视频生成等新兴任务。第 7章面向交叉前沿领域,介绍多模态脑机智能与应用,重点讨论脑信号采集与表示、脑机接口应用以及基于脑信号的视觉内容重建。第 8章对多模态智能信息处理的发展趋势进行分析与展望,以期为读者后续学习和研究提供启发。

      本书由邓成教授策划、组织和统稿,杨二昆副教授、杨旭副教授、闫杰熹副教授、魏坤副教授和武阿明副教授等参与了相关章节的研究与撰写工作。各位作者长期从事人工智能、多模态信息处理及相关交叉领域研究,在理论探索、方法创新和应

      多模态智能信息处理

      用实践方面积累了丰富的经验。本书的问世凝聚了 OPTIC实验室师生的共同努力,也得益于科学研究的长期积累,恕不一一具名,但感念在心。

      本书兼顾统一性和综合性,尝试以系统的思维和浅显的文字帮助读者理解多模态智能信息处理领域的知识演进与技术发展的内在逻辑。本书适合作为人工智能、计算机科学与技术、数据科学等相关专业本科生和研究生的教材或参考书,也可供从事人工智能研究、技术开发与行业应用的科研人员和工程技术人员阅读参考。

      书稿虽成,力有不逮,疏漏差错,恐在所难免。欢迎广大读者将您的建议发送至: multimodal.xd@xidian.edu.cn,我们会闻过而喜,以期内容日新又新。

      配送说明

      ...

      相似商品

      为你推荐

    孔网啦啦啦啦啦纺织女工火锅店第三课

    开播时间:09月02日 10:30

    即将开播,去预约
    直播中,去观看