内容简介
在驾驶过程中,我们会无意识地对视觉系统传递的信息进行处理和分析,从而做出相应的反应。理解视觉系统所传递的信息是人类大脑最基本的功能之一,但这对计算机来说却是十分困难的。视觉智能是处理这类问题的一个前沿领域。本书通过15章内容介绍视觉智能的前沿技术:第1部分包括第1~3章,对视觉智能、机器生命观和视觉智能数学基础进行说明与论述;第2部分包括第4~7章,论述经典的视觉智能相关技术;第3部分包括第8~15章,论述进阶知识,包括视觉智能方法在各个领域的应用。为方便读者阅读,本书对相关数学知识进行了缩减。本书适合相关专业本科生和研究生掌握视觉智能领域前沿知识,也适用于对人工智能视觉认知和理解感兴趣的人士阅读参考。
目录
前 言
第1 章 视觉智能前沿/ 001
1. 1 计算机视觉发展阶段/ 002
1. 1. 1 马尔计算视觉/ 002
1. 1. 2 昙花一现的主动和目的视觉/ 004
1. 1. 3 多视几何和分层三维重建/ 005
1. 1. 4 基于学习的视觉/ 007
1. 2 下一代人工智能架构/ 008
1. 2. 1 什么是智能/ 009
1. 2. 2 为什么火爆的深度学习并不是真正的AI / 010
1. 2. 3 什么是脑科学人工智能/ 010
1. 2. 4 脑科学向AI 转化的挑战/ 011
1. 2. 5 脑科学视觉识别系统的优势/ 012
1. 3 视觉智能多场景发展/ 013
1. 3. 1 生物计量领域的应用/ 013
1. 3. 2 在人工智能物联网领域的应用/ 015
1. 3. 3 在汽车领域的应用/ 016
1. 4 如何进行视觉智能的研究/ 017
1. 5 视觉智能团队历年研究历程/ 018
1. 5. 1 场景理解科研团队/ 018
1. 5. 2 图像处理团队/ 019
1. 5. 3 旋风智能车团队/ 020
1. 5. 4 无障碍服务团队/ 021
1. 6 视觉智能发展趋势/ 021
1. 6. 1 从二维成像升级到三维视觉/ 021
1. 6. 2 3 D 视觉应用领域更加多样化/ 022
1. 6. 3 3 D 视觉感知技术要求不断提升/ 022
第2 章 机器的生命观/ 025
2. 1 机器智能的内涵与讨论/ 026
2. 1. 1 视觉智能领域的关键科学问题/ 026
2. 1. 2 机器智能的内涵/ 028
2. 1. 3 机器视觉与人工视觉的对比/ 030
2. 2 机器生命观的起源与发展/ 031
2. 2. 1 机器生命观的研究起源/ 031
2. 2. 2 机器生命的概念与分类/ 031
2. 2. 3 机器生命与人工智能的关系/ 032
2. 2. 4 机器视角下的生命观/ 033
2. 3 多模态认知计算/ 035
2. 3. 1 机器认知能力在于信息利用率/ 036
2. 3. 2 多模态认知计算的主线/ 036
2. 3. 3 机遇与挑战/ 037
2. 4 我国公共服务机器人简介/ 038
2. 4. 1 公共服务机器人概述/ 038
2. 4. 2 公共服务机器人的发展/ 039
第3 章 视觉智能中的数学/ 041
3. 1 矩阵基础/ 042
3. 1. 1 矩阵的定义与概念/ 042
3. 1. 2 几种特殊的矩阵/ 042
3. 1. 3 矩阵的运算/ 044
3. 1. 4 矩阵的微分/ 045
3. 2 向量基础/ 048
3. 2. 1 向量的定义与概念/ 049
3. 2. 2 向量的基本运算与公式性质/ 049
3. 2. 3 范数/ 050
3. 2. 4 向量的相似性度量/ 050
3. 2. 5 随机向量及其分布/ 051
3. 3 概率论基础/ 054
3. 3. 1 随机事件和概率/ 054
3. 3. 2 随机变量及其概率分布/ 056
3. 3. 3 随机变量的数字特征/ 057
3. 3. 4 大数定律和中心限定理/ 059
3. 4 视觉智能数学补充说明/ 060
3. 4. 1 数理统计的基本概念/ 060
3. 4. 2 参数估计/ 064
3. 4. 3 李群与李代数/ 065
第4 章 视觉智能认知的基本任务
和方法/ 067
4. 1 图像分类/ 068
4. 1. 1 图像分类常用数据集/ 069
4. 1. 2 图像分类经典网络结构/ 070
4. 2 目标检测/ 074
4. 2. 1 目标检测常用数据集/ 075
4. 2. 2 目标定位和检测的基本方法/ 076
4. 3 图像分割/ 080
4. 3. 1 图像分割常用数据集/ 081
4. 3. 2 语义分割的方法与思路/ 081
4. 4 图像生成/ 083
4. 4. 1 生成对抗网络/ 083
4. 4. 2 扩散模型/ 085
第5 章 视觉智能中的深度学习/ 087
5. 1 机器视觉发展现状/ 088
5. 2 深度学习发展趋势/ 089
5. 3 深度学习常用基准数据集/ 093
5. 4 卷积神经网络技术基础/ 093
5. 4. 1 卷积运算/ 094
5. 4. 2 池化运算/ 096
5. 4. 3 BN 层与全连接层/ 097
5. 4. 4 激活函数/ 098
5. 4. 5 模型参数选择/ 102
5. 5 国内外知名刊物/ 103
第6 章 视觉智能中的行为认知/ 107
6. 1 从视觉感知智能到视觉
认知智能/ 108
6. 2 从认知智能到行为智能/ 109
6. 2. 1 基于行业知识图谱的深度应用/ 109
6. 2. 2 基于知识图谱的隐性关系
挖掘和推理/ 111
6. 2. 3 行业趋势/ 112
6. 2. 4 认知智能的落地条件及挑战/ 113
6. 3 强化学习与决策/ 116
6. 3. 1 强化学习/ 117
6. 3. 2 强化学习的环境/ 119
6. 3. 3 强化学习中的数据/ 119
6. 3. 4 深度强化学习/ 120
6. 3. 5 深度强化学习在自然语言处理中
的应用/ 121
6. 4 行为认知数据集/ 123
6. 4. 1 驾驶行为认知数据集/ 123
6. 4. 2 行为仿真数据集/ 125
第7 章 视觉智能与元宇宙/ 127
7. 1 元宇宙的发展/ 128
7. 1. 1 元宇宙的定义/ 128
7. 1. 2 元宇宙的特征/ 130
7. 1. 3 元宇宙所需要的技术支撑/ 131
7. 2 元宇宙中的视觉智能/ 134
7. 2. 1 元宇宙下的视觉设计/ 134
7. 2. 2 VR/AR 技术成为通往元宇宙
的关键接口/ 136
7. 2. 3 未来视觉技术寓于元宇宙/ 137
7. 2. 4 RGBD 智能立体视觉系统/ 141
7. 3 元宇宙与光电显示技术/ 142
7. 4 元宇宙在视觉领域的发展趋势
和展望/ 143
7. 4. 1 发展现状/ 144
7. 4. 2 面临的问题/ 145
7. 4. 3 未来展望/ 146
第8 章 三维场景中的视觉智能/ 149
8. 1 三维场景深度图像获取技术/ 150
8. 1. 1 基于双目相机的立体匹配方法/ 151
8. 1. 2 基于单目相机的深度估计方法/ 153
8. 2 三维场景视觉定位与制图技术/ 154
8. 2. 1 视觉SLAM 技术框架/ 155
8. 2. 2 视觉SLAM 技术方法/ 156
8. 2. 3 视觉SLAM 前沿技术/ 158
8. 2. 4 三维视觉数据集/ 162
8. 3 三维视觉建模方法/ 162
8. 3. 1 传统三维建模方法/ 163
8. 3. 2 基于深度学习的三维建模方法/ 164
8. 4 三维视觉发展趋势与展望/ 165
第9 章 自动驾驶视觉智能认知/ 167
9. 1 自动驾驶国内外发展政策/ 168
9. 1. 1 国外政策/ 168
9. 1. 2 国内政策/ 171
9. 2 场景分割/ 172
9. 2. 1 场景分割定义/ 172
9. 2. 2 场景语义分割/ 173
9. 3 自动驾驶中的静态目标检测/ 175
9. 3. 1 信号灯识别/ 175
9. 3. 2 车道线检测/ 176
9. 3. 3 道路交通标志牌识别/ 177
9. 3. 4 路面交通标志识别/ 179
9. 3. 5 道路障碍物检测/ 179
9. 4 自动驾驶中的动态目标检测/ 181
9. 4. 1 基于单传感器的目标检测方法/ 181
9. 4. 2 基于多传感器融合的目标检测方法/ 182
9. 5 场景理解/ 183
9. 5. 1 场景元素/ 183
9. 5. 2 空间和拓扑关系/ 184
9. 5. 3 事件的时间顺序/ 186
9. 5. 4 Ridecell 场景语言(RSL) / 187
9. 5. 5 场景覆盖范围/ 188
9. 6 自动驾驶软硬件平台/ 188
9. 6. 1 硬件构成/ 188
9. 6. 2 软件算法构成/ 191
9. 6. 3 自动驾驶视觉数据集/ 194
9. 7 应用场景/ 221
9. 7. 1 私家车出行场景/ 221
9. 7. 2 自动泊车场景/ 222
9. 7. 3 网约车/公共出行场景/ 222
9. 7. 4 无人驾驶环卫车/ 223
9. 8 自动驾驶的瓶颈技术/ 224
9. 9 自动驾驶发展趋势/ 226
第10 章 智能座舱关键技术与应用/ 227
10. 1 智能座舱与自动驾驶的
关系(舱驾融合) / 228
10. 2 智能座舱系统的技术架构/ 230
10. 3 智能座舱内的视觉技术/ 234
10. 3. 1 智能座舱内语音交互/ 234
10. 3. 2 智能座舱内手势交互/ 237
10. 3. 3 智能座舱视觉监控与交互/ 238
10. 3. 4 智能座舱内AR-HUD 显示/ 243
10. 4 智能座舱的发展与展望/ 243
第11 章 视觉智能在信息无障碍
领域的应用/ 245
11. 1 信息无障碍视觉智能
技术发展现状/ 246
11. 1. 1 手语领域/ 246
11. 1. 2 盲文领域/ 248
11. 2 信息无障碍视觉智能技术
发展瓶颈/ 249
11. 2. 1 书写系统理论/ 249
11. 2. 2 手语输入系统/ 250
11. 2. 3 文字信息提取/ 252
11. 3 落地前沿案例/ 254
11. 3. 1 视觉问答/ 254
11. 3. 2 实例分割/ 254
11. 3. 3 无障碍技术/ 255
11. 3. 4 华为无障碍技术成果/ 256
11. 4 展望/ 257
11. 4. 1 书写系统理论的完善/ 257
11. 4. 2 输入系统的实现/ 258
第12 章 面向教育服务的视觉
智能/ 259
12. 1 视觉智能技术在教育领域的
发展现状/ 260
12. 1. 1 传统教育方式面临的局限与瓶颈/ 260
12. 1. 2 视觉智能技术与传统教育方式
的交融/ 261
12. 2 视觉智能技术在教育领域的
具体应用/ 270
12. 2. 1 智能教育与人机协同/ 270
12. 2. 2 智能视觉与远程教育/ 276
12. 2. 3 智能视觉与数字孪生/ 278
第13 章 面向救援场景的视觉
智能/ 283
13. 1 救援机器人的分类/ 284
13. 1. 1 水上救援机器人/ 284
13. 1. 2 消防救援机器人/ 285
13. 1. 3 矿区救援机器人/ 285
13. 2 机器视觉应用场景/ 287
13. 2. 1 洪涝灾害中的机器视觉/ 287
13. 2. 2 火灾探测中的机器视觉/ 287
13. 2. 3 矿区环境中的机器视觉/ 288
13. 3 机器视觉在矿区中的应用/ 288
13. 3. 1 矿区救援环境/ 288
13. 3. 2 矿区无人驾驶/ 288
13. 3. 3 矿区三维重建/ 288
13. 4 矿区救援环境中的地图构建/ 291
13. 4. 1 相机与图像/ 291
13. 4. 2 图像去畸变/ 292
13. 4. 3 矿区建图流程/ 293
13. 4. 4 矿区建图优化/ 294
第14 章 视觉智能中的数据安全/ 295
14. 1 图像视觉数据安全技术/ 297
14. 1. 1 对称与非对称加密算法/ 297
14. 1. 2 基于矩阵变换和像素置换的图像加密技术/ 298
14. 1. 3 混沌图像加密技术/ 300
14. 2 数据生命周期各阶段常见方法/ 302
14. 2. 1 采集阶段/ 303
14. 2. 2 传输阶段/ 303
14. 2. 3 存储阶段/ 303
14. 2. 4 处理阶段/ 304
14. 2. 5 共享、交换阶段/ 304
14. 2. 6 销毁阶段/ 304
14. 3 新形势下的数据安全分析/ 304
14. 3. 1 数据作为生产要素的新风险/ 306
14. 3. 2 新形势下数据安全的核心场景/ 306
14. 3. 3 新形势下数据安全新的技术方向/ 307
第15 章 隐私计算与视觉智能/ 309
15. 1 隐私计算/ 310
15. 1. 1 隐私计算技术概述/ 310
15. 1. 2 隐私计算核心技术/ 310
15. 1. 3 隐私计算技术解决的主要问题/ 314
15. 2 隐私计算在视觉领域的应用/ 315
参考文献/ 316
前言/序言
当今社会,视觉智能相关技术已经成为人工智能领域的重要分支之一,广泛应用于图像识别、目标检测、人脸识别、自动驾驶等众多领域。同时,随着深度学习和神经网络技术的不断发展和完善,视觉智能相关技术也在不断发展。基于此,我们希望通过本书,向读者介绍视觉智能的基础知识、最新进展及应用场景,帮助读者更好地理解和应用视觉智能技术,同时为人工智能的发展和应用贡献力量。
本书主要有以下几个特点。
1)全面系统的介绍。本书从视觉智能相关技术的基础知识入手,结合具体的应用场景,尽可能全面系统地介绍了视觉智能的各个应用领域,包括机器的生命观、图像处理、元宇宙、智能座舱、定位与地图构建、自动驾驶等。
2)具有实用性的案例分析,突出应用价值。本书不仅介绍了视觉智能相关技术的基础理论和最新进展,还强调了视觉智能相关技术在各种应用场景中的实用价值和应用前景,在各个章节中都提供了具有实用性的案例分析,通过实际案例的讲解,帮助读者更好地理解和应用所学知识。
3)强调伦理和社会责任。本书在介绍视觉智能相关技术的同时,也强调了伦理和社会责任,提醒读者在应用技术时要注意遵守伦理和社会责任,促进视觉智能相关技术的健康发展和应用。
本书共分为3个部分15章,涵盖了视觉智能的前沿技术和应用。第1部分共3章,介绍了视觉智能前沿、机器的生命观和视觉智能中的数学。第1章介绍了视觉智能的概念和应用,探讨了视觉智能相关技术的重要性和应用领域。第2章介绍了机器生命观的概念和发展历程,探讨了视觉智能相关技术与生命科学的关系。第3章介绍了视觉智能中的数学基础,包括线性代数、概率论和统计学等基础知识。第2部分是视觉智能的基本任务和方法,共4章。第4章介绍了视觉智能认知的基本任务和方法,包括目标检测、目标跟踪、图像分割和场景理解等基本任务和方法。第5章介绍了视觉智能中的深度学习,主要介绍其基本原理和应用,包括卷积神经网络、循环神经网络和自编码器等深度学习技术。第6章介绍了视觉智能中的行为认知,包括动作识别、行为分析和运动估计等方法。第7章介绍了视觉智能与元宇宙,探讨了视觉智能相关技术与虚拟现实、增强现实等新兴技术的结合。第3部分是视觉智能的应用,共8章。第8章介绍了三维场景中的视觉智能,包括三维重建、三维识别和三维跟踪等技术。第9章介绍了自动驾驶视觉智能认知,包括自动驾驶车辆的视觉传感器、目标检测和跟踪等技术。第10章介绍了智能座舱关键技术与应用,包括驾驶员监测、驾驶辅助和智能安全系统等。第11章介绍了视觉智能在信息无障碍领域的应用,探讨了视觉障碍人士的需求和视觉智能技术赋能信息无障碍领域。第12章介绍了面向教育服务的视觉智能,包括教学辅助、学习分析和教育评估等技术。第13章介绍了面向救援场景的视觉智能,包括灾害响应、紧急救援和火灾检测等场景。第14章介绍了视觉智能中的数据安全,包括隐私保护、数据加密和数据共享等技术。第15章介绍了隐私计算与视觉智能,探讨了如何在视觉智能应用中保护个人隐私的问题。
感谢北京工业大学马楠,应急管理部大数据中心王棚飞,北京联合大学徐歆恺、张铖、周华、张子迎、姚登峰给予的技术指导与宝贵帮助。
在本书的编写过程中,史鑫昊、李鑫、李鸿天、郭宇昕、严永嘉、孙吉武、刘鸿飞、于康鸿、杨子豪、任天宇、王壮、谭雅维、邹宇翔、陈小康参与了资料收集和整理,在此表示感谢。
感谢北京联合大学教材资助项目,感谢国家语委项目(ZDI145-110)、教育部项目(25YJC740057)、 北京市自然科学基金项目(4262045)提供内容支持。
本书配套资源包含:源代码、思维导图、PPT、理论解读视频、讨论区、拓展文献、专业释义、补充附录及前沿拓展资料等。配套资源可通过链接(https://www.xuetangx.com/course/buu0809zjr) (https://www.icourse163.org/course/
0809BUU041-1206459826)获取。
由于作者水平有限,书中难免存在不足之处,欢迎各位读者批评指正。




















