第05章 信息媒体的表示及数字化
北京大学苏清元《信息技术导论》课程第5章 原文:PowerPoint 97-2003 二进制格式,LibreOffice 转 PDF 后 pdftotext 全文提取 章节数:5大节(5.1~5.5),约 491 行文本
一、计算机系统的信息表示与编码
1.1 模拟与数字
- 模拟数据 (Analog Data):随时间连续变化的值
- 数字数据 (Digital Data):模拟数据经量化后得到的离散值
- A/D 转换(模数转换):连续模拟信号 → 离散数字信号,电路称为 ADC
- D/A 转换(数模转换):离散数字信号 → 连续模拟信号,电路称为 DAC
模拟技术 vs 数字技术(水桶比喻):
- 数字系统:用空桶=0、有水桶=1,一个桶表示一位二进制位,采用浮点记数法
- 模拟系统:用一个桶的水位高度表示一个值
- 数字技术优势:抗干扰能力强、易于存储传输处理、可靠性高、便于集成
1.2 计算机为什么采用二进制
- 容易表示:只有 0 和 1 两种状态,电子器件容易实现(如高低电平、开关通断)
- 运算简单:二进制运算规则比十进制简单得多(加法 3 条、乘法 3 条)
1.3 数在计算机内的表示
- 位 (bit):最小信息单位,一个二进制位
- 字节 (Byte):8 位二进制,基本存储单位
- 字长:计算机一次能处理的二进制数据的位数
- 涉及问题:数的长度、符号表示(原码/反码/补码)、小数点表示(定点/浮点)
1.4 信息编码
ASCII 码
- 美国标准信息交换码 (American Standard Code for Information Interchange)
- ISO 646 国际标准,适用于拉丁文字母
- 7 位码(128 个字符)和 8 位码两种形式
- 计算机存储中占 1 字节 (8 位),最高位 (b7) 用作奇偶校验位
中文信息编码标准
| 标准 | 发布年份 | 收录字符数 | 编码方式 | 特点 |
|---|---|---|---|---|
| GB2312-1980 | 1980 | 7445 个(汉字 6763 个) | 双字节,每字节 7 位 | 基本集,简化汉字为主 |
| GBK-1995 | 1995 | 21886 个汉字和图形符号 | 双字节 | 向下兼容 GB2312,向上支持 ISO 10646 |
| GB18030-2000 | 2000 | 27484 个汉字 | 一/二/四字节变长 | 最新国标,与 Unicode 一一对应,类似 UTF-8 |
Unicode
- 对国际标准 ISO/IEC 10646 编码的称谓,亦称大字符集
- ISO 于 1993 年颁布,宗旨是全球所有文种统一编码
- 目标:实现”书同文、字同码”,解决多语种编码混乱问题
1.5 数制转换与逻辑运算
- 数制:二进制 (B)、八进制 (O)、十进制 (D)、十六进制 (H)
- 转换关系:(01001101)B = (115)O = (4D)H = 77(D)
- 基本逻辑运算:逻辑或 (OR)、逻辑与 (AND)、逻辑非 (NOT)、异或 (XOR)
二、媒体与多媒体信息
2.1 CCITT 媒体五大分类
按国际电信联盟 (ITU) 下属 CCITT 的定义,媒体分为五类:
| 类型 | 英文 | 定义 | 举例 |
|---|---|---|---|
| 感觉媒体 | Perception | 直接作用于人的感官,使人直接产生感觉 | 声音、图像、文字、气味、质地、温度 |
| 表示媒体 | Presentation | 为加工处理传输感觉媒体而人为构造的媒体 | 语音编码、图像编码、文本编码 |
| 显示媒体 | Display | 感觉媒体与电信号之间转换用的媒体 | 输入:键盘、摄像机、话筒、扫描仪;输出:显示器、打印机 |
| 存储媒体 | Storage | 存放数字化表示媒体的存储介质 | 磁盘、光盘、半导体存储器 |
| 传输媒体 | Transmission | 将表示媒体从一处传到另一处的物理介质 | 同轴电缆、双绞线、光纤、通信信道 |
2.2 多媒体的含义
- 广义:多种信息媒体的表现和传播形式
- 狭义:用计算机及其他设备交互处理多媒体信息的方法和手段
- 媒体表现形式:数值、文字、声音、图像、视频
- 硬件设备:声卡、视频卡、DSP 芯片
- 存储实体:光盘、磁带、半导体存储器
多媒体技术:以计算机为中心,把语音、图像处理技术和视频技术等集成在一起的综合技术,包括数字化信息处理、音视频技术、软硬件技术、AI 与模式识别、通信与网络技术等。
三、音频媒体的表示与数字化
3.1 音频信号的物理特征
- 声波:规则音频是连续变化的模拟信号,在时间和幅度上都连续
- 频率:每秒钟波峰数目,单位 Hz/kHz,体现音调高低
- 亚音 (subsonic):< 20 Hz
- 音频 (Audio):20 Hz ~ 20 kHz(人耳可听范围)
- 超音频 (ultrasonic):> 20 kHz
- 日常语音:300 Hz ~ 3000 Hz
- 周期:两个相邻波峰/谷底的时间间隔,与频率互为倒数
- 幅度:从基线到波峰的距离,决定声音强弱
- 强度:用分贝 (dB) 表示
3.2 音频数字化三步骤
- 采样 (Sampling):按一定时间间隔抽取模拟信号的幅度值
- 采样频率:每秒钟采样次数
- 奈奎斯特定理:采样频率 ≥ 信号最高频率的 2 倍,才能无失真恢复
- 量化 (Quantization):将采样的连续幅度值转换为有限个离散值
- 量化位数:每个采样点用多少位二进制表示(如 8 位/16 位)
- 量化位数越多,音质越好,数据量越大
- 编码 (Encoding):将量化后的数值按一定格式编码存储
数据量计算公式:数据量 = 采样频率 × 量化位数 × 声道数 / 8(字节/秒)
3.3 常见音频格式对比
| 格式 | 特点 | 压缩方式 | 典型参数 |
|---|---|---|---|
| WAV | Windows 标准波形文件,无损 | 不压缩 | 采样位数 + 采样频率 + 声道数三参数 |
| MP3 | MPEG Audio Layer 3,最流行 | 有损压缩 | 压缩比 1:10~1:12,44kHz 采样,112kbps 比特率 |
| MIDI | 乐器数字化接口,记录音符而非波形 | 非波形(指令式) | FM 合成 / 波表合成,文件极小 |
| WMA | Windows Media Audio | 有损压缩 | 80kbps/44kHz 下压缩比 1:18,速度比 MP3 快一倍 |
| RA/RAM/RM | Real 公司网络音频格式 | 流式音频 | 适合网络广播,实时播放,可含版权信息 |
| ASX | 流信息重定向文本文件 | — | 指向流媒体 URL 的中转文件 |
| Ogg Vorbis | 完全免费开放无专利 | 有损压缩 | 支持多声道,需专用播放器 |
四、图像媒体的表示与数字化
4.1 图像的数字化过程
- 采样:空间坐标 (x, y) 的离散化 → 像素 (Pixel)
- 量化:每个像素的颜色/灰度值离散化
- 编码:按一定格式存储
4.2 图像的基本属性
- 分辨率:图像像素总数,如 640×480、1024×768、2048×1536
- 长宽比一般为 4:3
- 颜色深度:每个像素用多少位二进制表示颜色
- 单色(1 位):640×480 = 37.5 KB
- 256 级灰度(8 位):640×480 = 300 KB
- 256 色(8 位索引色):640×480 = 300 KB
- 真彩色(24 位 RGB):640×480 = 900 KB
- 32 位色:24 位 RGB + 8 位 Alpha 通道(表示像素透明度/特技效果)
4.3 颜色模型
- RGB 模型:红 (Red)、绿 (Green)、蓝 (Blue) 三原色加法混合,计算机显示常用
- 灰度模型:只有亮度信息,从黑到白的渐变
- 还有 CMYK(印刷)、YUV(电视/视频)、HSI(人眼感知)等模型
4.4 图像文件格式对比
| 格式 | 开发方 | 压缩方式 | 特点 | 适用场景 |
|---|---|---|---|---|
| BMP | Microsoft | 不压缩(可选) | 位映射格式,与硬件无关,文件大,Windows 标准 | Windows 图形交换 |
| GIF | CompuServe 1987 | 无损(LZW 算法) | 最多 256 色,支持动画(多帧),隔行显示,压缩率 ~50% | 网页小图标、简单动画 |
| PNG | 1990s 开源 | 无损(LZ77 派生) | 替代 GIF/TIFF,支持 48 位彩色/16 位灰度/16 位 Alpha,流式读写,逐次逼近显示,透明性,无专利 | 网页图像、开源项目 |
| JPEG | 联合图像专家组 | 有损压缩 | 压缩比可调(10:1 ~ 40:1),主要压缩高频信息,色彩保留好,24 位真彩色 | 照片、网页、连续色调图像 |
PNG 保留 GIF 的 7 大特性:彩色查找表、流式读写、逐次逼近显示、透明性、辅助信息、独立于软硬件、无损压缩。
4.5 图像压缩原理
为什么能压缩:
- 信息本身存在很大冗余量(空间冗余、时间冗余、编码冗余)
- 人的视觉/听觉对某些信号不敏感(感知冗余)
压缩分类:
- 无损压缩:解压后数据是原始数据的完整复制,无任何损失
- 算法:行程编码、LZW、霍夫曼编码、算术编码
- 有损压缩:利用人眼感知特性,丢弃不重要信息,压缩比高但有质量损失
- 算法:变换编码(DCT)、预测编码、矢量量化
4.6 图像品质影响因素
- 色值(色彩方案)
- 灰度等级
- 分辨率
- 存储格式
- 压缩比
- 阈值(图像分割用)
五、视频媒体的表示及数字化
5.1 视频的定义
从三个角度理解:
- 物理角度:动态三维景物投影到摄像机图像平面上的二维图像序列
- 观察者角度:从观测系统看到的场景中物体发射/反射光的强度,时空都在变化
- 数学角度:随时间变化的图像,即时变图像
5.2 视频分类
| 类型 | 特点 |
|---|---|
| 模拟视频 | 随时间连续变化的电信号,早期记录存储传输都用模拟方式 |
| 数字视频 | 模拟视频经采样、量化、编码转换为计算机可处理的数字形式 |
5.3 视频数字化过程
- 分量数字化:先将复合视频信号的亮度和色度分离,得到 YUV 或 YIQ 分量
- 三路 A/D 转换:对 Y、U/V 三个分量分别数字化
- 彩色空间转换:最终转换为 RGB 彩色模型
YUV:Y 是亮度信号,U/V 是两个色差信号。人眼对亮度比对色度更敏感,因此 U/V 可以降低采样率(如 4:2:2、4:2:0)来压缩数据量,而主观质量下降不多。
5.4 视频压缩编码
- 帧内编码:去除图像的空间冗余(同一帧内相邻像素相似)
- 帧间编码:去除图像的时间冗余(相邻帧内容高度相似)
- 运动估计与运动补偿
- 差分编码
5.5 视频编码标准两大系列
1. MPEG 系列(ISO/IEC 制定)
- MPEG-1:1992,VCD 标准,1.5 Mbps
- MPEG-2:1994,DVD/数字电视标准,4~9 Mbps
- MPEG-4:1999,基于对象的编码,多媒体应用
- MPEG-4 AVC (H.264):2003,和 ITU 联合制定,高压缩比
2. H.26x 系列(ITU 制定,面向通信)
- H.261 (1989):MPEG 的先驱,P×64 kbps
- H.263:IP 视频通信最常用的编码方法
- H.263+ (1998):提高压缩编码性能
- H.264 (2003) / AVC:更高压缩比,被 ISO 接纳为 MPEG-4 的一部分
关键概念速查
| 概念 | 核心含义 |
|---|---|
| 采样 | 时间/空间上的离散化 |
| 量化 | 幅度/颜色上的离散化 |
| 编码 | 按格式组织存储 |
| 有损压缩 | 利用感知冗余,高压缩比,不可逆 |
| 无损压缩 | 利用信息冗余,低压缩比,完全可逆 |
| Alpha 通道 | 像素透明度/合成控制 |
| YUV | 亮度+色差分离,利用人眼特性压缩 |
| 帧间编码 | 利用时间冗余,视频压缩的核心 |
| 奈奎斯特定理 | 采样频率 ≥ 最高频率 × 2 |
章节关联
- 与 第01章-信息信息科学与信息技术-信息技术导论:信息的数字化是信息技术的基础
- 与 第02章-计算与计算科学-信息技术导论:二进制与计算的本质
- 与 第04章-计算机软件系统-信息技术导论:多媒体软件技术
- 与 第06章-数据的组织结构与算法-信息技术导论:数据压缩算法(霍夫曼编码、LZW等)
- 与 第07章 数据库技术-信息技术导论:多媒体数据存储与检索
- 与 时序逻辑电路与逻辑部件-第七八章-计算机组织与系统结构:A/D、D/A 转换器的硬件实现