第05章 信息媒体的表示及数字化

北京大学苏清元《信息技术导论》课程第5章 原文:PowerPoint 97-2003 二进制格式,LibreOffice 转 PDF 后 pdftotext 全文提取 章节数:5大节(5.1~5.5),约 491 行文本


一、计算机系统的信息表示与编码

1.1 模拟与数字

  • 模拟数据 (Analog Data):随时间连续变化的值
  • 数字数据 (Digital Data):模拟数据经量化后得到的离散值
  • A/D 转换(模数转换):连续模拟信号 → 离散数字信号,电路称为 ADC
  • D/A 转换(数模转换):离散数字信号 → 连续模拟信号,电路称为 DAC

模拟技术 vs 数字技术(水桶比喻):

  • 数字系统:用空桶=0、有水桶=1,一个桶表示一位二进制位,采用浮点记数法
  • 模拟系统:用一个桶的水位高度表示一个值
  • 数字技术优势:抗干扰能力强、易于存储传输处理、可靠性高、便于集成

1.2 计算机为什么采用二进制

  1. 容易表示:只有 0 和 1 两种状态,电子器件容易实现(如高低电平、开关通断)
  2. 运算简单:二进制运算规则比十进制简单得多(加法 3 条、乘法 3 条)

1.3 数在计算机内的表示

  • 位 (bit):最小信息单位,一个二进制位
  • 字节 (Byte):8 位二进制,基本存储单位
  • 字长:计算机一次能处理的二进制数据的位数
  • 涉及问题:数的长度、符号表示(原码/反码/补码)、小数点表示(定点/浮点)

1.4 信息编码

ASCII 码

  • 美国标准信息交换码 (American Standard Code for Information Interchange)
  • ISO 646 国际标准,适用于拉丁文字母
  • 7 位码(128 个字符)和 8 位码两种形式
  • 计算机存储中占 1 字节 (8 位),最高位 (b7) 用作奇偶校验位

中文信息编码标准

标准发布年份收录字符数编码方式特点
GB2312-198019807445 个(汉字 6763 个)双字节,每字节 7 位基本集,简化汉字为主
GBK-1995199521886 个汉字和图形符号双字节向下兼容 GB2312,向上支持 ISO 10646
GB18030-2000200027484 个汉字一/二/四字节变长最新国标,与 Unicode 一一对应,类似 UTF-8

Unicode

  • 对国际标准 ISO/IEC 10646 编码的称谓,亦称大字符集
  • ISO 于 1993 年颁布,宗旨是全球所有文种统一编码
  • 目标:实现”书同文、字同码”,解决多语种编码混乱问题

1.5 数制转换与逻辑运算

  • 数制:二进制 (B)、八进制 (O)、十进制 (D)、十六进制 (H)
  • 转换关系:(01001101)B = (115)O = (4D)H = 77(D)
  • 基本逻辑运算:逻辑或 (OR)、逻辑与 (AND)、逻辑非 (NOT)、异或 (XOR)

二、媒体与多媒体信息

2.1 CCITT 媒体五大分类

按国际电信联盟 (ITU) 下属 CCITT 的定义,媒体分为五类:

类型英文定义举例
感觉媒体Perception直接作用于人的感官,使人直接产生感觉声音、图像、文字、气味、质地、温度
表示媒体Presentation为加工处理传输感觉媒体而人为构造的媒体语音编码、图像编码、文本编码
显示媒体Display感觉媒体与电信号之间转换用的媒体输入:键盘、摄像机、话筒、扫描仪;输出:显示器、打印机
存储媒体Storage存放数字化表示媒体的存储介质磁盘、光盘、半导体存储器
传输媒体Transmission将表示媒体从一处传到另一处的物理介质同轴电缆、双绞线、光纤、通信信道

2.2 多媒体的含义

  • 广义:多种信息媒体的表现和传播形式
  • 狭义:用计算机及其他设备交互处理多媒体信息的方法和手段
    • 媒体表现形式:数值、文字、声音、图像、视频
    • 硬件设备:声卡、视频卡、DSP 芯片
    • 存储实体:光盘、磁带、半导体存储器

多媒体技术:以计算机为中心,把语音、图像处理技术和视频技术等集成在一起的综合技术,包括数字化信息处理、音视频技术、软硬件技术、AI 与模式识别、通信与网络技术等。


三、音频媒体的表示与数字化

3.1 音频信号的物理特征

  • 声波:规则音频是连续变化的模拟信号,在时间和幅度上都连续
  • 频率:每秒钟波峰数目,单位 Hz/kHz,体现音调高低
    • 亚音 (subsonic):< 20 Hz
    • 音频 (Audio):20 Hz ~ 20 kHz(人耳可听范围)
    • 超音频 (ultrasonic):> 20 kHz
    • 日常语音:300 Hz ~ 3000 Hz
  • 周期:两个相邻波峰/谷底的时间间隔,与频率互为倒数
  • 幅度:从基线到波峰的距离,决定声音强弱
  • 强度:用分贝 (dB) 表示

3.2 音频数字化三步骤

  1. 采样 (Sampling):按一定时间间隔抽取模拟信号的幅度值
    • 采样频率:每秒钟采样次数
    • 奈奎斯特定理:采样频率 ≥ 信号最高频率的 2 倍,才能无失真恢复
  2. 量化 (Quantization):将采样的连续幅度值转换为有限个离散值
    • 量化位数:每个采样点用多少位二进制表示(如 8 位/16 位)
    • 量化位数越多,音质越好,数据量越大
  3. 编码 (Encoding):将量化后的数值按一定格式编码存储

数据量计算公式:数据量 = 采样频率 × 量化位数 × 声道数 / 8(字节/秒)

3.3 常见音频格式对比

格式特点压缩方式典型参数
WAVWindows 标准波形文件,无损不压缩采样位数 + 采样频率 + 声道数三参数
MP3MPEG Audio Layer 3,最流行有损压缩压缩比 1:10~1:12,44kHz 采样,112kbps 比特率
MIDI乐器数字化接口,记录音符而非波形非波形(指令式)FM 合成 / 波表合成,文件极小
WMAWindows Media Audio有损压缩80kbps/44kHz 下压缩比 1:18,速度比 MP3 快一倍
RA/RAM/RMReal 公司网络音频格式流式音频适合网络广播,实时播放,可含版权信息
ASX流信息重定向文本文件—指向流媒体 URL 的中转文件
Ogg Vorbis完全免费开放无专利有损压缩支持多声道,需专用播放器

四、图像媒体的表示与数字化

4.1 图像的数字化过程

  1. 采样:空间坐标 (x, y) 的离散化 → 像素 (Pixel)
  2. 量化:每个像素的颜色/灰度值离散化
  3. 编码:按一定格式存储

4.2 图像的基本属性

  • 分辨率:图像像素总数,如 640×480、1024×768、2048×1536
    • 长宽比一般为 4:3
  • 颜色深度:每个像素用多少位二进制表示颜色
    • 单色(1 位):640×480 = 37.5 KB
    • 256 级灰度(8 位):640×480 = 300 KB
    • 256 色(8 位索引色):640×480 = 300 KB
    • 真彩色(24 位 RGB):640×480 = 900 KB
    • 32 位色:24 位 RGB + 8 位 Alpha 通道(表示像素透明度/特技效果)

4.3 颜色模型

  • RGB 模型:红 (Red)、绿 (Green)、蓝 (Blue) 三原色加法混合,计算机显示常用
  • 灰度模型:只有亮度信息,从黑到白的渐变
  • 还有 CMYK(印刷)、YUV(电视/视频)、HSI(人眼感知)等模型

4.4 图像文件格式对比

格式开发方压缩方式特点适用场景
BMPMicrosoft不压缩(可选)位映射格式,与硬件无关,文件大,Windows 标准Windows 图形交换
GIFCompuServe 1987无损(LZW 算法)最多 256 色,支持动画(多帧),隔行显示,压缩率 ~50%网页小图标、简单动画
PNG1990s 开源无损(LZ77 派生)替代 GIF/TIFF,支持 48 位彩色/16 位灰度/16 位 Alpha,流式读写,逐次逼近显示,透明性,无专利网页图像、开源项目
JPEG联合图像专家组有损压缩压缩比可调(10:1 ~ 40:1),主要压缩高频信息,色彩保留好,24 位真彩色照片、网页、连续色调图像

PNG 保留 GIF 的 7 大特性:彩色查找表、流式读写、逐次逼近显示、透明性、辅助信息、独立于软硬件、无损压缩。

4.5 图像压缩原理

为什么能压缩:

  1. 信息本身存在很大冗余量(空间冗余、时间冗余、编码冗余)
  2. 人的视觉/听觉对某些信号不敏感(感知冗余)

压缩分类:

  • 无损压缩:解压后数据是原始数据的完整复制,无任何损失
    • 算法:行程编码、LZW、霍夫曼编码、算术编码
  • 有损压缩:利用人眼感知特性,丢弃不重要信息,压缩比高但有质量损失
    • 算法:变换编码(DCT)、预测编码、矢量量化

4.6 图像品质影响因素

  • 色值(色彩方案)
  • 灰度等级
  • 分辨率
  • 存储格式
  • 压缩比
  • 阈值(图像分割用)

五、视频媒体的表示及数字化

5.1 视频的定义

从三个角度理解:

  • 物理角度:动态三维景物投影到摄像机图像平面上的二维图像序列
  • 观察者角度:从观测系统看到的场景中物体发射/反射光的强度,时空都在变化
  • 数学角度:随时间变化的图像,即时变图像

5.2 视频分类

类型特点
模拟视频随时间连续变化的电信号,早期记录存储传输都用模拟方式
数字视频模拟视频经采样、量化、编码转换为计算机可处理的数字形式

5.3 视频数字化过程

  1. 分量数字化:先将复合视频信号的亮度和色度分离,得到 YUV 或 YIQ 分量
  2. 三路 A/D 转换:对 Y、U/V 三个分量分别数字化
  3. 彩色空间转换:最终转换为 RGB 彩色模型

YUV:Y 是亮度信号,U/V 是两个色差信号。人眼对亮度比对色度更敏感,因此 U/V 可以降低采样率(如 4:2:2、4:2:0)来压缩数据量,而主观质量下降不多。

5.4 视频压缩编码

  • 帧内编码:去除图像的空间冗余(同一帧内相邻像素相似)
  • 帧间编码:去除图像的时间冗余(相邻帧内容高度相似)
    • 运动估计与运动补偿
    • 差分编码

5.5 视频编码标准两大系列

1. MPEG 系列(ISO/IEC 制定)

  • MPEG-1:1992,VCD 标准,1.5 Mbps
  • MPEG-2:1994,DVD/数字电视标准,4~9 Mbps
  • MPEG-4:1999,基于对象的编码,多媒体应用
  • MPEG-4 AVC (H.264):2003,和 ITU 联合制定,高压缩比

2. H.26x 系列(ITU 制定,面向通信)

  • H.261 (1989):MPEG 的先驱,P×64 kbps
  • H.263:IP 视频通信最常用的编码方法
  • H.263+ (1998):提高压缩编码性能
  • H.264 (2003) / AVC:更高压缩比,被 ISO 接纳为 MPEG-4 的一部分

关键概念速查

概念核心含义
采样时间/空间上的离散化
量化幅度/颜色上的离散化
编码按格式组织存储
有损压缩利用感知冗余,高压缩比,不可逆
无损压缩利用信息冗余,低压缩比,完全可逆
Alpha 通道像素透明度/合成控制
YUV亮度+色差分离,利用人眼特性压缩
帧间编码利用时间冗余,视频压缩的核心
奈奎斯特定理采样频率 ≥ 最高频率 × 2

章节关联