ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

音频专业知识

音频专业知识 目录一 音频文件1 前言2 概念3 PCM介绍4 PCM原理二 PCM相关概念1 采样频率2 采样位数3 声道数4 音频数据大小计算5 量化6 其他参数相关7 PCM数据流三 编码1 音频编码协议ACC2 压缩3 编码格式4 其他概念四 声道是什么五 声道数字含义一 音频文件1 前言现实生活中我们听到的声音都是时间连续的我们称为这种信号叫模拟信号。模拟信号需要进行数字化以后才能在计算机中使用。为了将模拟信号数字化对数字音频进行讲解分别是采样、量化和编码。首先要对模拟信号进行采样所谓采样就是在时间轴上对信号进行数字化。目前我们在计算机上进行音频播放都需要依赖于音频文件。那么音频文件如何生成的呢音频文件的生成过程是将声音信息采样、量化和编码产生的数字信号的过程我们人耳所能听到的声音频率范围为20Hz~20KHz因此音频文件格式的最大带宽是20KHZ。根据奈奎斯特的理论音频文件的采样率一般在40~50KHZ之间。奈奎斯特采样定律又称香农采样定律即为了不失真地恢复模拟信号采样频率应该大于等于模拟信号频谱中最高频率的2倍。而所谓的 44.1 kHz 就是代表 1 s 会采样 44100 次。2 概念声音的本质是一种能量波由振动而产生的能量波通过传输介质传输出去。其实声音是一种压力波当敲打某个物体或演奏某个乐器时它们的振动都会引起空气有节奏的振动使周围的空气产生疏密变化形成疏密相间的纵波由此就产生了声波这种现象会一直延续到振动消失为止。声波的三要素 声波的三要素是频率、振幅、和波形频率代表音阶的高低振幅代表响度波形代表音色。声音的传播介质 声音的传播介质很广它可以通过空气、液体和固体进行传播而且介质不同传播的速度也不同比如声音在空气中的传播速度为 340m/s , 在蒸馏水中的传播速度为 1497 m/s , 而在铁棒中的传播速度则可以高达 5200 m/s 不过声音在真空中时无法传播的。回声 当我们在高山或者空旷地带高声大喊的时候经常会听到回声之所以会有回声是因为声音在传播过程中遇到障碍物会反弹回来再次被我们听到。 但是若两种声音传到我们的耳朵里的时差小于 80 毫秒我们就无法区分开这两种声音了其实在日常生活中人耳也在收集回声只不过由于嘈杂的外接环境以及回声的分贝比较低所以我们的耳朵分辨不出这样的声音或者说是大脑能接收到但分辨不出。共鸣 自然界中有光能水能生活中有机械能电能其实声音也可以产生能量例如两个频率相同的物体敲打其中一个物体时另一个物体也会振动发生。这种现象称为共鸣共鸣证明了声音传播可以带动另一个物体振动也就是说声音的传播过程也是一种能量的传播过程。声音有三个属性音调声音频率的高低表示人的听觉分辨一个声音的调子高低的程度。音调主要由声音的频率决定同时也与声音强度有关。音量由“振幅”amplitude和人离声源的距离决定振幅越大响度越大。音色又称声音的品质波形决定了声音的音色。波长是决定音调高低振幅是决定音量高低波纹是决定音色。3 PCM介绍PCMPulse Code Modulation即脉冲编码调制技术。由于我们人耳听到的声音均为模拟信号那么我们如何将听到的信息存储起来呢这就涉及到了PCM技术。PCM技术就是把声音从模拟信号转化为数字信号的技术即对声音进行采样、量化的过程经过PCM处理后的数据是最原始的音频数据即未对音频数据进行任何的编码和压缩处理。4 PCM原理脉冲编码调制就是把一个时间连续取值连续的模拟信号变换成时间离散取值离散的数字信号后在信道中传输。脉冲编码调制就是对模拟信号先抽样再对样值幅度量化编码的过程。那么具体的每个采样又该如何表示呢这就涉及到将要讲解的第二个概念: 量化。量化是指在幅度轴上对信号进行数字化比如用 16 bit 的二进制信号来表示声音的一个采样而 16 bit 所表示的范围是 [-32768 , 32767] , 共有 65536 个可能取值因此最终模拟的音频信号在幅度上也分为了 65536 层。既然每一个分量都是一个采样那么这么多的采样该如何进行存储呢这就涉及将要讲解的第三个概念: 编码。所谓编码就是按照一定的格式记录采样和量化后的数字数据比如顺序存储或压缩存储等等。这里涉及了很多中格式通常所说的音频的裸数据就是 PCM (Pulse Code Modulation) 数据。简化来说PCM脉冲编码调制以一个固定的频率对模拟信号进行采样并将采样的信号按照一定精度进行量化最终量化后的值被输出记录到存储介质中。如下图所示原始模拟音频数据如下按照固定频率进行采样得到最后对采样后的数据选择合适精度进行量化二 PCM相关概念描述一段 PCM 数据一般需要以下几个概念量化格式(sampleFormat)、采样率sampleRate、声道数 (channel) 。以 CD 的音质为例量化格式为 16 bit 2 byte,采样率 44100 声道数为 2 这些信息就描述了 CD 的音质。而对于声音的格式还有一个概念用来描述它的大小称为数据比特率即 1s 时间内的比特数目它用于衡量音频数据单位时间内的容量大小。当然如果 sampleFormat 更加精确 (比如用 4 个字节来描述一个采样)或者 sampleRate 更加密集 (比如 48kHz 的采样率) 那么所占的存储空间就会更大同时能够描述的声音细节就会越精确。存储的这段二进制数据即表示将模拟信号转为数字信号了以后就可以对这段二进制数据进行存储播放复制或者进行其它操作。1 采样频率采样频率单位时间内对模拟信号的采样次数它用赫兹Hz来表示。采样频率越高声音的还原就越真实越自然当然数据量就越大。采样频率一般共分为22.05KHz、44.1KHz、48KHz三个等级。Tip5kHz的采样率仅能达到人们讲话的声音质量。11kHz的采样率是播放小段声音的最低标准是CD音质的四分之一。22kHz采样率的声音可以达到CD音质的一半目前大多数网站都选用这样的采样率。44kHz的采样率是标准的CD音质可以达到很好的听觉效果。48KHzminiDV、数字电视、DVD、电影和专业音频。2 采样位数采样位数Sample Bits又称为采样精度量化级也相当于每个采样点所能被表示的数据范围。采样位数通常有8bits或16bits两种采样位数越大所能记录声音的变化度就越细腻相应的数据量就越大。8bits为低品质16bits为高品质16bits最为常见。3 声道数声道数Channels又称为通道数指的是能支持不同发声的音响个数它是衡量音响设备的重要指标之一。Tip单声道的声道数为1个声道双声道的声道数为2个声道立体声道的声道数默认为2个声道立体声道4声道的声道数为4个声道。4 音频数据大小计算知道上面三个概念我们就能够计算出来一个原始的音频文件所占用空间大小了。空间大小 ( B y t e ) 时长 ( s ) ∗ 采样位数 ( b i t ) ∗ 声道数 / 8 空间大小(Byte)时长(s)∗采样位数(bit)∗声道数/8空间大小(Byte)时长(s)∗采样位数(bit)∗声道数/8而对于 CD 音质的数据比特率为多少呢 计算如下:44100 * 16 * 2 1378.125 kbps那么在一分钟里这类 CD 音质的数据需要占据多大的存储空间呢计算如下:1378.125 * 60 / 8 / 1024 10.09 MB5 量化量化 量化就是通过四舍五入的方法将采样后的模拟信号转换成一种数字信号的过程。对于采样来说就是在时间轴上对信号数字化对于量化来说就是在幅度轴上对信号数字化通过采样时测的的模拟电压值要进行分级量化按整个电压变化的最大幅度划分成几个区段把落在某区段的采样到的样品值归成一类并给出相应的量化值。6 其他参数相关帧Frame一个声音的基本数据单元其长度为采样位数和通道数的乘积。周期Period Size音频设备一次处理所需要的帧数对于音频设备的数据访问以及音频数据的存储都是以此为单位。硬件缓冲传输单位即完成这么多采样帧的传输就会回馈一个中断。Buffer Bytes 一个应用Buffer有多少个字节DMA缓冲区大小。因为Buffer Size由应用设置其可大可小若其太大则传输的延时太大所以对此进行分片提出Period的概念。overrun录制时数据都满了应用来不及取走underrun需要数据来播放应用来不及写入数据Sign 表示样本数据是否是有符号位Byte Ordering字节序表明数据是小端little-endian存储还是大端big-endian存储通常均为little-endian。nteger Or Floating Point 整形或者浮点型大多数格式的PCM样本数据使用整形表示。交错模式数字音频信号存储的方式。数据以连续帧的方式存放即首先记录第一帧的左声道样本和右声道样本再开始第2帧的记录…非交错模式 首先记录的是一个周期内所有帧的左声道样本再记录所有右声道样本。以FFmpeg中常见的PCM数据格式s16le为例它描述的是有符号16位小端PCM数据。s表示有符号16表示位深le表示小端存储。7 PCM数据流对于PCM数据都是一些文本化的描述那么一段PCM格式的数据流怎么表示的呢以8-bit有符号为例长得像这样----------------------------------- binary | 0010 0000 | 1010 0000 | ... decimal | 32 | -96 | ... -----------------------------------每个分割符|分割字节。因为是 8-bit 有符号表示的采样数据所以采样的范围为-128128。OK对于PCM数据流的存储而言上面仅仅只是单声道。对于多声道的PCM数据而言通常会交错排列就像这样--------------------------------------------------------- FL | FR | FL | FR | FL | ---------------------------------------------------------​ 对于8-bit有符号的PCM数据而言上图表示第一个字节存放第一个左声道数据FL第二个字节放第一个右声道数据FR第三个字节放第二个左声道数据FL…三 编码​ 一个完整的音频经过采样和量化后的信号需要将它转化为数字编码脉冲这一过程称为编码。​ 编码简单来说就是按一定格式记录采样和量化后的数字数据。PCM技术仅仅包含采样和量化并不包含编码部分这里仅简单介绍。1 音频编码协议ACC​AACAdvanced Audio Coding高级音频编码是一种声音数据的文件压缩格式。AAC分为ADIF和ADTS两种文件格式。ADIFAudio Data Interchange Format 音频数据交换格式。这种格式的特征是只有音频数据最前面具有头字节音频数据流中间没有头字节。因此它的解码只能在头字节处开始进行。故这种格式常用在磁盘文件中。ADTSAudio Data Transport Stream 音频数据传输流。这种格式的特征是它每一单元音频数据都有一个header字节解码可以在这个流中任何位置开始。2 压缩​ PCM数据是最原始的音频数据完全无损所以PCM数据虽然音质优秀但体积庞大为了解决这个问题先后诞生了一系列的音频格式这些音频格式运用不同的方法对音频数据进行压缩其中有无损压缩和有损压缩两种。压缩编码的基本指标之一就是压缩比压缩比通常小于 1 。压缩比越小丢失的信息就比越多信号还原后的失真就会越大。无损压缩将数据压缩之后通过解码还能还原成与原始数据一模一样的数据为无损压缩。ALAC、APE、FLAC有损压缩消除冗余信息如人耳能听到的声音为20Hz - 20000Hz 以内所以可以将此范围外的声音去除掉。MP3、AAC、OGG、WMA3 编码格式WAV 编码WAV 编码就是在 PCM 数据格式的前面加了 44 个字节分别用来存储 PCM 的采样率、声道数、数据格式等信息。特点: 音质好大量软件支持。场景: 多媒体开发的中间文件、保存音乐和音效素材。MP3 编码MP3 具有不错的压缩比使用 LAME 编码 MP3 编码格式的一种实现的中高码率的 MP3 文件听感上非常接近源 WAV 文件当然在不同的应用场景下应该调整合适的参数以达到最好的效果。特点: 音质在 128 Kbit/s 以上表现还不错压缩比比较高大量软件和硬件都支持兼容性好。场景: 高比特率下对兼容性有要求的音乐欣赏。AAC编码AAC 是新一代的音频有损压缩技术它通过一些附加的编码技术(比如 PS 、SBR) 等衍生出了 LC-AAC 、HE-AAC 、HE-AAC v2 三种主要的编码格式。LC-AAC 是比较传统的 AAC ,相对而言其主要应用于中高码率场景的编码 (80Kbit/s) ; HE-AAC 相当于 AAC SBR 主要应用于中低码率的编码 80Kbit/s; 而新推出的 HE-AAC v2 相当于 AAC SBR PS 主要用于低码率场景的编码 ( 48Kbit/s) 。事实上大部分编码器都设置为 48Kbit/s 自动启用 PS 技术而 48Kbit/s 则不加 PS 相当于普通的 HE-AAC。特点: 在小于 128Kbit/s 的码率下表现优异并且多用于视频中的音频编码。场景: 128 Kbit/s 以下的音频编码多用于视频中音频轨的编码。Ogg 编码Ogg 是一种非常有潜力的编码在各种码率下都有比较优秀的表现尤其是在中低码率场景下。Ogg 除了音质好之外还是完全免费的这为 Ogg 获得更多的支持打好了基础Ogg 有着非常出色的算法可以用更小的码率达到更好的音质128 Kbit/s 的 Ogg 比 192kbit/s 甚至更高码率的 MP3 还要出色。但是目前因为还没有媒体服务软件的支持因此基于 Ogg 的数字广播还无法实现。Ogg 目前受支持的情况还不够好无论是软件上的还是硬件上的支持都无法和 MP3 相提并论。特点: 可以用比 MP3 更小的码率实现比 MP3 更好的音质高中低码率下均有良好的表现兼容性不够好流媒体特性不支持。场景: 语言聊天的音频消息场景。Android 平台下的音频渲染4 其他概念码率(也成位速、比特率) 是指在一个数据流中每秒钟能通过的信息量代表了压缩质量。比如MP3常用码率有128kbit/s、160kbit/s、320kbit/s等等越高代表着声音音质越好。MP3中的数据有ID3和音频数据组成ID3用于存储歌名、演唱者、专辑、音轨等我们可以常见的信息。码率采样率∗采样位数∗声道数例如如果是CD音质采样率44.1KHz采样位数16bit立体声(双声道) 码率 44.1 * 1000 * 16 * 2 1411200bps 176400Bps那么录制一分钟的音乐 大概176400 * 1 * 60 / 1024 / 1024 10.09MB。音频帧 音频数据是流式的本身没有明确的一帧帧的概念在实际的应用中为了音频算法处理/传输的方便一般约定俗成取2.5ms~60ms为单位的数据量为一帧音频。四 声道是什么声道指声音在录制或播放时在不同空间位置采集或回放的相互独立的音频信号声道数也就是声音录制时的音源数量或回放时相应独立发声的扬声器数量。我们平时都是说数字几点几声道那为了方便解释杰宝在这里用字母来指代数字。简单来说a.b.c声道音响系统就是由a个前后左右环绕的扬声器b个低音炮c个天空扬声器共计abc个扬声器组成的总计abc个声道的系统。其中a位置代表的是a个环绕扬声器b位置代表的是b个专门设计的超低音声道需要单独的低音炮来发声c位置代表的是c个天空扬声器装在顶上。例如7.1.4声道音响就是中置、左右前置、左右环绕、左右后置7个扬声器加上1个低音炮和4个天空扬声器共计12个扬声器组成的12声道系统而2.0声道音响是有左右两个扬声器没有低音炮也没有上方扬声器的双声道系统。7.1.4声道音响系统摆放示意图声道可以基本分为单声道、立体声、环绕声、全景声不同的声道各有其能够实现的效果从低到高层层递进声道越多听觉感受越丰富但相应的成本也就越高。选择设备时了解清楚不同声道能够实现的效果再和自身音质需求进行匹配能让小伙伴们少走不少弯路。1.单声道即一个声音通道用一个传声器拾取声音用一个扬声器进行放音的过程称之为单声道。单声道只能听得到所有声音包括人声、枪声、汽车声等都从一个地方来听不出声音的定位、移动等效果相对于真实的自然声来说是简单化、失真的。随着时代的发展单声道已经越来越无法满足人们的影音欣赏和声音体验需求产品很少也不建议小伙伴们选购。2.立体声2.0声道、2.1声道都是立体声立体声能够听到声音的方位和变化相比单声道系统音质有很大改善、临场感也大大加强在重现声源的定位方面有很大改进。2.1声道比2.0声道多一个低音炮用2.1声道音响系统在家看电影的时候电影的左右声道声音就会分别从左右音箱传出来而低音部分会但单独从低音炮中传出除呈现声音的立体声效果清晰辩位外声音的高中低部分也能有更好的呈现用户能够享受沉醉低音和真实立体声效果。但真实的环绕感和现场感立体声就完全做不到了。传统音响和新兴的回音壁音响都可以实现2.1声道。虽然在音质效果上回音壁没有传统高端音响完美但由于回音壁音响使用简便是一体化音响无需复杂布线安装价格也让人容易接受对电视、投影仪等设备能够起到大幅音质提升的效果回音壁音响越来越成为人们改善音质的选择。如果对声音有点要求又不算太高只是想要看电影听音乐、在家享受周末生活的时候能够提升音质效果更清晰真实地听到声音的方位、细节、变化让娱乐生活更畅快酣爽让生活品质小范围提升对自己更好一点的话2.1声道电视音响就是一个很值得的选择一般千元左右就可以搞定贵一点几千便宜一点几百也都有选择的空间。例如杰科T130Pro回音壁音响就是2.1声道采用长条音箱加低音炮的组合共计3个扬声器7个发声单元发声配有HDMI ARC 接口稳定回传K歌、音乐、观影三种模式随心切换低音沉醉澎湃高音细节明显。3.环绕声常见的环绕声包括5.1、7.1声道在家庭影院方面环绕声具有立体声不可比拟的优势三维空间感能给观众一种鲜活的、置身其中的临场感可以感知到前所未有的细微声音移动拥有真实震撼的观影体验。其中7.1声道要更加强大它在5.1的基础上又增加了左后和右后两个发音点扬声器以求达到声音的完美境界。能够实现全方位全包围环绕更加逼真、更具现场感的极佳观影体验。环绕声效果图如果比较追求环绕声追求观影时刻的沉浸感可以选择5.1声道音响来感受浑厚优质的人声、极好的音场形象、更宽阔的声场以及真实的立体环绕感。如果对声音有很高的品味和追求同时经济能力和技术实力也跟得上的话那7.1声道音响以及更高阶的玩法都在等待烧友们的探索4. 全景声杜比全景声Dolby Atmos是杜比实验室研发的3D环绕声技术全景声是一种颠覆性改变它将基于声道来混音的技术上升为基于对象的音频处理技术声音不再按照声道预设好的来输出而是根据影片情节灵活处理通过解码计算之后按照算法来指定具体的某些喇叭输出。在效果上杜比全景声能够实现以影片情节来设定的动态声音效果更真实地营造出声音的方位感和临场感通过更多扬声器展现更多声音细节达到一种动态化的震撼完美声音效果。全景声效果示意图全景声音响数量并不固定少于7.1.4声道可以通过技术感受到模拟全景声效果有条件的小伙伴可以配备7.1.4声道来感受真正的全景声效果也可以再继续增加扬声器来获得更饱满细腻、真实还原的声音。它最多可以支持64个独立扬声器、多达 128 个音轨呈现内容如果说人类永恒在追求更高的境界那全景声技术的发明可以说是对这一说法最好的验证之一。五 声道数字含义点前面代表全频扬声器能听清人声的数量点后面代表超低扬声器俗称低音炮数量。全频扬声器数为奇数 n 则代表其有 2 个前置箱左前和右前、 1 个中置箱正前主要用于表现电影人声对白和 (n-3) 个环绕箱主要用于渲染环境氛围。如为偶数则无中置箱。超低扬声器主要用于表现超低频信号一般在看电影玩游戏听电子乐时可以带来更深的低频下潜动次大次到你心里和更大的低频声压整个房间都在震但如果分频处理不好不够平坦的频响曲线会劣化中低频表现这样对于声乐回放可能还不如没有超低扬声器的 2.0 产品。
返回列表