ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

一文读懂NemotronLabs-VoiceChat-11B-mlx-8bit:Apple Silicon专属的110亿参数语音模型

一文读懂NemotronLabs-VoiceChat-11B-mlx-8bit:Apple Silicon专属的110亿参数语音模型 一文读懂NemotronLabs-VoiceChat-11B-mlx-8bitApple Silicon专属的110亿参数语音模型【免费下载链接】NemotronLabs-VoiceChat-11B-mlx-8bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/NemotronLabs-VoiceChat-11B-mlx-8bitNemotronLabs-VoiceChat-11B-mlx-8bit是专为Apple Silicon优化的110亿参数语音模型它实现了双向语音交互功能让用户能够与AI进行自然流畅的对话。作为NVIDIA NemotronLabs-VoiceChat-11B模型的MLX转换版本该模型在保持原有性能的基础上通过8位量化技术大幅降低了内存占用使其能够在苹果芯片上高效运行。 模型简介110亿参数的语音交互专家NemotronLabs-VoiceChat-11B-mlx-8bit是一个完整的语音交互系统包含四个核心组件语言主干77.1亿参数采用Nemotron-H混合架构包含56层27个Mamba-2层、25个MLP层和4个分组查询注意力层隐藏层大小4480词汇量131072词汇头17.6亿参数包括令牌嵌入、LM头和函数调用头语音编码器6.1亿参数采用带mel前端的Conformer编码器语音生成器10亿参数包含Gemma-3 TTS主干、混合高斯头、神经音频编解码器和31级残差VQ该模型支持双向操作以80毫秒帧12.5帧/秒运行输入采样率16kHz输出采样率22.05kHz。 量化版本对比选择最适合你的方案NemotronLabs-VoiceChat-11B提供了多个MLX量化版本以满足不同设备配置的需求版本大小量化方式bf1622.2 GB无8bit(本仓库)13.9 GB8位仅LLM和词汇头4bit9.2 GB4位仅LLM和词汇头8bit版本被推荐为最佳选择在贪婪解码下产生与bf16版本相同的文本同时减少43%的内存使用。 Apple Silicon性能表现高效运行的秘密在Apple M4 Max68.7 GB统一内存上仅语言主干的贪婪解码性能如下版本加载时间峰值内存首令牌时间吞吐量bf163.1 s17.96 GB646 ms23.4 tok/s8-bit1.9 s10.22 GB803 ms33.2 tok/s音频编解码器的运行速度约为实时速度的6倍确保了流畅的语音交互体验。️ 快速开始两步体验语音模型步骤1文本生成与语言主干首先使用以下命令安装必要的依赖并体验语言主干的文本生成能力pip install mlx mlx-lm python mlx/extract_llm.py --src . --dst ./voicechat-llm python mlx/chat_example.py --model ./voicechat-llm --prompt The capital of France is由于源模型没有提供文本令牌器extract_llm.py会将主干与Nemotron-H基础令牌器词汇量131072配对并在写入前验证大小是否匹配。步骤2音频编解码器往返测试体验音频编解码器的功能将波形编码为512维潜在变量和31级代码然后解码回音频pip install mlx numpy python mlx/codec_example.py --repo . --wav input.wav --out output.wav在M4 Max上重建的信噪比约为8 dB以12.5帧/秒的速度运行比实时速度快约6倍。 量化细节平衡性能与效率NemotronLabs-VoiceChat-11B-mlx-8bit采用了精心设计的量化策略语言主干和三个词汇头被量化为8位组大小64占111亿参数中的94.7亿整个语音路径音频编解码器、混合高斯头、Conformer编码器和RNN-T解码器保留在bfloat16中这些小张量的误差会直接影响音频质量而节省的空间可以忽略不计与bfloat16版本相比平均相对误差仅为0.57%确保了高质量的语音交互体验。⚠️ 使用注意事项纯文本提示不在模型的训练分布范围内它被训练为发出交错的文本和音频编解码器令牌因此生成可能以音频侧令牌结束如SPECIAL_12编解码器期望22.05 kHz单声道音频其他速率会以错误的速度解码源检查点中的每个张量都存在于本仓库中转换经过完整性验证所有层级都确保有限值 许可证和归属NemotronLabs-VoiceChat-11B-mlx-8bit根据OpenMDW-1.1许可证发布遵循原始模型。基础模型和架构由NVIDIA提供MLX音频编解码器实现遵循NVIDIA NeMo Speech。要获取完整模型请克隆仓库git clone https://gitcode.com/hf_mirrors/mlx-community/NemotronLabs-VoiceChat-11B-mlx-8bit开始探索这个强大的语音交互模型体验Apple Silicon上高效运行的AI语音技术【免费下载链接】NemotronLabs-VoiceChat-11B-mlx-8bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/NemotronLabs-VoiceChat-11B-mlx-8bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表