ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何在Apple Silicon上快速部署GLM-4.1V-9B-Thinking-8bit?完整安装与运行教程

如何在Apple Silicon上快速部署GLM-4.1V-9B-Thinking-8bit?完整安装与运行教程 如何在Apple Silicon上快速部署GLM-4.1V-9B-Thinking-8bit完整安装与运行教程【免费下载链接】GLM-4.1V-9B-Thinking-8bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/GLM-4.1V-9B-Thinking-8bitGLM-4.1V-9B-Thinking-8bit是专为Apple Silicon优化的多模态AI模型基于MLX框架实现高效8位量化可在M系列芯片上流畅运行图像-文本推理任务。本教程将带你完成从环境准备到实际运行的全流程让你在Mac设备上轻松体验强大的视觉语言模型能力。 准备工作确认系统要求在开始部署前请确保你的设备满足以下条件硬件要求Apple Silicon芯片M1/M2/M3系列建议至少16GB内存模型峰值内存占用约11.89GB软件要求macOS 12.0Python 3.8网络环境稳定的网络连接用于下载模型文件和依赖库⚡ 一键安装核心依赖部署GLM-4.1V-9B-Thinking-8bit仅需一个核心依赖库mlx-vlm它是MLX框架的多模态扩展专门用于处理图像-文本任务。打开终端执行以下命令pip install mlx-vlm⚠️ 注意请不要使用mlx-lm库它仅支持纯文本路径无法处理图像输入。mlx-vlm是本模型的专用运行库。 获取模型文件通过Git克隆完整项目仓库到本地git clone https://gitcode.com/hf_mirrors/mlx-community/GLM-4.1V-9B-Thinking-8bit cd GLM-4.1V-9B-Thinking-8bit仓库包含以下关键文件模型权重文件model-00001-of-00003.safetensors共3个分片配置文件config.json、generation_config.json处理器配置preprocessor_config.json、processor_config.json分词器文件tokenizer.json、tokenizer_config.json 快速运行示例代码创建一个Python文件例如run_glm4v.py复制以下代码即可实现基本的图像问答功能from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template # 加载模型和处理器 model, processor load(mlx-community/GLM-4.1V-9B-Thinking-8bit) # 准备对话模板包含1张图片 prompt apply_chat_template( processor, model.config, What is shown in this image? Reason step by step., num_images1, ) # 生成回答替换image.png为你的图片路径 out generate(model, processor, prompt, image[image.png], max_tokens512) print(out.text)文本-only模式使用如果只需处理纯文本任务可简化代码如下prompt apply_chat_template( processor, model.config, Explain quantum computing in simple terms., num_images0, # 不使用图片 ) out generate(model, processor, prompt, max_tokens512) print(out.text)⚙️ 性能优化建议根据官方测试数据在M2 Pro/32GB设备上解码速度15.8 tokens/秒提示处理110.2 tokens/秒峰值内存11.89 GB为获得最佳性能建议关闭其他占用内存的应用程序适当调整max_tokens参数默认512模型会先输出/think思考块再给出答案使用SSD存储模型文件可提升加载速度❓ 常见问题解决Q: 运行时提示内存不足怎么办A: 确保关闭其他大型应用或尝试在更低配置设备上使用更小量化版本如4-bit/5-bitQ: 如何处理多张图片输入A: 修改num_images参数为图片数量并在image列表中提供对应路径Q: 模型输出包含/think符号是什么意思A: 这是GLM-4.1V的思考过程标记模型会先在/think块中进行推理之后给出最终答案 许可证信息本项目基于MIT许可证开源原始模型由Zhipu AI / Tsinghua KEG开发。详细许可条款请参见项目根目录下的LICENSE文件。使用前请确保符合原始模型的使用规范和限制。 进一步学习模型量化细节查看项目中的量化报告量化模式affine组大小64有效位9.15高级用法参考mlx-vlm官方文档了解更多参数配置性能测试项目README提供了详细的吞吐量和保真度测试数据通过以上步骤你已成功在Apple Silicon设备上部署并运行GLM-4.1V-9B-Thinking-8bit模型。这个8位量化版本在保持高保真度余弦相似度0.999973的同时显著降低了内存占用让你在Mac上也能体验强大的多模态AI能力。【免费下载链接】GLM-4.1V-9B-Thinking-8bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/GLM-4.1V-9B-Thinking-8bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表