ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MiniCPM-V 4.0 全解析:4.1B 参数端侧多模态大模型的能力、评测与部署指南

MiniCPM-V 4.0 全解析:4.1B 参数端侧多模态大模型的能力、评测与部署指南 MiniCPM-V 4.0 全解析4.1B 参数端侧多模态大模型的能力、评测与部署指南【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-VMiniCPM-V 4.0 是 MiniCPM-V 系列主打端侧高效部署的多模态大模型MLLM以仅 4.1B 总参数量实现了超越 MiniCPM-V 2.68.1B与 GPT-4.1-mini-20250414 的视觉理解表现并可在 iPhone 16 Pro Max 上流畅运行。本文以 docs/minicpm_v4_zh.md 为骨架结合仓库源码与说明文档完整展开该模型的架构、三组核心评测数据、端侧实测体验以及 llama.cpp / Ollama / vLLM / SGLang / LLaMA-Factory 等多框架使用方式帮助你评估其能力边界并快速完成部署选型。MiniCPM-V 4.0 模型总览架构与核心特性MiniCPM-V 4.0 是 MiniCPM-V 系列中一款高效模型构建于SigLIP2-400M 视觉编码器与MiniCPM4-3B 语言骨干之上参数总量约4.1B该模型文档归档于 2026-05-09仓库 README.md 的新闻记录显示其于 2025.08.02 开源。它延续了 MiniCPM-V 2.6 在单图、多图和视频理解三方面的能力同时大幅提升了推理效率。官方文档归纳了三大核心特性 领先的视觉能力MiniCPM-V 4.0 在 OpenCompass8 个主流 benchmark 的综合评测上取得平均69.0分超越了 MiniCPM-V 2.68.1B65.2 分、Qwen2.5-VL-3B-Instruct3.8B64.5 分以及广泛使用的闭源模型 GPT-4.1-mini-2025041468.9 分在多图理解与视频理解任务上同样表现出色。 卓越的效率专为端侧设备优化可在 iPhone 16 Pro Max 上流畅运行首 token 延迟低至 2 秒、解码速度达 17.9 tokens/s且无发热问题在并发请求场景下也表现出领先的吞吐率。 易于使用支持 llama.cpp、Ollama、vLLM、SGLang、LLaMA-Factory 及本地 Web Demo 等多种推理方式并开源了可在 iPhone 和 iPad 上运行的 iOS App。从仓库结构看该系列统一采用「视觉编码器 resampler LLM」的组合范式如 chat.py 中MiniCPMV2_6类所示家族模型的推理入口均遵循model.chat(image..., msgs..., tokenizer...)的 API 惯例MiniCPM-V 4.0 作为同系列模型延续了这一调用风格。单图理解OpenCompass 综合评测结果下表为官方文档给出的 OpenCompass 单图理解评测结果覆盖 OpenCompass 均值、OCRBench、MathVista、HallusionBench、MMMU、MMVet、MMBench V1.1、MMStar、AI2D 共 9 项指标对比模型包括 GPT-4v、Gemini-1.5-Pro、GPT-4.1-mini、Claude 3.5 Sonnet 四款闭源模型以及 Qwen2.5-VL、InternVL2.5、MiniCPM-V 2.6、MiniCPM-o 2.6 等开源模型modelSizeOpencompassOCRBenchMathVistaHallusionBenchMMMUMMVetMMBench V1.1MMStarAI2DProprietaryGPT-4v-20240409-63.565655.243.961.767.579.856.078.6Gemini-1.5-Pro-64.575458.345.660.664.073.959.179.1GPT-4.1-mini-20250414-68.984070.949.355.074.380.960.976.0Claude 3.5 Sonnet-20241022-70.679865.355.566.470.181.765.181.2Open-sourceQwen2.5-VL-3B-Instruct3.8B64.582861.246.651.260.076.856.381.4InternVL2.5-4B3.7B65.182060.846.651.861.578.258.781.4Qwen2.5-VL-7B-Instruct8.3B70.988868.151.958.069.782.264.184.3InternVL2.5-8B8.1B68.182164.549.056.262.882.563.284.6MiniCPM-V-2.68.1B65.285260.848.149.860.078.057.582.1MiniCPM-o-2.68.7B70.288973.351.150.967.280.663.386.1MiniCPM-V-4.04.1B69.089466.950.851.268.079.762.882.9值得关注的几个结论参数量减半、性能反超MiniCPM-V 4.0 仅用 4.1B 参数OpenCompass 平均分69.0即超过自家 8.1B 的 MiniCPM-V 2.665.2也超过同量级竞品 Qwen2.5-VL-3B64.5与 InternVL2.5-4B65.1。逼近并局部超越闭源模型69.0 分高于 GPT-4.1-mini-20250414 的 68.9接近 Claude 3.5 Sonnet 的 70.6。OCR 能力突出OCRBench 得分894为同表所有模型中最高甚至超过 8.7B 的 MiniCPM-o-2.6889体现了强文本识别能力。专项能力图表、文档、数学与幻觉抑制在更细分的单图任务上官方文档给出了图表理解ChartQA、整体感知MME、真实世界问答RealWorldQA、场景文本TextVQA、文档问答DocVQA、数学推理MathVision、DynaMath、WeMath以及幻觉抑制Obj Hal 的 CHAIRs/CHAIRi、MM Hal 的 score/hall rate等指标modelSizeChartQAMMERealWorldQATextVQADocVQAMathVisionDynaMathWeMathCHAIRs↓CHAIRi↓score avg3↑hall rate avg3↓ProprietaryGPT-4v-20240409-78.5192761.478.088.4-------Gemini-1.5-Pro-87.2-67.578.893.141.031.550.5----GPT-4.1-mini-20250414------45.347.7-----Claude 3.5 Sonnet-20241022-90.8-60.174.195.235.635.744.0----Open-sourceQwen2.5-VL-3B-Instruct3.8B84.0215765.479.393.921.913.222.918.310.83.933.3InternVL2.5-4B3.7B84.0233864.376.891.618.415.221.213.78.73.246.5Qwen2.5-VL-7B-Instruct8.3B87.3234768.584.995.725.421.836.213.37.94.131.6InternVL2.5-8B8.1B84.8234470.179.193.017.09.423.518.311.63.637.2MiniCPM-V-2.68.1B79.4234865.080.190.817.59.020.47.34.74.029.9MiniCPM-o-2.68.7B86.9237268.182.093.521.710.425.26.33.44.131.3MiniCPM-V-4.04.1B84.4229868.580.892.920.714.232.76.33.54.129.2解读要点文档与场景文本DocVQA 92.9、TextVQA 80.8明显高于前代 MiniCPM-V 2.690.8 / 80.1在 4B 级别开源模型中处于第一梯队。数学推理WeMath 32.7、DynaMath 14.2、MathVision 20.7均显著优于 MiniCPM-V 2.620.4 / 9.0 / 17.5说明 4.0 在数学类任务上亦有代际提升。幻觉抑制出色MM Hal 的 hallucination rate29.2是同表开源模型中最低的低于 MiniCPM-V 2.629.9与 Qwen2.5-VL-7B31.6CHAIRs 6.3 与 8.7B 的 MiniCPM-o-2.6 持平表明模型在降低对象级幻觉方面表现稳健。多图与视频理解Mantis、Blink 与 Video-MMEMiniCPM-V 4.0 继承了 MiniCPM-V 2.6 的多图与视频理解能力官方文档给出的评测结果如下Video-MME 分含字幕 wo subs / 不含字幕 w subs 两种设置modelSizeMantisBlinkVideo-MME wo subsVideo-MME w subsProprietaryGPT-4v-20240409-62.754.659.963.3Gemini-1.5-Pro--59.175.081.3GPT-4o-20240513--68.071.977.2Open-sourceQwen2.5-VL-3B-Instruct3.8B-47.661.567.6InternVL2.5-4B3.7B62.750.862.363.6Qwen2.5-VL-7B-Instruct8.3B-56.465.171.6InternVL2.5-8B8.1B67.754.864.266.9MiniCPM-V-2.68.1B69.153.060.963.6MiniCPM-o-2.68.7B71.956.763.969.6MiniCPM-V-4.04.1B71.454.061.265.8可见 MiniCPM-V 4.0 在Mantis 多图评测上取得 71.4超过自家 8.7B 的 MiniCPM-o-2.671.9 之下、接近 8.1B 的 2.6 版本 69.1与所有同表小参数模型Video-MMEw subs65.8 优于 8.1B 的 MiniCPM-V 2.663.6在多图与视频理解上与更大参数模型保持同一水平——这也是「小参数、强多模态」定位的直接证据。端侧部署实测iPhone 16 Pro Max 上的运行体验MiniCPM-V 4.0 的核心卖点之一是端侧on-device部署。官方文档记录开发团队在iPhone 16 Pro Max上部署了 MiniCPM-V 4.0 的 iOS demo实测表现如下首 token 延迟低至 2 秒first token delay 2s解码速度超过 17 tokens/s无发热问题适合长时间交互场景在并发请求场景下吞吐率指标领先。配套开源的iOS App 同时支持 iPhone 与 iPad官方演示录屏均为未经加速等任何编辑的真实屏幕录制。下图为官方公布的典型能力展示样例含数学推理等多任务案例与 iPhone 16 Pro Max 上的中英文实时演示片段仓库中还保留了iphone_en_information_extraction.gif、iphone_cn_funny_points.gif等信息抽取、趣味多轮交互场景的英文与中文录屏见 assets/minicpmv4可用于直观了解其在真实手机上的响应速度与交互质量。如果你关心端侧部署的完整流程模型转换、量化、Xcode 工程集成等官方推荐参考结构清晰的 MiniCPM-V CookBook 中的 iOS demo 章节其中涵盖详细部署指南与真实示例。灵活易用多框架推理与生态支持MiniCPM-V 4.0 在推理方式上提供了丰富的选择官方明确支持以下途径llama.cpp面向 CPU / 端侧的高效推理配合 GGUF 量化模型使用Ollama一键本地拉起模型服务适合个人开发者快速体验vLLM高吞吐、显存友好的服务化部署SGLang高性能推理框架适合生产级并发服务LLaMA-Factory在推理之外同时提供微调生态接入本地 Web Demo仓库内即可启动交互式演示iOS App面向 iPhone / iPad 的端侧原生体验。仓库 README.md 的「Supported Inference and Training Frameworks」一节给出了 MiniCPM-V 4.0 在各框架下的部署文档入口vLLM / SGLang / llama.cpp / Ollama 四列均指向 Cookbook 中的minicpm-v4专项指南与本文档声明完全一致。对于需要快速上手部署的场景可在 Cookbook 中按「vLLM → 服务化、llama.cpp/Ollama → 本地与端侧、SGLang → 高并发」的路径选择最合适的框架。仓库内的微调支撑与工程佐证围绕 MiniCPM-V 4.0当前仓库还提供了可落地的训练与推理工程支撑官方微调脚本finetune/readme.md 明确列出官方微调脚本支持MiniCPM-V 4.0与 MiniCPM-o 2.6、MiniCPM-V 2.6 等并列默认基于 transformers Trainer 与 DeepSpeed。脚本中通过LLM_TYPE指定语言骨干类型——按注释约定MiniCPM-V 4.0 对应llama其他模型如 MiniCPM-V-2.6 对应qwen。训练数据采用「id image单图路径或image_XX占位符字典 conversations」的 JSON 结构既支持单图 SFT也支持多图占位符插入并建议多图 SFT 时设置MODEL_MAX_LENGTH4096。统一推理入口chat.py 提供了家族统一的MiniCpmvChat入口类通过model_path自动路由到 OmniLMM-12B、MiniCPM-Llama3-V 2.5、MiniCPM-V 2.6 等对应实现MiniCPMV2_6还支持multi_gpusTrue的多卡分发推理其attn_implementationsdpa、torch_dtypetorch.bfloat16的加载约定可作为同系列模型加载的参考。量化与多卡仓库 docs/inference_on_multiple_gpus.md、docs/minicpm_v2dot6_zh.md 等文档提供了系列模型的多卡推理与量化部署经验可作为 MiniCPM-V 4.0 在低显存环境下的部署参考。总结与适用场景综合官方文档与仓库信息MiniCPM-V 4.0 的定位可以概括为以 4.1B 参数达到 8B 级视觉理解水平、并以端侧可部署性为核心设计目标的多模态模型。其能力画像如下适合的场景手机 / 平板等端侧实时图像与视频理解、低延迟交互应用、隐私敏感的边缘计算场景、需要高吞吐的并发服务能力优势单图理解OpenCompass 69.0、OCRBench 894、图表文档理解ChartQA 84.4、DocVQA 92.9、数学推理WeMath 32.7与幻觉抑制hall rate 29.2均相对前代 2.6 有代际提升多图Mantis 71.4与视频Video-MME w subs 65.8能力保持系列水准工程生态llama.cpp / Ollama / vLLM / SGLang / LLaMA-Factory / 本地 Web Demo / iOS App 多路径覆盖配合 Cookbook 可快速完成从本地体验到生产部署的迁移。如果你正在为端侧多模态应用或轻量级视觉服务选型MiniCPM-V 4.0 是同时兼顾「性能上限」与「部署下限」的有力候选进一步了解其英文版介绍可阅读 docs/minicpm_v4_en.md。【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表