ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

InternImage-G快速开始:10行代码跑通图像分类推理的完整指南

InternImage-G快速开始:10行代码跑通图像分类推理的完整指南 InternImage-G快速开始10行代码跑通图像分类推理的完整指南【免费下载链接】internimage_g_22kto1k_512项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/internimage_g_22kto1k_512InternImage-G 是上海 AI Lab 等机构推出的 3B 参数开源视觉基础模型ImageNet-1K 图像分类 Top-1 精度高达 90.1%是目前开源世界唯一突破 90% 的图像分类模型。本文将带你快速开始只需10 行代码即可跑通 InternImage-G 图像分类推理的完整流程零门槛上手最强开源视觉模型。一、什么是 InternImage-G一句话总结InternImage-G 用可变形卷积 DCNv3替代 Transformer成为图像分类领域的开源天花板。规格项参数值模型名称InternImage-Ginternimage_g_22kto1k_512参数量3B约 12.3GB 权重分 3 个文件存储输入分辨率512×512ImageNet-1K Top-1 精度90.1%核心算子DCNv3第三代可变形卷积输出类别数1000 类ImageNet-1K 标准类别许可证MIT它与其他视觉大模型最大的区别在于没有使用 Transformer而是以DCNv3第三代可变形卷积作为核心算子天然具备动态、有效的感受野非常适合分类、检测、分割等密集预测任务。二、项目文件结构速览每个文件是干什么的 理解文件布局能帮你快速定位配置与代码逻辑文件作用config.json模型架构配置DCNv3 核心算子、4 层 stage 深度[2,2,48,4]、1000 分类头等preprocessor_config.json图像预处理参数缩放到 512、居中裁剪、ImageNet 均值/标准差归一化modeling_internimage.py模型完整实现Backbone、DCNv3 模块、CLIP 投影器与分类头configuration_internimage.py配置类InternImageConfig定义架构超参数dcnv3.py/dcnv3_func.pyDCNv3 算子实现自动检测 CUDA 内核无内核时回退到 PyTorch 纯计算版本model-00001~00003-of-00003.safetensors分片权重文件由model.safetensors.index.json索引 提示这些自定义代码文件会随模型一起加载所以使用时必须加trust_remote_codeTrue。三、环境准备两条命令搞定安装 ️推理不需要从零训练装好 HuggingFace Transformers 生态即可pip install transformers torch pillow模型代码自定义建模文件会由 Transformers自动下载并加载无需手动克隆。如果你希望把整个模型仓库拉到本地查看源码可执行git clone https://gitcode.com/hf_mirrors/OpenGVLab/internimage_g_22kto1k_512四、10 行代码跑通图像分类推理 下面是完整的推理流程加载图像 → 预处理 → 加载模型 → 输出预测类别。import torch from PIL import Image from transformers import AutoModelForImageClassification, CLIPImageProcessor model_name OpenGVLab/internimage_g_22kto1k_512 processor CLIPImageProcessor.from_pretrained(model_name) image processor(imagesImage.open(cat.jpg), return_tensorspt).pixel_values model AutoModelForImageClassification.from_pretrained(model_name, trust_remote_codeTrue) logits model(image).logits print(预测类别 ID, torch.argmax(logits, dim1).item())逐行解读CLIPImageProcessor复用 CLIP 预处理器自动完成缩放至 512、居中裁剪和 ImageNet 归一化均值[0.485, 0.456, 0.406]标准差[0.229, 0.224, 0.225]参数来自preprocessor_config.jsonAutoModelForImageClassification自动匹配config.json中的auto_map加载自定义代码文件并构建分类模型logits1000 维输出向量argmax得到的就是 ImageNet-1K 的类别 ID。五、进阶技巧DCNv3 CUDA 内核加速 ⚡没有编译 CUDA 内核时模型会自动回退到 PyTorch 实现见dcnv3_func.py中的has_cuda_kernel检测功能完全正常但效率略低。官方提供了 CUDA 版 DCNv3 内核编译后能显著降低 GPU 显存占用、提升推理效率安装方式很简单克隆官方 InternImage 代码库进入classification/ops_dcnv3目录执行sh make.sh完成编译模型即会自动启用 CUDA 实现。 对 3B 参数的 InternImage-G 来说这一步强烈建议做——单张推理计算量高达 2700G FLOPs内核优化带来的收益非常可观。六、常见问题 FAQ ❓Q1需要多大的显卡权重约 12.3GBfloat32单卡推理建议24GB 以上显存如 RTX 3090/4090。若显存不足可尝试半精度加载在from_pretrained中加torch_dtypetorch.float16。Q2trust_remote_codeTrue安全吗该参数允许执行模型仓库内的自定义代码modeling_internimage.py等。本项目来自上海 AI Lab 官方团队代码开源透明、MIT 协议可以放心使用。Q3预测出的类别 ID 如何对应名称InternImage-G 遵循 ImageNet-1K 标准0~999 对应 1000 个自然类别如 281 是金毛寻回犬。可以加载 ImageNet-1K 类别名称列表做 ID → 名称的映射。Q4能用它做特征提取Backbone吗可以改用AutoModel.from_pretrained加载输出的hidden_states包含 4 个 stage 的特征图可直接接入检测、分割等下游任务。七、总结为什么值得试试 InternImage-G ✅精度标杆开源图像分类模型中唯一 Top-1 突破 90% 的存在上手极快10 行代码完成图像分类推理无需修改一行模型代码架构创新DCNv3 可变形卷积路线区别于主流 ViT感受野更灵活协议友好MIT 许可可自由用于科研与商业项目。现在就可以复制第四节的代码换上自己的图片跑通你的第一次 InternImage-G 推理【免费下载链接】internimage_g_22kto1k_512项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/internimage_g_22kto1k_512创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表