
1. 项目概述当AI在黑夜中“失明”最近在ICLR 2026上看到一篇挺有意思的工作标题直接点出了一个我们可能都隐约感觉到但没被系统量化过的问题AI在夜晚集体失明。这个说法很形象它指的不是AI真的看不见而是指当前主流的多模态大模型比如GPT-4V、Gemini、Claude等在处理夜间、低光照、复杂光线条件下的视觉内容时其理解和推理能力会出现断崖式下跌。这就像给一个白天视力5.0的人戴上了一副磨砂镜片世界瞬间变得模糊且难以理解。这个项目团队没有停留在感觉层面而是实打实地构建了一个名为“NightBlind”的基准测试集。他们收集了90段真实世界的夜间视频涵盖了城市街道、室内弱光、逆光、动态光影等12类极具挑战性的视觉问题场景。然后他们用这个基准去“拷问”了市面上多个顶尖的多模态模型结果发现这些在白天图片上表现近乎“通灵”的模型一到晚上性能下降幅度之大有些场景的准确率甚至能掉一半以上。这不仅仅是一个学术发现它直接关系到无数依赖视觉AI的落地应用自动驾驶的夜间感知、安防监控的异常行为识别、甚至是我们手机里夜景模式的人像优化如果底层模型是“夜盲”的那这些应用在关键时刻就可能掉链子。所以这篇博文我就来深入聊聊这个“AI夜盲”现象。我会拆解这个基准测试是怎么设计的模型到底在哪些具体问题上“翻了车”背后可能的技术原因是什么以及对我们这些AI应用开发者和研究者来说有哪些实实在在的启示和可以着手改进的方向。无论你是关注多模态前沿的研究者还是正在寻找模型瓶颈的工程师相信这些来自一线的实测分析和避坑经验都能给你带来一些新的视角。2. 基准构建如何科学地给AI做“夜间视力检查”要证明AI“夜盲”不能靠感觉必须有一套科学、严谨、可复现的评估体系。NightBlind基准的构建思路就非常值得借鉴。它不是一个简单的图片数据集而是一个以视频为核心、以问题为导向的评估框架。2.1 数据采集真实世界的“黑夜挑战赛”团队首先摒弃了简单调低图片亮度来模拟夜晚的做法。因为真实的夜间视觉挑战远不止“暗”那么简单。他们从公开视频平台和自采集中精心筛选了90段视频确保每一段都代表了夜间视觉理解的某个典型难点极低光照如仅有月光或远处路灯的乡村道路。高动态范围霓虹灯招牌、车灯直射等造成的局部过曝与大片阴影并存。复杂人工光源城市中各种色温、频率不一致的LED灯、广告屏造成的光污染。运动模糊与噪声夜间拍摄常需提高ISO导致画面噪点多物体移动易产生拖影。反射与折射湿滑路面反射灯光、橱窗玻璃反光等干扰。这些视频不是孤立的片段每段视频都被切割成多个关键帧并围绕这些帧构建了具体的问答对。这就构成了一个视频-问题-答案的三元组评估单元。2.2 问题设计12把“手术刀”精准解剖模型能力这是整个基准的精华所在。他们设计了12类问题像12把不同功能的手术刀专门用来检验模型在夜间场景下各种细分能力的缺失。我挑几个最有代表性的说说细粒度属性识别“视频中那辆车的左尾灯是否在闪烁”考验在昏暗和光晕下对微小动态状态的捕捉空间关系理解“行人是在路灯的左侧还是右侧阴影里”考验在低对比度下对物体相对位置的判断时序推理“那个从暗处走出来的人之前是站在店门口吗”结合视频前后帧信息进行推理基于常识的视觉推理“为什么这个区域的监控画面看起来一片模糊可能因为摄像头镜头上有雾气或污渍”需要结合视觉现象和物理常识文字识别“远处那个蓝色招牌上的第二个字是什么”考验夜间低分辨率、强光干扰下的OCR能力异常检测“画面中是否有不符合夜间常理的现象如一片黑暗中有一个异常明亮的、无光源的物体”这12类问题几乎覆盖了多模态理解的所有核心任务而且每一类都特意选择了在夜间场景下会变得格外困难的表现形式。这样的设计使得测试结果不仅能告诉我们模型“不行”还能精确地指出它“在哪个方面不行”以及“为什么不行”。注意构建评估基准时问题类型的针对性和场景的真实性远比数据量大小更重要。NightBlind的90段视频看似不多但其问题设计的密度和精度使得它能够高效地暴露模型弱点这比用十万张简单调暗的图片更有说服力。2.3 评估协议公平的“统考”为了保证评估的公平性团队采用了零样本Zero-Shot的评估方式。也就是说在测试时模型之前从未见过NightBlind基准中的任何数据。评估时将视频的关键帧或短序列帧连同设计好的问题一起输入给多模态大模型让模型生成答案。然后将模型的答案与人工标注的标准答案进行比对计算准确率。这种设置模拟了现实情况我们部署一个预训练好的通用大模型直接用它来处理我们遇到的夜间视觉任务看它“开箱即用”的效果如何。这能最真实地反映模型当前的实际能力上限。3. 实测结果顶尖模型的“夜间成绩单”令人大跌眼镜团队用这个基准测试了包括GPT-4V、Gemini Pro Vision、Claude-3 Opus、LLaVA-NeXT等在内的多个明星多模态模型。结果可以说是一份令人警醒的“成绩单”。3.1 整体性能滑坡从“学霸”到“学渣”在标准的白天图像基准如MMBench、VQAv2上这些模型的得分往往在80%甚至90%以上表现接近人类。但在NightBlind基准上所有模型的平均性能都出现了大幅下降下降幅度在20%-40%不等。有些模型在特定类别上的准确率甚至不足50%相当于随机猜测的水平。这意味着如果一个自动驾驶系统在白天对行人的识别率是95%到了夜间同样条件下可能骤降到60%以下这是完全不可接受的安全风险。3.2 分项能力剖析弱点各不同但“盲区”明显通过分析12类问题的具体得分我们发现了一些共性的薄弱环节对光照变化极度敏感几乎所有模型在“高动态范围”和“复杂人工光源”场景下得分最低。模型无法有效处理过曝和欠曝共存的区域经常把过曝的车灯识别成“太阳”或“白色物体”把阴影中的物体直接“忽略”。细节丢失严重“细粒度属性识别”和“文字识别”类任务表现糟糕。夜间图像的信噪比低模型提取的视觉特征本身就模糊导致它无法分辨尾灯是否闪烁、招牌上的具体文字。时序推理能力几乎失效在需要联系前后帧信息的“时序推理”问题上模型表现接近盲猜。因为单帧信息已经损失严重跨帧关联就更加困难模型往往只能基于当前最模糊的一帧进行猜测而无法构建连贯的事件链条。常识与视觉结合困难在“基于常识的视觉推理”中模型可能会正确描述现象“画面模糊”但无法将其与夜间可能的成因镜头脏污、雨滴联系起来。这说明模型的视觉模块和语言常识模块在低质量视觉输入下的协同出现了问题。下面这个表格简要概括了几类核心问题的典型表现和可能原因问题类型典型夜间场景模型常见错误核心挑战分析细粒度属性识别判断车辆转向灯状态将常亮灯判断为闪烁或完全无法识别低帧率输入、运动模糊、光晕效应导致动态信息丢失模型缺乏对夜间灯光特性的专门训练。空间关系理解判断行人与路灯的相对位置混淆左右或无法定位阴影中的行人低对比度使物体边缘消失阴影成为“黑洞”模型对深度和遮挡关系判断失准。文字识别读取店铺招牌识别出乱码或完全跳过文字区域夜间成像分辨率低、光线不均造成字符断裂、模糊模型OCR能力基于高质量文档训练泛化性不足。异常检测发现黑暗中无光源的发光体将其归类为普通灯光或直接忽略模型对“夜间正常光影分布”缺乏内部建模无法定义何为“异常”。它更擅长识别物体而非判断光影的合理性。3.3 一个令人深思的发现语言描述越详细可能错得越离谱在测试中还有一个有趣的现象当面对一张非常黑暗、信息量极低的图片时有些模型反而会“承认”自己看不清回答“图像太暗无法确定”。这虽然没解决问题但至少是诚实的。但更多的时候模型会基于那一点点模糊的视觉线索结合其强大的语言先验知识生成一段非常流畅、具体但完全错误的描述。例如把一团模糊的光斑描述成“一只白色的猫”把阴影中的栅栏描述成“一排整齐的树木”。这种“一本正经地胡说八道”在落地应用中比单纯的“不知道”更危险因为它会传递高度自信的错误信息误导后续决策。这暴露了当前多模态模型的一个深层问题语言模态过于强大以至于在视觉信号微弱时它不是在“辅助”理解而是在“主导”甚至“虚构”理解。模型倾向于用它的语言模型去“脑补”一个最合理的场景而不是坦率地承认视觉证据不足。4. 技术根因探析为什么AI会“夜盲”看到这样的结果我们不禁要问这些吸收了海量图文数据、参数千亿计的大模型为什么会在夜间视觉上栽这么大跟头根据我的经验和相关论文分析原因可以归结为以下三个层面4.1 数据偏差训练集里的世界总是“阳光明媚”多模态大模型的视觉能力本质上是从其预训练数据中学来的。目前公开的、规模最大的图文对齐数据集如LAION其图像来源主要是互联网上的公开图片。这些图片绝大多数是在良好光照条件下拍摄的经过摄影师或用户筛选目的就是为了清晰、美观地呈现主体。这意味着模型的“视觉经验”严重偏向于白天、明亮、高清晰度的场景。它见过成千上万张清晰的猫、车、招牌的图片但它极少见过这些物体在极度昏暗、光影破碎下的样子。模型没有学习过如何从噪声中提取有效特征如何补偿低光照带来的颜色失真和细节损失。它的“视觉词典”里缺乏“夜间模式”的条目。4.2 架构局限“看”与“想”的耦合方式有待优化当前主流的多模态架构无论是基于交叉注意力的融合方式还是先将图像编码成“视觉词元”再输入大语言模型的方式其设计初衷都是为了处理高质量的视觉输入。当输入是高质量图像时视觉编码器能提取出丰富、干净的特征与语言特征可以很好地对齐和融合。但在夜间图像中视觉编码器如CLIP的ViT提取出的特征本身可能就是嘈杂、稀疏、有误导性的。将这些有缺陷的特征强行输入给语言模型并要求它做出精确理解无异于“巧妇难为无米之炊”。语言模型试图去理解这些混乱的信号结果就是要么放弃回答不知道要么用自己的语言知识去强行解释产生幻觉。问题的核心在于当前的架构缺乏一个显式的机制来处理“视觉不确定性”。模型需要一个模块来评估当前视觉输入的质量“这张图我看清了多少哪些区域是可靠的哪些区域是模糊的”然后在推理时模型应该能根据视觉置信度来动态调整对语言先验的依赖程度。视觉信号强时以视觉为准视觉信号弱时可以更多地依赖常识推理但同时要给出较低的可信度分数。目前这种刚性的、一刀切的融合方式无法适应从清晰到模糊的连续变化。4.3 任务定义与评估的缺失在学术研究领域大家追逐的榜单和基准长期集中在高质量图像的理解上。虽然也有一些关于“鲁棒性”的研究比如对抗攻击、常见损坏但系统性地、大规模地关注极端光照条件这一非常现实且重要的维度在过去是相对缺失的。没有专门的基准就没有明确的优化目标学术界和工业界自然就不会将大量资源投入到这个“非主流”但至关重要的方向上。NightBlind基准的出现正是为了填补这一空白。它告诉我们仅仅在ImageNet上达到99%的准确率是不够的模型必须能在全天候、全场景下稳定工作。5. 解决路径与实战思考如何给AI配上“夜视仪”知道了问题所在接下来就是如何解决。从研究到工程我认为可以从以下几个方向尝试有些是长期的架构革新有些则是当下就可以实践的技巧。5.1 数据层面构建“黑夜版”的预训练数据这是最直接、也最可能见效的方法。我们需要刻意地去收集、清洗、标注大量真实世界的低光照视觉数据并将其注入到模型的预训练阶段。实战建议1数据增强的“硬核”版本。不要只使用简单的亮度、对比度调整。可以模拟更真实的夜间光学效应如添加噪声根据ISO值模拟高斯噪声、泊松噪声。模拟运动模糊针对运动物体添加方向性模糊。模拟光晕与眩光在强点光源周围添加光晕效果。色偏模拟模拟钠灯暖黄、LED灯冷白等不同人工光源的色温。工具上除了OpenCV可以看看Albumentations库它提供了非常丰富的、针对真实世界损坏的增强方法。实战建议2主动采集与合成并重。有条件的话在真实夜间场景下采集数据是最优解。如果资源有限可以利用游戏引擎如Unity、Unreal Engine或高质量的合成数据集如Synscapes在虚拟环境中生成精确可控的夜间场景包括各种天气、光照条件。这些合成数据可以带有完美的像素级标注对于训练感知模型非常有用。实战建议3重平衡现有数据。在构建自己的训练集时有意识地将低光照数据的权重提高或者采用困难样本挖掘Hard Example Mining的策略让模型花更多精力去学习那些它容易出错的夜间样本。5.2 模型层面设计对光照鲁棒的视觉编码与融合机制这是更根本的解决方案需要算法层面的创新。方向一前置低光增强模块。在视觉编码器之前加入一个轻量级的、可训练的低光照图像增强网络。这个模块的目标不是将夜间图变成白天图那会引入幻觉而是自适应地提升图像的可用视觉信息如抑制噪声、平衡光照、恢复局部对比度。这个模块可以和整个多模态模型一起进行端到端的微调学习到“为了更好理解我需要将图像增强到什么程度”。方向二不确定性感知的融合。改进多模态融合架构让模型能够显式地估计视觉特征的可信度。例如视觉编码器可以同时输出特征向量和一个对应的“置信度分数”。在交叉注意力机制中这个置信度分数可以用于调制注意力权重——对于低置信度的视觉区域模型可以少“看”一点多“想”一点依赖语言先验并在最终输出时附带一个总体不确定性估计。这类似于人的行为看不清时我们会更依赖经验和上下文去猜测但同时心里知道“这可能不太准”。方向三专门针对低光优化的视觉编码器。探索或设计新的视觉主干网络其训练目标就包含在低光照条件下的特征表示学习。例如可以设计一种自监督任务让模型学习从极暗图像到其正常光照版本如果可获得的映射过程中的不变特征。5.3 评估与部署层面将夜间性能纳入核心指标对于AI产品经理和工程师来说这个研究给出了一个明确的行动指南在评估和选择视觉或多模态模型时必须将其在低光照、复杂光照条件下的性能作为核心考核指标之一。选型测试在POC概念验证阶段就引入类似NightBlind的夜间测试集。不要只看模型在公开标准数据集上的漂亮分数必须用自己业务场景下的夜间数据去实测。持续监控在模型上线后建立针对不同时段白天/夜晚、不同天气条件的性能监控面板。如果发现模型在夜间时段的错误率或不确定性显著升高就要触发警报。系统级容错认识到当前模型的这一局限在系统设计上增加冗余和容错机制。例如在自动驾驶中夜间模式可以主动降低车速增加激光雷达等主动传感器的权重在安防监控中对夜间警报可以设置更高的人工复核优先级。5.4 一个简单的实战微调示例假设我们有一个基于LLaVA架构的模型想提升其对夜间街道场景的问答能力。我们可以进行如下步骤数据准备收集一批夜间街道场景的图片Q并人工撰写一些针对性的问答对A。问题要涵盖NightBlind中提到的几类难点如“左侧车道那辆车的雾灯是开的吗”细粒度、“行人正在走向斑马线还是已经站在上面”时空关系。构建指令数据将每张图片和对应的问题构造成模型能理解的指令格式例如image User: 这是一张夜间街道的图片。请问左侧车道那辆车的雾灯是开的吗 Assistant: 是的左侧车道那辆灰色SUV的左前雾灯是亮着的。选择微调方法由于计算资源有限我们可以采用LoRALow-Rank Adaptation这种参数高效微调方法。它只训练模型中插入的少量低秩矩阵而不是全部参数能大大节省显存和时间。训练与评估使用准备好的指令数据在基础模型如LLaVA-NeXT上进行LoRA微调。训练完成后不仅要在自己的测试集上评估最好还能在NightBlind的类似场景上跑一下看看泛化能力提升如何。实操心得在进行此类微调时有一个关键点容易被忽略——答案的严谨性。在夜间场景下很多问题本身就是模糊的。因此在标注答案时要允许模型给出“不确定”的答案。例如对于“招牌上第二个字是什么”如果确实模糊不清标准答案可以是“无法清晰辨认”。这比强迫模型猜一个字要好得多。在训练时也要给予这类“诚实”的回答以正确的奖励这有助于模型学会在证据不足时保持谨慎减少幻觉。6. 未来展望从“夜盲”到“全时视觉”“AI夜盲”问题的暴露不是一个终点而是一个重要的里程碑。它提醒我们人工智能的感知能力正在从实验室的“温室环境”走向真实世界的“狂风暴雨”。解决这个问题需要数据、算法、评估、工程多个维度的共同努力。短期内我们可以通过针对性的数据增强和领域自适应微调来快速提升模型在特定夜间场景下的表现。中长期来看则需要架构上的创新开发出能够原生处理视觉不确定性、动态融合多模态信息的下一代模型。对于从事相关应用开发的我们而言最直接的启示就是永远不要完全信任模型在分布外数据上的表现。建立严谨的评估体系特别是针对业务场景下的极端案例如夜间、雨雪、遮挡是保证AI系统可靠性的生命线。同时在系统设计上保持谦逊为模型的“认知局限”预留容错空间是人机协同智能走向成熟的必经之路。这次ICLR 2026的工作就像给火热的AI视觉领域泼了一盆必要的“冷水”。它让我们看到在通往通用视觉理解的路上还有像“黑夜”这样看似普通却异常艰难的关卡需要攻克。而每一次对模型失败案例的深入剖析都让我们离打造真正鲁棒、可信赖的AI系统更近一步。