Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models
该论文探索了Qwen模型在遥感图像变化视觉问答(Change VQA)任务中的应用,并对比了不同模型架构。
- 评估了Qwen系列模型在CDVQA基准上的性能
- 对比了结构化视觉语言模型和原生多模态模型的效果
共 1170 篇论文
该论文探索了Qwen模型在遥感图像变化视觉问答(Change VQA)任务中的应用,并对比了不同模型架构。
该论文提出了一种利用视觉指令调整的视觉-语言框架,通过理解医学图像来提高生存预测的准确性。
LeapAlign通过两步轨迹优化Flow Matching模型,降低计算成本并提升早期生成步骤的更新效果。
论文评估了视觉异常检测在自动驾驶安全中的应用,并提出了高效的边缘部署模型。
分析了VLM在识别人类情感方面的不足,并提出了针对长尾分布和时间信息缺失的解决方案。
SegWithU提出了一种高效的单次前向传播医学图像分割不确定性估计方法。
该论文提出IRS框架,通过监督中间推理过程,提升模型在多模态幽默理解任务上的性能,超越现有模型。
VisPCO提出了一种自动优化视觉token剪枝配置的框架,提升视觉-语言模型的效率。
论文提出MCSC任务和MCSC-Bench数据集,用于评估多模态大模型在视频脚本生成中的能力。
提出STFER框架,利用LVLM生成语义文本,增强Any-Time ReID在跨模态和服装变化下的鲁棒性。
ControlFoley提出了一种可控的跨模态视频到音频生成框架,解决了跨模态冲突和风格控制问题。
ConfGuide通过Conformal风险控制,结合VLM生成更简洁的引导,优化混合决策。
UniDoc-RL提出了一种基于强化学习的视觉RAG框架,通过分层动作和密集奖励提升细粒度视觉语义理解。
研究视觉语言模型在推理过程中的信息整合方式,揭示了其对文本线索的过度依赖及CoT的可解释性局限。
MetaDent提出了一个用于牙科图像VLM训练的大规模标注数据集和基准测试。
Paza是一个零样本零售盗窃检测框架,利用多模型协同降低成本,保护隐私。
论文提出了MM-AQA基准,评估多模态系统在证据不足时有效放弃回答的能力,并分析了现有模型的表现。
论文提出MirrorBench基准,评估多模态大模型在自参照理解方面的能力,揭示其与人类的差距。
针对VQA持续学习中视觉语言模型的不对称性,提出非对称信息掩码(AIM)方法,平衡稳定性和可塑性。
HAMSA是一种无扫描的视觉状态空间模型,在频谱域直接操作,提升了速度和效率。
针对长视频理解的VLM,提出token和帧级别的双重压缩方法,以减少计算量并提高性能。
ROSE通过检索增强解决MLLM在新实体分割上的难题,提升模型性能。
提出音频对比偏好优化ACPO,解决音视频语言模型中视频驱动的音频幻觉问题,提升音频的可靠性。
HiVLA通过解耦高层语义规划和低层运动控制,提升机器人操作的推理能力和执行精度。
UI-Zoomer提出了一种无需训练的自适应GUI元素定位缩放框架,提升了小图标和密集布局的定位准确性。
UMI-3D扩展了UMI,通过集成LiDAR克服了视觉SLAM的局限,提升了数据质量和策略性能。
提出TF-SMOT,一个无需训练的语义多目标跟踪流程,提升视频理解能力。
提出Unconstrained HOI任务,利用MLLM进行无约束人与物交互检测,突破传统HOI的限制。
提出Delta-LLaVA,一个针对遥感变化理解的MLLM框架,解决时序盲区问题,实现高精度变化检测。
提出了DailyClue基准测试,用于评估MLLMs在日常场景中基于视觉线索的推理能力。
从零训练多模态Agentic搜索模型POINTS-Seeker,解决长程知识密集型视觉推理难题。
MAny通过跨模态原型合并和低秩参数合并解决多模态持续指令微调中的灾难性遗忘问题。
研究奖励函数设计对视觉语言模型物理推理能力的影响,并提出基于注意力的新奖励函数。
MApLe提出了一种多任务多实例视觉语言对齐方法,解决医学影像报告中细微病理发现与图像关联的难题。
论文提出RoleJudge框架,评估语音大模型在角色扮演中的角色一致性,并利用强化学习优化。
早期视觉皮层对齐能提高视觉语言模型抵抗诱导性错误回答的能力。
FIDeL通过统计和语义过滤,实现了机器人模仿学习中故障的准确识别,显著提升了故障检测性能。
MedRCube提出了一个多维度医学影像MLLM评估框架,揭示了现有评估的局限性,并发现了影响临床信任度的因素。
VLAJS方法结合视觉-语言-动作模型和强化学习,提升机器人操作任务的探索效率和学习效果。
Doc-V*是一个OCR-free的agent框架,通过主动导航和证据聚合解决多页文档VQA问题。
论文提出Audio-Side Time Prompt和TimePro-RL框架,提升LALM在音频时间感知任务中的性能。
提出SLQ框架,通过共享潜在查询将冻结的MLLM适配于检索任务,并构建知识推理检索基准KARR-Bench。
VIGILant是一个用于Virgo探测器故障分类和可视化的自动机器学习pipeline。
EMGFlow利用Flow Matching高效生成高质量sEMG数据,提升肌电控制系统性能。
VRAG-DFD通过RAG和RL增强MLLM,提升Deepfake检测能力,构建了专业知识库和推理数据集。
提出ESC-RL,通过证据感知奖励和自校正偏好学习增强放射报告生成。
SocialMirror利用语义和几何信息,从单目视频重建多人交互的3D人体网格。
提出MM-Doc-R1框架,利用多轮强化学习和SPO算法解决长文档视觉问答问题。
提出SceneCritic,一种基于符号的室内场景布局评估器,优于VLM。
rDPO通过实例Rubric优化视觉偏好,提升多模态任务中模型的细粒度推理能力。
研究了CT enterography中视觉-语言模型的最佳表征选择,并提出了实用指导。
PAL平台将讲座视频转化为互动学习体验,实现个性化和实时自适应的学习。
GlotOCR Bench评估OCR模型在100多种Unicode脚本上的泛化能力,发现现有模型在少数脚本外表现不佳。
提出P-FIN网络,通过概率特征插补和不确定性感知的联邦聚合,解决多模态联邦学习中的模态异质性问题。
通过自监督视觉任务增强视觉指令调优,提升MLLM的细粒度视觉推理能力。
Pi-HOC提出了一种单次、实例感知的3D人-物交互接触预测框架,提高了准确性和效率。
P$^2$通过语言化视觉工具输出,显著提升多模态大模型视觉推理能力。
提出了针对视觉语言模型的物理可部署多模态语义照明攻击,揭示了其在物理世界中的脆弱性。
DPC-VQA通过解耦感知和校准,高效地将预训练MLLM应用于视频质量评估,降低了训练成本。
DocSeeker通过结构化流程和证据引导提升MLLM在长文档理解中的表现,解决了信噪比低和监督稀疏问题。
CLASP通过类自适应层融合和双阶段剪枝,有效减少多模态大语言模型中的视觉token冗余。
AffectAgent通过多智能体协同、检索增强,提升LLM在多模态情感识别中的性能。
MISID是一个多模态、多轮次的意图识别数据集,用于解决复杂战略欺骗游戏中意图识别的挑战。
论文构建多尺度股票K线图数据集,评估VLMs在股票预测中的能力,发现其存在局限。
PromptEcho利用冻结VLM的token级交叉熵损失,为文本到图像的强化学习提供免标注的奖励信号。
论文提出听觉深度伪造检测任务,构建数据集ListenForge,并提出MANet模型,用于检测听觉伪造视频。
GeoAlign通过动态聚合多层几何特征,提升MLLM的空间推理能力,达到SOTA。
提出一种用于动态光照环境中时序光照贴图的神经动态GI压缩技术。
提出MemJack框架,利用视觉语义进行多模态大模型的越狱攻击,并发布大规模攻击数据集MemJack-Bench。
提出CAMFusion模型,通过交叉注意力融合多视角视觉-语言嵌入,提升3D场景理解性能。
提出MODIX,一种免训练的多模态信息驱动位置索引缩放方法,提升VLM的多模态推理能力。
EBMC模型通过增强弱模态、平衡模态贡献和信任度蒸馏,提升多模态情感分析的性能和鲁棒性。
NTIRE 2026 RAIM挑战赛专注于利用MLLM进行专业图像质量评估。
针对MLLM细粒度视觉感知弱点,提出变分信息流框架VIF,提升模型对细微视觉信息的关注。
SEATrack是一种高效多模态跟踪器,通过对齐模态特征和高效融合实现性能与效率的平衡。
该论文提出了一种基于Elastic Net正则化和Gabor字典的心音信号分类方法,并利用深度学习模型进行验证。
IAD-Unify提出一种统一的工业异常检测框架,实现分割、理解和生成三项任务。
提出Decoding by Perturbation (DeP)框架,通过文本扰动缓解多模态大语言模型的幻觉问题。
提出一种双模态锚点引导的测试时提示调优框架,提升视觉-语言模型在分布偏移下的性能。
Pair2Scene提出了一种基于局部对象关系学习的程序化室内场景生成框架。
OmniShow提出了一种统一多模态条件的人与物交互视频生成框架,性能优异。
提出了一种预算感知的不确定性驱动的放疗分割QA框架,用于指导人工审核。
提出了LottieGPT,用于生成可编辑的矢量动画,并构建了大规模的Lottie动画数据集。
综述LMM在物体中心视觉方面的进展,涉及理解、分割、编辑和生成。
StarVLA-α旨在简化VLA系统,通过最小化复杂性实现强大的机器人控制性能,并作为VLA研究的基准。
提出了一个基于视觉-语言对齐潜在空间的Grounded World Model,用于语义泛化的规划。
论文探索利用深度学习进行视频中矛盾/犹豫情绪识别,应用于个性化数字健康干预。
提出了一种基于Mamba的多模态网络,用于爆炸诱导的快速结构损伤评估。
LARY基准测试评估了视觉潜在动作表征在机器人控制中的泛化能力。
AffordSim是一个基于仿真的机器人操作数据生成框架,专注于物体功能性的交互任务。
UNIGEOCLIP提出了一种统一的多模态对比学习框架,用于对齐地理空间数据,提升跨模态检索和推理能力。
GazeVaLM是一个用于评估AI生成X光临床真实性的多观察者眼动追踪基准数据集。
CArtBench是一个评估VLMs在理解中国艺术品方面的基准测试。
POINTS-Long提出了一种双模态MLLM,通过动态视觉token缩放,提升长视频理解效率。
提出RationalRewards模型,通过推理奖励提升视觉生成效果,无需参数更新即可优化生成结果。
该论文提出了一种统一的几何形式化语言用于解析平面和立体几何,并构建了大规模数据集GDP-29K。
研究发现多模态大语言模型评估存在模型偏好,提出 Philautia-Eval 并设计 Pomms 模型缓解偏见。
提出GeomPrompt,通过RGB图像合成几何提示,提升RGB-D语义分割在深度缺失/退化情况下的性能。
AdvFLYP通过模拟CLIP预训练方式进行对抗微调,提升视觉-语言模型的零样本对抗鲁棒性。
DA-PTQ通过降低量化误差累积,实现了在资源受限机器人上高效部署VLA模型。
构建多模态实时交流分析系统,用于自适应VR降级训练,并应用于执法领域。
论文研究了基于个性化生理信号的驾驶员状态非侵入式建模,提升自动驾驶安全性。
CLAY提出一种文本条件视觉相似度调制方法,实现高效且多条件图像检索。
提出TAG-Head,一种轻量级时空图模块,提升RGB视频细粒度动作识别性能,达到SOTA水平。
通过优化推理阶段的对齐方式,提升双编码器视觉语言模型在组合性任务上的泛化能力。
论文提出了一种人为区域适应范式,优化多模态模型在特定区域的文化相关性,同时保持全局泛化能力。
该论文研究通过激活控制使XAI更具操作性,并探讨其在视觉模型调试中的应用。
提出LangSCD框架,利用视觉-语言模型进行场景变化检测,并构建了多类别变化标注的数据集NYC-CD。
针对视频语言模型时序推理能力下降问题,提出MERIT方法进行层级选择性模型融合,有效恢复时序推理能力。
分析视觉语言模型(VLM)在个性化图像美学评估(PIAA)中的表征能力,并用于轻量级个性化。
提出一种多阶段框架,利用LLM生成动态摘要,提升多模态抑郁症检测的准确性和可解释性。
PaperScope是一个多模态、多文档的AI论文深度研究基准。
该论文全面回顾了基于多模态大语言模型(MLLMs)的视频翻译技术,并提出了三角色分类法。
Dialectic-Med通过多智能体对抗辩论,显著缓解医疗多模态大模型诊断中的幻觉问题。
提出Multi-Stream Scene Script范式,解耦视频信息并显式关联,提升视频理解和生成效果。
提出一种基于类别级协作知识挖掘的自适应开放集目标检测方法。
论文揭示了多模态MoE模型在视觉推理中存在的“只见其形,不见其意”问题,并提出了路由干扰假设。
该论文提出了一个多粒度文本到音视频生成评测基准AVGen-Bench,揭示了现有模型在语义可靠性方面的不足。
OpenVLThinkerV2是一个通用的多模态推理模型,通过改进的强化学习方法,在多领域视觉任务上表现出色。
提出了一种基于元学习的无需训练的跨个体脑信号视觉解码方法。
RewardFlow通过优化奖励函数,引导预训练扩散模型生成图像,实现高质量图像编辑和生成。
提出UniversalVTG,通过跨数据集预训练和Query Unifier,实现轻量级且通用的视频时序定位模型。
提出C-Score用于评估医学图像分类模型解释的一致性,并发现AUC和一致性之间的分离现象。
提出一种基于VLM和NLP的语义scanpath相似度框架,弥补了传统方法忽略语义信息的不足。
LAMP通过提升图像编辑为3D先验,实现开放世界操作中的零样本泛化。
提出基于持久性的数据增强方法,利用Morse-Smale复形编码局部梯度流区域的层级演化,提升神经网络性能。
提出一种无需训练的视觉语言模型证据检索方法,利用熵梯度定位关键视觉区域。
论文改进了基于条件神经过程的多模态动作预测模型,提升了时间信息的表征能力。
SyncBreaker提出了一种多模态对抗攻击框架,旨在破坏语音驱动的头部生成模型的同步性。
PokeGym是一个视觉驱动的长程视觉语言模型基准,旨在评估3D具身环境中的VLM性能。
InstAP通过实例感知的预训练框架,提升视觉-语言模型在时空理解上的细粒度推理能力。
医学多模态大语言模型在图像分类任务中表现不如传统模型,论文分析了其性能退化的原因。
提出Fundus-R1模型,利用公共数据训练增强推理的眼底影像多模态大语言模型。
评估视觉语言模型在动作质量评估中的性能,发现现有模型表现不佳,存在偏差。
提出Orion-Lite,通过知识蒸馏将LLM推理能力赋予高效的视觉驾驶模型,并超越VLA教师模型。
提出双分支多模态框架DBMF,提升医学图像领域OOD检测性能,显著优于现有方法。
EditCaption通过两阶段训练提升VLM生成图像编辑指令的质量,更贴合人类意图。
提出PaveGPT,通过领域特定指令调优,实现全面的自动化路面状况评估。
提出了SciFigDetect,一个用于检测AI生成科学图像的新基准,揭示了现有检测方法的不足。
MedVR通过强化学习实现医学VLM的免标注视觉推理,提升性能与鲁棒性。
AT-ADD挑战赛旨在推动通用音频深度伪造检测技术的发展,弥补现有方法对非语音音频的不足。
提出T-Gated Adapter,利用相邻切片信息提升医学影像分割中VLM的性能。
论文提出了用于可解释加密流量分析的多模态推理框架,并构建了新的基准数据集BGTD。
PolySLGen提出一个在线多模态多人交互反应生成框架,提升了社交场景的真实感。
Uni-ViGU通过扩展视频生成器,统一视频生成和理解任务,实现了有竞争力的性能。
Tempo利用SVLM高效压缩长视频,实现意图驱动的长视频理解。
Revise框架通过模拟OCR错误进行纠正,提升文档结构化表示和下游任务性能。
OV-Stitcher通过拼接子图像特征,实现全局上下文感知的免训练开放词汇语义分割。
提出基于扩散模型的非自回归视频字幕生成框架DiffVC,提高生成速度和质量。
AtlasOCR是首个开源Darija OCR模型,通过微调VLM实现,在Darija和标准阿拉伯语OCR任务上表现出色。
Brain3D提出一种多模态架构,通过脑电信号重建3D视觉表示,实现脑驱动的3D内容生成。
Pearl通过预测嵌入对齐,在隐空间学习工具使用,提升多模态推理,避免显式工具调用。
EEG2Vision通过多模态方法,提升低分辨率脑电信号重建视觉图像的质量。
3DrawAgent利用LLM和几何反馈生成3D草图,通过对比学习提升3D感知能力,无需参数更新。
PrivFedTalk提出了一种隐私保护的联邦扩散框架,用于个性化说话头生成。
SearchAD:自动驾驶大规模稀有图像检索数据集,聚焦长尾和语义检索。
论文为结直肠肝转移患者的未来肝余体积分割建立基准和评估方法。
提出了一种意图感知的图表检索框架,通过理解用户意图,提高图表检索质量,辅助图表创作。
提出DSCA方法,通过动态子空间概念对齐实现VLM的终身知识编辑,有效避免灾难性遗忘。
WorldMAP利用世界模型生成监督信号,提升视觉-语言导航轨迹预测性能。
提出了MONETA多模态行业分类基准数据集,利用多模态大语言模型进行行业分类。
MoRight提出了一种解耦运动建模框架,用于生成运动控制视频,实现相机视角和物体运动的解耦控制和因果关系建模。
提出Appear2Meaning跨文化基准,评估VLM在图像中推理结构化文化元数据的能力。
OpenSpatial提供了一个开源空间数据引擎,并构建了大规模高质量数据集,显著提升空间推理能力。
研究不同深度学习模型人脸嵌入的兼容性,发现线性映射可显著提升跨模型人脸识别。
BATON数据集用于预测驾驶自动化系统中人机控制权转移,并分析不同模态数据对预测的影响。
提出双流特征解耦的LDC方法,实现高压缩比、高吞吐量、低延迟和低内存占用。
解决多模态检索中查询失配问题,提出基于强化学习的查询对齐方法。
提出一种基于正交子空间分解的多模态融合方法,区分MRI和PET的互补信息。
论文提出了一种基于决策的智能体,用于知识型视觉问答,并取得了SOTA效果。
USCNet通过Transformer融合CT图像和EHR数据,实现肾结石的精准术前分类。
提出一种实用性保护的去识别流程,用于跨医院放射影像数据共享,提升AI模型性能并保护隐私。
提出一种基于Transformer的多模态车辆轨迹预测模型,无需图结构或显式意图标签。
提出了SurFITR数据集,用于提升监控图像伪造检测和定位的性能。
KITE利用关键帧索引和符号化证据,提升VLM在机器人故障分析中的性能。
提出UILoop范式,通过显式学习UI元素信息,提升MLLM在GUI推理任务中的性能。
利用可穿戴设备数据和多示例学习估计老年肿瘤患者的心理压力。
使用多模态可穿戴设备数据和多示例学习预测老年肿瘤患者的虚弱程度。
该论文揭示了多模态大语言模型在内容审核中易受对抗性走私攻击的漏洞。
LungCURE提出,针对肺癌诊疗,构建多模态临床推理基准,并提出LCAgent框架。
Q-Zoom通过query感知的自适应高分辨率感知框架,提升MLLM的推理效率和精度。
XR-CareerAssist结合XR和多模态AI,打造个性化沉浸式职业指导平台。
提出能量正则化空间掩码(ERSM)方法,提升视觉模型的鲁棒性和可解释性。
提出一种基于FDG-PET/CT影像和时间信息的深度学习框架,用于预测非小细胞肺癌患者的生存期。
通过揭示语音大模型中的冗余,提出Affinity Pooling方法压缩语音表征,提高推理效率。
RefineAnything提出了一种基于扩散模型的区域特异性图像修复方法,专注于细节恢复和背景保持。
PASS框架利用VLM引导深度展开网络,实现个性化快速MRI,提升图像质量和下游诊断任务。
STQuant提出了一种时空自适应量化框架,降低大模型训练中优化器状态的内存占用,同时保持模型质量。
Fast-dVLM通过直接转换自回归VLM实现高效的块扩散视觉语言模型,显著提升推理速度。
提出了一种基于MLLM的训练自由的声音源定位框架GAR,通过生成、分析和精炼实现精确声音定位。
提出一种全局视频引导的多模态翻译框架,提升长视频翻译效果。
该论文提出MAPO方法,通过对齐文本推理和视觉动作,提升MLLM在视觉推理任务中的性能。
FlowInOne提出了一种统一的多模态生成框架,将所有输入转化为视觉提示,实现图像输入输出的流程匹配。
HaloProbe通过贝叶斯框架检测并缓解视觉-语言模型中的物体幻觉问题,并提出了一种非侵入式的缓解方法。
提出MMEmb-R1,通过自适应推理提升多模态嵌入效果,降低推理开销并优化延迟。
提出一个合成医生-病人对话数据集用于长文本音频摘要,解决数据稀缺和评估难题。
提出轻量级多模态适配框架,将RGB预训练VLM应用于无人机热成像物种识别和栖息地环境解释。
该论文提出了一种用于科学图形程序合成的自洽强化学习框架,并构建了高质量数据集和基准。
Graph-PiT通过图结构先验提升基于部件的图像合成的结构一致性。
CoStream利用视频编码信息优化视频流分析,提升吞吐并降低GPU计算成本。
CLIP模型存在中心偏见,忽略图像边缘物体。通过分析和干预注意力机制,可以缓解这一问题。
提出了一种基于多模态数据和集成学习的滑坡检测框架,提高了检测精度。
提出MoME和HTL框架,通过模态专家混合和整体token学习提升驾驶员行为识别的细粒度多模态理解能力。
利用图像编辑基础模型,通过少量数据有效去除CT图像中的金属伪影。
该论文研究了视觉-语言模型理解多模态双关语的能力,并提出了数据集和改进方法。
AICA-Bench基准测试VLMs在情感图像内容分析的能力,并提出GAT Prompting框架。
HybridKV通过混合压缩策略,显著降低多模态大模型推理时KV缓存的内存占用,提升推理速度。
PRISM通过共享原型空间进行多模态情感分析,并动态调整模态权重,提升情感预测精度。
提出了一种新型的文本到图像模型的恶意利用方式,可生成包含有害文本的图像。
提出一种基于视觉语言模型的全自动前端代码生成迭代优化框架,显著提高代码质量。
发现多模态对比学习中Symile的脆弱性,提出Gated Symile以提升在不可靠模态下的鲁棒性。
提出了一种直接优化deletion和insertion指标的学习排序视觉归因方法,提升了Transformer模型的可解释性。
WikiSeeker通过多模态检索和重定义VLM角色,提升知识型视觉问答性能,达到SOTA。
提出一种隐蔽且可调的文本引导多模态预训练模型后门攻击方法,提高了攻击的实用性和隐蔽性。
提出PDMP策略,通过性能主导模态的优先级排序,改善多模态学习的优化效果。
BADAS-2.0在碰撞预测、长尾数据处理、边缘部署和可解释性方面有所提升。
SVC 2026挑战赛旨在推动鲁棒且泛化的细微视觉信号表示学习,包含跨域多模态欺骗检测和远程生理测量两项任务。
MedLayBench-V是一个用于医学视觉语言模型专家-患者语义对齐的大规模基准数据集。
提出QA-MoE模型,利用质量感知的专家混合方法,提升多模态情感分析在噪声环境下的鲁棒性。
提出了GUIDE框架,通过多层几何先验注入提高MLLM空间感知能力。
CRFT提出了一种基于特征流学习的跨模态图像配准统一框架,实现了高精度和鲁棒性。
提出Smoke-GS框架,结合视觉先验和3D高斯溅射,实现烟雾场景重建和新视角合成。
ASTRAL利用多模态LLM进行CPS架构重建和安全风险评估,提高网络风险管理决策。
SnapFlow通过自蒸馏将多步去噪压缩为单步,加速Flow-Matching VLA模型推理。
SGANet通过语义和几何对齐,提升多模态多视角异常检测性能。
DetailVerifyBench是一个用于长图像描述中密集幻觉定位的基准测试,包含高质量图像和token级别的幻觉标注。
提出STGR框架,结合LLM和视觉基础模型,用于语言引导的肺部筛查,效果显著。
提出了一种基于重要性和多样性的视觉token选择方法ID-Selection,用于加速LVLM推理。
提出DAERT框架,通过多样性红队测试发现VLA模型在语言理解上的脆弱性,提高其安全性。
针对模态缺失问题,提出Purify-then-Align框架,通过元学习和知识蒸馏提升单模态模型的鲁棒性。
针对Composed Image Retrieval过拟合问题,提出权重正则化微调网络WRF4CIR,提升泛化能力。
针对多模态情感分析中模态缺失问题,提出基于Prompt的缺失模态自适应框架,提升模型鲁棒性。
通过多智能体推理,复用小模型的推理token,提升大模型在视觉语言任务中的效率。
发现预训练扩散模型内在的图像修复能力,通过学习Prompt嵌入来实现高效修复。
Vero开源了一系列视觉语言模型,通过大规模RL数据和任务路由奖励,在视觉推理任务上取得优异表现。
HI-MoE提出了一种分层实例条件混合专家模型用于目标检测,尤其提升了小目标检测性能。
ClickAIXR提出了一种基于设备端VLM的XR对象交互框架,通过点击选择对象进行多模态问答。
DIRECT框架通过层级多智能体规划实现高质量视频混剪,优化视觉和听觉连贯性。
针对自动驾驶微调模型灾难性遗忘问题,提出Drive Expert Adapter (DEA) 框架,有效缓解了知识退化,提升了驾驶任务性能。
提出了一种基于一致性模型的迭代细化框架,用于生成人-物-场景交互。
通过降级图像和结构化提示,DDP框架提升了VQA模型在复杂视觉基准上的推理准确性。
E-VLA通过事件相机增强VLA模型,提升其在光线不足和模糊场景下的操作鲁棒性。
AnyUser通过草图和语言指令控制机器人,无需预先建模,提升用户交互性和任务完成效率。
提出MMF-BEV,一种基于混合注意力机制的雷达-相机BEV融合框架,用于自动驾驶3D目标检测。
CLEAR框架通过解耦生成与推理,提升统一多模态模型在降质图像理解上的鲁棒性。
提出Synthesis4AD,利用合成异常数据提升3D异常检测性能,解决异常样本稀缺问题。
提出Flow Divergence Sampler (FDS),一种无训练的流程匹配优化框架,通过散度引导采样提高生成质量。
InCTRLv2通过双分支框架和视觉-文本语义先验,实现了少样本通用异常检测与分割的SOTA性能。
提出一种针对自动驾驶VLM的隐蔽多模态后门攻击,利用涂鸦和跨语言触发器,难以检测。
针对多层不完全多模态EHR,提出HealthPoint框架用于住院死亡率预测,实现SOTA性能。
该论文提出了一种基于物理特征的跨模态合成检测方法,提升了AIGC图像检测的鲁棒性和准确性。
Firebolt-VL提出了一种高效的视觉语言模型,通过LFM解码器和Token-Grid关联模块提升性能。
该论文提出了一种基于视觉提示和多模态LLM的零样本越野环境可行驶区域推理方法。
提出TILA框架,通过时序反演增强医学影像模型对时间变化的敏感性,提升疾病进展分类和时序嵌入对齐。
StableTTA通过提升集成稳定性,实现免训练测试时自适应,显著提高ImageNet-1K图像分类精度。
利用多模态大语言模型预测学习者在教育视频中的交互行为,并提供可解释性。
ModMap通过跨模态特征映射和跨视角调制,在3D异常检测中取得了领先性能。
提出可控视觉表征,通过早期融合文本信息到视觉编码器中,实现对图像特征的精细控制。
提出SimpleStream基线,仅用滑动窗口即可媲美复杂流视频理解模型,揭示感知-记忆权衡。
提出VOID框架,利用因果推理和视频扩散模型实现物理上合理的视频对象移除。
Omni123通过统一文本到2D和3D生成,利用2D数据提升3D建模效果。
提出一种利用冻结的预训练模型进行安全文本到图像生成的推理时能量引导框架。
SPAR提出了一种单次Any-Resolution ViT,通过知识蒸馏实现高效的高分辨率开放词汇分割。
提出UAV-Track VLA模型,用于提升无人机在复杂场景下的视觉-语言-动作跟踪能力。
研究了多模态和对话式AI对视觉密集型STEM领域学习效果的影响。
LEO利用图注意力网络融合多传感器数据,实现动态目标的形状和轨迹估计。
UniDriveVLA通过专家解耦解决自动驾驶中感知和推理的冲突,实现统一的视觉-语言-动作模型。
针对多模态推荐系统中数据难删除问题,提出TRU框架,实现有针对性的逆向更新,提升遗忘效果。
提出了Cross-Modal Latent Filter (CMLF)模型,用于机器人视觉-触觉融合的物理属性估计。
CASHG通过显式建模字符间连接,生成风格一致的在线手写体句子。
LatentUM通过共享潜在空间统一多模态表征,实现高效且无偏的跨模态推理和生成。
GroundVTS通过查询引导的视觉Token采样,提升视频大语言模型在时序定位任务上的性能。
PLUME提出一种基于隐变量推理的通用多模态嵌入框架,提升推理效率。
提出InCoM-Net,结合视觉语言模型和目标检测器,提升人-物交互检测性能。
COMPASS提出了一种基于代理令牌和共享空间的多模态融合框架,有效解决了模态缺失问题。
提出了Jagle,一个大规模日语多模态后训练数据集,用于提升VLM在日语任务上的性能。
研究高斯扩散模型在离散数据生成上失效的原因,并提出了缓解方法。
提出了LinkS$^2$Bench,用于评估VLM在无人机-卫星动态跨视角空间智能方面的能力。
MLLM视觉注意力具有惯性,阻碍认知推理,提出IVE方法打破惯性并提升认知能力。
Curia-2通过优化预训练策略和扩展模型规模,显著提升了放射影像Foundation Models的性能。
论文提出了MyEgo数据集,用于评估MLLM在理解和推理第一人称视角视频中自我相关信息的能力。
使用nnU-Net自动分割MRI前列腺,实现高精度和泛化性,优于通用分割方法。
提出了一个针对幼儿教育图像描述的大规模数据集和混合训练框架,提升了专业对象描述的准确性。
研究了多模态Transformer在心衰患者短期死亡率预测中的应用,并对比了LLM的效果。
SURE模型通过协同不确定性感知推理,提升对话场景下多模态情感识别的鲁棒性和上下文建模能力。
论文提出KnowMVG框架,通过知识引导的空间提示增强医学图像视觉定位的精确性。
利用网络视频自动生成3D场景理解训练数据,提升模型性能。
ProVG通过解耦语言表达式,动态调节视觉注意力,实现遥感图像视觉定位的精度提升。
VLM在几何变换下表现脆弱,缺乏鲁棒的空间不变性和等变性,空间推理能力不足。
提出了一种感知驱动的策略优化PGPO,提升LVLM在多模态推理任务中的性能,通过动态调整token级别的优势函数。
提出了 Ultrasound-CLIP 模型,用于提升超声图像文本理解能力,并在相关任务上取得了SOTA。
提出Causal Scene Narration方法,通过因果场景叙述和运行时安全监督,提升自动驾驶VLA模型的性能。
研究多模态LLM识别可视化谎言的能力,并分析其潜在原因和意图。
开发了Florence-2模型的ROS 2封装,支持多种交互模式,方便机器人系统集成视觉-语言模型。
利用AI分析街景图像进行房产级洪水风险评估,并提出可行性方法。
MoA-DepthCLIP利用轻量级混合适配器和选择性微调,高效地将CLIP知识迁移到单目深度估计任务。
ProOOD通过原型引导,提升3D语义占据预测的OOD检测能力,尤其针对长尾类数据。
PDA框架通过文本增强提升视觉-语言模型在对抗图像攻击下的鲁棒性,无需训练。
提出了一种基于信息瓶颈理论的查询条件式证据关键帧采样方法,提升MLLM在长视频理解任务上的性能。
分析YouTube Shorts上国家资助媒体对以哈冲突的多模态报道,揭示情绪和视觉线索。
ACT通过自适应上下文整合,有效减少LVLM的幻觉问题,提升视觉-语言对齐效果。
YieldSAT数据集发布,用于高分辨率农作物产量预测,包含多模态数据和深度学习模型。
DANCEMATCH提出了一种端到端舞蹈检索框架,通过量化运动表示实现高效舞蹈指纹识别。
该论文系统评估了VLM在跨图示装配指令对齐任务中的表现,并分析了影响因素。
ProCap通过解耦物理场景和投影内容,提升空间增强现实中视觉语言模型理解能力,并提出RGBP数据集。
论文提出JAMMEval,一个经过精细化处理的日语VLM评测基准,提升评测可靠性。
PixelPrune通过预测编码压缩,在ViT编码器前剪枝冗余像素块,加速VLM推理和训练。
LinguDistill通过知识蒸馏恢复视觉语言模型在多模态适应中损失的语言能力,无需增加额外模块。
提出CLeaRS基准,评估遥感视觉语言模型在持续学习中的灾难性遗忘问题,并分析现有方法的局限性。
多模态大语言模型在空间一致性推理上表现不佳,无法识别3D空间矛盾。
提出SurgSTU-Pipeline自动生成手术视频数据集,提升VLM对手术视频时空理解能力。
提出了一种开放式可穿戴人体活动理解方法,通过自然语言描述对齐传感器数据。
提出一种基于注意力的视觉语言模型(LVLM)token剪枝方法,旨在提高效率,降低计算成本。
该论文提出了一种基于Mamba的OCR架构,并验证了其在效率和精度上优于Transformer和BiLSTM。
TTA-Vid利用测试时强化学习,无需标注数据即可使视频理解模型适应新领域。
CL-VISTA是为Video-LLM持续学习定制的基准,揭示了性能、效率和内存之间的权衡。
提出KG-CMI框架,融合知识图谱和Mamba交互,提升医学VQA性能,并实现自由形式答案生成。
HarassGuard利用视觉-语言模型检测社交VR中的骚扰行为,保护用户隐私。
通过InterSHAP量化多模态融合中信号交互,发现性能提升源于互补信号聚合而非协同作用。
研究使用三模态深度学习(病理、基因、MRI)预测脑胶质瘤患者生存期,初步验证了MRI的潜在价值。
提出MAGNet,利用多尺度自适应图注意力网络融合结构和功能脑连接,提升认知功能预测。
SurgRec提出了一个可扩展和可复现的手术视频预训练框架,提升了手术视频理解能力。
SurgTEMP通过分层视觉记忆和SCP训练,提升了手术视频问答在时间语义理解和多任务评估上的性能。
EC-Bench:长视频计数基准,挑战现有MLLM在长时间序列推理上的能力。
该论文研究了分割不确定性聚合方法对下游任务的影响,并提出了空间感知的聚合策略。
提出了用于评估MLLM交错生成Agentic Tool Planning能力的ATP-Bench基准,揭示了模型在连贯规划和工具使用上的不足。
提出ViTAS模型,通过选择性关注病灶区域图像,显著提升了多模态放射学报告摘要的生成效果。
DIAL通过解耦意图和动作,利用潜在世界建模,提升VLA模型性能并减少数据依赖。
该论文利用多模态机器学习预测四种癌症的转移风险,提升预测准确率。
针对公共安全,提出一种结合骨骼动作分析和视觉-语言模型的混合边缘行为检测系统。
论文提出了TSHA基准,用于评估视觉语言模型在可信安全风险评估中的能力,解决了现有基准的局限性。
该论文提出了评估多模态主动学习陷阱的框架,揭示了现有方法在模态平衡上的不足。
该论文利用信息分解方法分析LVLM的决策过程,揭示其多模态融合和单模态先验依赖。
提出一种新型边缘相机跨模态检索架构,通过新颖性过滤提升检索性能。
提出了大规模多传感器遥感图像-文本数据集BigEarthNet.txt,用于提升遥感领域视觉-语言模型性能。
提出QUAD框架,通过量化和知识蒸馏实现多LoRA共享模型在边缘设备上的高效部署。
ConRad通过强化学习微调医学LVLM,生成校准的置信度表达,提升放射报告生成的安全性。
M-MiniGPT4通过混合数据和多语言对齐训练,提升了多语言视觉语言理解能力,并在MMMU上取得了优秀表现。
提出了一种基于多模态上下文学习的少样本手写体风格迁移方法,无需参数更新即可实现。
SeGPruner通过语义和几何引导的token修剪,提升3D问答的效率,并保持性能。
提出了一种工具引导的推理框架,解决VLM在视觉错觉上的系统性偏差问题。
A$^2$BFR通过属性感知学习和语义双重训练,实现了高保真和可控的盲脸修复。
研究多模态模型在身份证件PAD中的应用,但实验结果表明效果不佳。
研究针对多模态大语言模型(MLLM)的不可察觉视觉提示注入攻击,提升攻击的有效性和隐蔽性。
AGFT通过对齐视觉特征和文本嵌入,提升视觉-语言模型在零样本对抗攻击下的鲁棒性。
提出QENO,一种混合量子-经典时空预测框架,用于三维云场预测,效果优于现有模型。
提出一种幻觉感知的中间表示编辑框架,有效且高效地消除多模态大模型的幻觉问题。
论文提出TriDerm框架,利用专家知识评估多模态慢性伤口嵌入,提升RDEB疾病相似病例检索效果。
提出一种新颖的上下文空间排斥方法,用于提升Diffusion Transformer的图像生成多样性,同时保持图像质量和语义一致性。
提出VeoPlace,利用视觉语言模型指导芯片布局,显著提升芯片设计性能。
SOLE-R1利用视频语言模型进行机器人强化学习,无需人工奖励。
AdaptToken提出一种基于熵的自适应token选择框架,用于提升MLLM长视频理解能力。
PRCO通过双角色强化学习,解耦感知与推理优化,提升多模态推理性能。
ResAdapt通过自适应分辨率分配,提升了多模态大模型在低视觉预算下的推理效率。
Unsafe2Safe提出了一种自动化的图像匿名化流程,保证隐私的同时维持图像效用。
ChartCynics框架通过双路径和Agent技术,显著提升了模型在欺骗性图表问答中的鲁棒性。
提出一种X形稀疏像素攻击(XSPA),用于评估视觉语言模型在跨任务上的鲁棒性。
提出StreamingVLA模型,通过并行VLA阶段,减少延迟和执行停顿,提高效率。
DiCoOp通过对抗训练扩展CoOp,学习领域不变的视觉语言模型Prompt,提升领域泛化能力。
Hydra将文档检索和生成统一到单个视觉-语言模型中,降低了内存和复杂度。
提出MarkushGrapher-2,用于端到端多模态识别化学结构,性能优于现有方法。
提出一种结合轻量级伪影检测器和MLLM的AI生成图像检测框架,提升检测精度和泛化性。
提出一种基于漂移模型的MRI到CT合成方法,在骨盆CT图像合成上优于现有方法。
提出AceleradorSNN,一种基于SNN和动态ISP的FPGA加速的神经形态认知系统。
提出用于海事场景红外-可见光图像融合和分割的统一复原-感知学习框架。
EdgeDiT通过硬件感知优化,实现Diffusion Transformer在移动NPU上的高效图像生成。
临床VLM评估中,提示词框架(scaffold effect)会导致虚假的多模态性能提升,而非真正的信息融合。
首次系统评估大型音频语言模型(LALM)的成员推断攻击(MIA),并提出了避免虚假相关性的评估方法。
AutoCut是一个端到端的广告视频编辑框架,通过多模态分词和可控生成提高效率和降低成本。
提出SEA指标评估草图抽象效率,并构建了CommonSketch数据集。
论文提出一种加权集成学习方法,结合深度学习和传统机器学习模型,用于脑肿瘤MRI图像分类。
VistaGEN通过多视角视觉语言推理实现可控、一致的驾驶视频生成。
提出AmodalCG框架,利用多模态大语言模型指导残缺图像补全,提升了补全效果。
LIBERO-Para基准测试VLA模型在指令复述下的鲁棒性,发现性能显著下降,并提出PRIDE度量指标。
TwinMixing是一种轻量级多任务分割模型,专为自动驾驶环境下的车道线和可行驶区域分割设计。
EZPC通过将CLIP的预测与人类可理解的概念对齐,实现了零样本图像识别的可解释性。
PReD是首个电磁领域的多模态大模型,实现感知、识别、决策的智能闭环。
针对遥感图像-文本检索中噪声对应问题,提出鲁棒检索框架RRSITR,提升模型在噪声环境下的性能。
ORACAL利用异构多模图学习和因果推理,提升智能合约漏洞检测的准确性和可解释性。
针对医学图像视觉定位中奖励稀疏问题,提出基于性能感知的课程奖励调度框架MedLoc-R1。
AutoDrive-P3通过强化微调整合感知、预测和规划链式推理,提升端到端自动驾驶性能。
VERITAS框架将文档数字化重构为集成工作流,提升转录质量和下游应用。
提出了一种基于视觉-语言-世界-行动模型的自动驾驶方案,并构建了大规模指令驾驶数据集。
提出SlotVTG,通过轻量级slot adapter提升MLLM在视频时序定位任务中的泛化能力。
PackForcing通过分层KV-cache策略,实现短视频训练到长视频生成的高效迁移。
提出概念中心学习方法,提升对比视觉语言模型在组合性任务上的表现,同时保持零样本能力。
提出R-C2框架,通过跨模态循环一致性增强多模态推理,提高模型理解能力。
针对视频世界模型中动态物体遮挡问题,提出混合记忆和新数据集,实现更好的动态物体建模。
论文提出VISAGE框架,通过校准目标函数,减少多模态大语言模型中的幻觉问题。
提出一种基于自回归缩放的跨视角地理定位方法,无需对比学习,性能优于传统方法。
构建了大规模结肠镜视频数据集Colon-Bench,并评估了MLLM在该数据集上的性能。
LanteRn通过在LLM中引入紧凑的潜在视觉表征,提升了多模态推理中细粒度的视觉理解能力。
研究了MLLM在人脸验证任务中的性别和种族偏见,并进行了基准测试。
提出层级引导的多模态表示学习方法,用于解决生物分类推断问题,提升分类准确率。
提出了针对遥感图像高度感知能力的多模态大模型评估框架与基线模型。
该论文提出了一种多模态图像融合方法,用于眼科手术中的实时场景理解,提高了手术器械跟踪精度。
针对微服务事件管理中数据缺失问题,提出了一种鲁棒的自监督多模态融合框架ARMOR。
该论文比较了人类和视觉-语言模型在视觉故事叙事连贯性上的差异。
提出了一个羽毛球全场比赛密集标注数据集BFMD,并构建了基于VideoMAE的多模态字幕生成框架。
分析高光谱成像在自动驾驶中应用的挑战,并基于HSI-Drive数据集进行实验。
GridVAD提出了一种基于视觉-语言模型的无训练视频异常检测方法,利用空间推理生成像素级异常掩码。
该论文提出了一个大规模微视频假新闻基准和基于多智能体推理的检测框架,有效提升了假新闻的检测性能。
VideoWeaver是首个多模态多视角视频转换框架,用于具身智能体环境重构,实现视角一致性。
HiSpatial提出分层框架提升VLM的3D空间理解能力,并构建数据集和RGB-D VLM,在多个基准测试中达到SOTA。
针对本地视觉语言模型,论文提出双层侧信道攻击,泄露输入图像的几何信息和语义内容。
LaMP利用3D场景流作为运动先验,提升机器人操作任务中的视觉-语言-动作策略。
提出一种新型多模态数据集蒸馏框架PTM-ST,有效提升学生模型性能并降低存储开销。
提出可控的低光照图像增强框架CLE-RWKV,并构建了新的多光照数据集Light100。
论文提出了一种基于CSI-tuples和多模态学习的3D信道指纹构建框架,提高低空通信环境感知精度。
EagleNet通过细粒度关系学习和能量感知匹配,提升文本-视频检索性能。
提出TITAnD,通过将轨迹转换为高光谱图像,利用Transformer进行多月轨迹异常检测。
提出TANL方法,通过激活的负标签提升视觉-语言模型在OOD检测中的性能。
提出PCGR框架,利用概率概念图推理提升多模态错误信息检测的准确性和可解释性。
Photon通过自适应token压缩加速3D医学影像多模态大语言模型在视觉问答中的应用。
提出基于排序优化的视频文本对齐方法,并发现视觉编码器微调的重要性。
SAVe提出了一种自监督音视频深度伪造检测框架,利用视觉伪影和音视频错位。
AnyDoc框架通过大规模HTML/CSS数据合成和高度感知强化学习优化文档生成,效果显著。
提出一种基于莫尔干涉的公式化数据增强方法,提升图像分类模型的鲁棒性。
MSRL通过多阶段强化学习提升多模态奖励模型,解决标注数据不足问题,性能显著提升。
提出RL-MBA框架,解决多模态主动学习中模态平衡和难度感知问题,提高模型性能和公平性。
提出一种用于容错多模态表示学习的层特异性Lipschitz调制框架。
提出TAG,通过目标无关的指导来提升VLA模型在复杂场景下的目标定位准确性和鲁棒性。
该论文评估了视觉语言模型在图像质量评估任务中与人类感知的对齐程度,并分析了不同属性的影响。
提出VFIG,一个基于视觉语言模型的复杂图形矢量化方法,并构建了大规模数据集和评估基准。
POLY-SIM挑战赛旨在推动缺失模态和跨语言环境下多模态说话人识别的研究。
LensWalk通过让LLM自主控制视觉观察,提升了长视频理解的准确性、鲁棒性和可解释性。
CliPPER通过上下文视频语言预训练,提升手术视频事件识别的准确率。
开发了一种多语言AI系统,自动将文本映射为象形图,辅助特殊教育儿童的阅读理解。
提出一种跨模态原型对齐与混合方法,提升CLIP在少样本分类任务中的性能。
该论文提出VisionToM框架,通过干预视觉表征提升MLLM的视频理解ToM能力。
提出了一种结合视觉和听觉生物特征的多模态宠物重聚系统,提高了宠物重聚的成功率。
OmniWeaving旨在通过统一框架实现自由组合和推理的视频生成,并提出了评估基准。
VLAForge利用视觉-语言语义增强深度伪造视频检测的判别能力,优于现有方法。
综述医学图像分析中因果迁移学习方法,提升模型跨域泛化性和鲁棒性。
ViHOI利用2D图像先验指导3D人与物体交互生成,提升生成质量和泛化性。
GeoRouter提出了一种动态路由框架,利用LVLM为图像地理定位选择最优范式。
PP-OCRv5以5M参数媲美数十亿参数VLM,强调高质量数据在OCR中的重要性。
提出了一种神经符号系统,用于可解释的多模态生理信号融合,以检测人类疲劳。
提出GameplayQA基准,用于评估多智能体3D环境中多模态LLM的感知和推理能力。
Le MuMo JEPA提出了一种多模态自监督学习框架,利用融合tokens学习统一表征。
PaddleOCR-VL通过粗到细视觉处理,提升文档解析效率和性能,关注关键区域,抑制冗余信息。
AMIF提出一种可授权的医学图像融合模型,内置认证机制,保护知识产权,防止模型泄露。
提出了一种记忆增强的视觉-语言智能体,以解决跨视角的对象描述不一致问题。
RVLM通过迭代生成-执行循环和自适应深度,提升医疗AI的可审计性和效率。
提出RefReward-SR,利用LR条件奖励模型优化超分辨率重建,更符合人类感知偏好。
LVLMs可通过prompt conditioning和head选择提升zero-shot和few-shot图像分类性能,缩小与CLIP的差距。
提出了一种EEG条件下的fMRI重建框架,实现高分辨率、高时间一致性的动态脑活动建模。
提出HeROD框架,通过注入启发式推理先验,提升数据稀缺场景下指代表对象检测的效率。
研究双形式注意力机制在多模卫星图像时间序列土地监测中的应用,提升效率。
MLLM更强的语义理解能力带来比扩散模型更大的安全风险,包括不安全内容生成和假图片合成。
PosterIQ是一个海报理解与生成的设计驱动型基准,涵盖海报的结构、排版和语义意图。
AD-Reasoning提出了一种基于多模态信息的、结合NIA-AA指南的阿尔茨海默病诊断框架,提高了诊断准确性和透明性。
论文通过纠正视觉语言模型中的注意力失衡来减轻对象幻觉问题。
针对深度伪造检测中优化崩溃问题,提出CoRIT模型,提升跨域泛化能力。
提出了一种基于异构注意力调制(HAM)的免训练扩散模型风格迁移方法。
该论文提出了一种训练框架,用于缓解语音LLM中上下文暴露偏差问题,提高模型在真实场景下的鲁棒性。
论文提出一种基于神经符号推理的表格理解方法TWT,提升多模态表格数据理解能力。
MedObvious基准测试揭示了医学VLM在输入验证方面存在的安全隐患,模型易产生幻觉并缺乏鲁棒性。
提出UniGRPO,用于联合优化推理和图像生成策略,提升图像生成质量,为多轮交互模型提供基线。
VISOR通过动态稀疏视觉-语言交互提升VLLM效率,在不损失性能的前提下降低计算成本。
AgentRVOS利用SAM3和MLLM构建无训练Agent框架,通过对象轨迹推理实现视频对象分割。
VTAM通过融合视觉和触觉信息,提升了机器人在复杂物理交互任务中的性能。
UniFunc3D利用多模态大语言模型,提出了一种统一的、无训练的3D场景功能分割框架。
InverFill通过一步反演注入语义信息,提升少步扩散模型图像修复质量。
DetPO提出了一种黑盒prompt优化方法,提升MLLM在少样本目标检测任务上的性能。
提出3DCity-LLM框架,用于3D城市尺度视觉-语言感知与理解,并构建大规模数据集。
论文提出TRACE方法,通过文本表示引导MLLM进行3D空间推理,提升视频理解能力。
SIMART通过MLLM将静态网格分解为可用于物理模拟的铰接资产。
提出了一种毫米波雷达材料分类方法,并分析了几何偏移对分类性能的影响。
ARGENT提出了一种新的双曲视觉语言模型,通过自适应损失和角度概率评估提升层级表征能力。
Ker-VLJEPA-3B通过课程学习框架,提升了3D CT报告生成的准确性和效果。
该论文评估了多模态大语言模型在理解 Meme 中隐喻意义的能力,发现模型存在偏见且解释不忠实。
论文提出了一种基于人类视觉注意力的机器人操作学习框架,提升了机器人操作的性能和可解释性。
论文提出了一种基于注视正则化的VLM框架,用于提升以自我为中心的行为理解和未来事件预测。
ViKey通过视觉提示和关键词帧映射,提升视频LLM在稀疏帧下的时间推理能力。
CCMA利用跨模态信息,提升视觉任务主动学习的数据效率,优于现有单模态方法。
InterDyad通过中间视觉引导,实现更自然、可控的双人交互视频生成。
VIRST-Audio模型利用文本监督进行音频视频对象分割,通过ASR转换音频并引入存在感知门控提升鲁棒性,在MeViS-Audio挑战赛中获得第三名。
研究MLLM在视觉错觉上的缺陷,提出SMSP多尺度感知策略提升模型对视觉错觉的理解。
提出了一种基于强化学习的自回归图像模型微调框架,提升图像质量和多样性。
MedCausalX通过自反思和因果推理,提升医学视觉语言模型的可信度和可靠性。
MLLM-HWSI是一种用于病理全切片图像理解的多模态大语言模型,通过层级结构实现精细化分析。
利用Kolmogorov-Arnold网络提升YOLOv10目标检测的可解释性和置信度评估,结合多模态信息增强可信赖AI。
论文提出了大规模交通标志数据集TS-1M,并针对自动驾驶中的鲁棒性问题进行了基准测试。
针对训练自由的开放词汇语义分割,提出一种全局-局部对齐的CLIP模型,解决窗口间的语义差异问题。
Cog3DMap通过构建显式3D认知地图,增强MLLM的多视角空间推理能力。
提出一个针对自然灾害管理中分割和检测模型的概念解释框架,提升模型透明度和可信度。
VLA-IAP是一种训练无关的视觉token剪枝方法,通过交互对齐提升VLA模型在资源受限平台上的推理效率。
该论文区分了不文明和不容忍言论,提出了细粒度的多模态内容审核方案。
ClusterSTM提出一种簇级时空掩码策略,提升视频语言预训练的效率和性能。
PersonalQ提出了一种统一框架,通过选择、量化和提供个性化扩散模型来提高推理效率。
提出了Ran Score,一种基于LLM的放射报告生成评估指标,特别关注低频异常和临床语言。
针对视频会议场景下的AVSR性能退化问题,构建了MLD-VC数据集并分析了原因,提出了优化方法。
ForestPrune通过时空森林建模实现视频MLLM高比例视觉token压缩。
提出了一种双教师蒸馏方法,通过子网络校正解决黑盒域适应问题,提升模型性能。
VLGOR利用视觉-语言知识生成虚假轨迹,增强离线强化学习,提升智能体泛化能力。
TreeTeaming通过层级策略探索,实现对视觉-语言模型(VLM)的自主红队测试。
研究了灵巧操作中Sim-to-Real泛化的关键因素,并提出了评估协议。
提出ForeSea,一个用于视频监控场景下多模态查询的AI取证搜索系统及数据集ForeSeaQA。
利用视频生成模型中的隐式3D先验知识,提升MLLM在空间理解方面的能力。
提出CubiD模型,首次实现高维离散表示的视觉生成,并验证其表示能力。
SAMA通过解耦语义锚定和运动对齐,提升指令引导的视频编辑效果,实现更精确的语义修改和更真实的运动保持。
提出了一种基于图像频谱特性的像素扩散模型噪声调度方法,提高了生成质量。
DriveTok提出了一种高效的3D驾驶场景Tokenization方法,用于多视角重建和理解。
提出了LVOmniBench,用于评估OmniLLM在长音频视频理解方面的能力。
DreamPartGen提出一种语义驱动的、部件感知的文本到3D生成框架,实现高质量的3D物体生成。
研究了状态空间模型(SSM)作为视觉编码器在视觉语言模型(VLM)中的表现,发现其具有竞争力。
研究表明,视觉语言模型(VLM)的视觉注意力受问题框架影响,导致性能下降和不一致。
该论文研究LLM中的听觉知识对LALM性能的影响,并进行了全面的评估。
提出FLAC,一种基于流匹配的概率方法,用于少样本声学合成,生成与场景一致的RIR。
ARIADNE框架通过偏好对齐感知和RL推理,提升冠状动脉造影分析的可靠性。
提出MAPG框架,分解复杂指令为子任务,提升VLM在度量约束下的视觉语言导航性能。
LuMamba结合拓扑不变编码和线性复杂度状态空间模型,高效处理脑电信号,性能优越。
提出了用于交通异常理解的视觉语言模型TAU-R1,并构建了Roundabout-TAU数据集。
研究语义线索如何影响视觉语言模型(VLM)的安全判断,揭示其脆弱性。
TerraScope提出了一个像素级视觉推理的VLM,用于地球观测任务。
SEM通过稀疏自编码器分解CLIP嵌入,实现对视觉-语言模型偏差的后处理校正。
提出了一种无需额外解码器的MLLM图像分割方法SELF1E,通过单一分割token实现高效分割。
CRAFT通过复合奖励过滤和增强型SFT,在少量数据下高效对齐扩散模型。
提出了用于评估视觉语言模型多跳空间推理能力的MultihopSpatial基准。
PromptHub通过局部感知融合、集中和对齐增强多提示视觉上下文学习,提升视觉任务性能。
RadioDiff-FS利用少量样本,构建高保真无线电地图,有效降低了建模成本。
HORNet通过学习帧选择策略提升VLM在视频问答任务上的效率和性能。
Perceptio通过显式的语义分割和深度token增强了LVLM的空间推理能力,并在多个基准测试中取得了SOTA。
提出SEAR方法,高效微调视觉几何Transformer,用于RGB+热成像3D重建,提升多模态对齐效果。
论文提出了一种基于说话人情感表达预测观众情感投入和声音吸引力的双模型方法。
OGD利用知识图谱引导扩散模型,实现了零样本Sim2Real图像转换,提升了图像的真实感和可解释性。
Li-Net模型通过稀疏注意力机制和多模态融合,高效准确地进行多通道时间序列预测。
综述性论文,分析了多模态计算病理学中的表示学习、图像压缩、数据增强和多智能体协作诊断等关键技术。
提出SCALe损失函数,通过动态权重解决VLM中CoT训练的token不平衡问题,提高推理精度和效率。
Click-to-Ask是一个AI直播助手,通过离线文案生成和在线交互问答提升直播效率。
提出AFS-Search闭环框架,通过VLM引导,提升空间约束文本生成图像质量。
GenVideoLens基准测试揭示LVLMs在AI生成视频检测中光学、物理和时序推理上的不足。
提出一种跨模态的、可解释的人道主义分类框架,提升了社会媒体危机事件分类的准确性和可解释性。
提出互补文本引导注意力机制Comp-TGA,提升CLIP模型在零样本对抗环境下的鲁棒性。
myMNIST缅甸手写数字数据集上,PETNN等模型与经典深度学习模型性能对比基准。
MedForge提出一种可解释的医学Deepfake检测方法,提高了检测精度和可信度。
HiMu是一种高效的无训练长视频问答框架,通过分层多模态帧选择提升性能。
提出了CoDA框架评估医学视觉语言模型在临床环境中抵抗图像质量退化的能力,并提出了一种修复策略。
提出了一种统一的时空Token评分模块STTS,用于高效的视频VLM的Token剪枝,提升计算效率。
SkeletonLLM通过可微渲染将骨骼数据转换为视觉信息,利用MLLM实现通用骨骼理解。
Loc3R-VLM通过全局布局重建和情境建模,增强视觉语言模型在3D空间理解和定位方面的能力。
LoST通过语义显著性进行3D形状的token化,显著提升重建和生成质量。
GMT利用多模态Transformer生成3D场景中可控的6自由度物体操作轨迹。
Motion-MLLM利用运动数据增强MLLM,提升3D场景理解的效率和准确性。
LaDe提出了一种新的潜在扩散框架,用于生成和分解可编辑的多层图形媒体设计。
VideoAtlas通过分层网格结构实现长视频的无损、可导航表示,并结合RLM实现高效视频理解。
提出C-TRAIL数据集和一个两阶段框架,用于从行车记录仪视频中推断交通责任。
针对VCE图像多标签分类,提出了基于BiomedCLIP和不对称Focal优化的框架,提升不平衡数据集性能。
FailureMem是一个多模态自动软件修复框架,通过记忆失败经验提升修复成功率。
提出多源证据融合的音频问答系统,在Interspeech 2026挑战赛中获得第一,大幅领先。
ChopGrad通过截断反向传播降低视频扩散模型训练的显存占用。
该论文提出了一种细粒度后训练量化方法,利用量化感知集成梯度提升LVLM量化性能。
提出了一种无需微调LVLM的图像Deepfake检测框架SCEP,通过证据驱动推理提高检测泛化性。
论文提出了一个用于检测和理解有害幽默的多模态、多语言基准数据集,并评估了现有模型。
C2P提出了一种无需提示的通用医学图像分割框架,利用多模态LLM进行知识蒸馏,实现跨模态的泛化。
SARE提出了一种样本自适应的推理框架,用于无需训练的细粒度视觉识别。
MoBaNet提出一种参数高效、模态平衡的对称融合框架,用于多模态遥感语义分割。
提出SynRL框架,利用合成视频学习可迁移的时间基元,提升视频推理能力。
提出 WeatherReasonSeg 基准,评估 VLM 在恶劣天气下的推理分割能力。
针对MLLM在细粒度负查询下产生幻觉的问题,提出了FINER基准和FINER-Tuning方法。
针对CDFSL中CLIP模型局部对齐问题,提出循环一致性和语义锚定机制,提升局部视觉-语言对齐和可解释性。
ReLaGS构建了分层语言蒸馏高斯场景和3D语义场景图,用于开放词汇3D感知和推理。
LoGSAM利用语音转录和少量参数更新,实现MRI图像肿瘤的自动分割。
HeiSD框架通过混合推测解码加速具身视觉-语言-动作模型的推理速度,并保持任务成功率。
视频微调能提升视频理解能力,但可能牺牲静态图像理解能力,存在时空理解的权衡。
提出了一种新的SE(3)等变卷积方法ECKConv,提高了点云分析的效率和性能。
AdapTS是一种轻量级的教师-学生框架,用于多类和持续视觉异常检测。
提出MM-OVSeg,一个基于光图和SAR图像融合的遥感开放词汇分割框架,解决恶劣天气下的分割问题。
提出了KineVLA框架,通过双层动作分解实现对精细运动指令的理解与执行,并在数据集上验证了其优越性。
PCA-Seg提出并行成本聚合方法,解决开放词汇语义分割中语义和空间信息的干扰问题。
提出一种用于多模态医学图像疾病识别的早期干预框架,解决信息融合和数据稀缺问题。
Omni-I2C是一个用于评估LMMs将图像转化为代码能力的高保真综合基准。
提出针对复杂背景下无人机检测的RGB-T数据集UAV-CB和局部频率桥网络LFBNet。
UniSAFE是一个评估统一多模态模型安全性的综合基准,揭示了现有模型在多模态情境下的安全漏洞。
提出VirPro框架,利用视觉信息提升弱监督单目3D目标检测性能,解决文本描述多样性不足问题。
VLM2Rec提出了一种基于VLM的序列推荐框架,解决了多模态数据中的模态崩溃问题。
AdaZoom-GUI通过指令优化和自适应缩放提升VLM在GUI界面定位的准确性和效率。
ManiTwin提出了一种自动化流程,高效生成大规模、高质量的机器人操作数据。
SparkVSR提出了一种交互式的视频超分辨率框架,利用稀疏关键帧作为控制信号。
Surg$Σ$框架提供大规模多模态手术数据和模型,旨在提升手术智能的泛化性和可解释性。
WildDepth是一个用于动物3D感知和深度估计的多模态数据集,包含RGB和LiDAR数据。
提出了IOSVLM,一种用于口腔扫描3D统一牙科诊断的视觉语言模型。
SpecMoE模型利用频谱信息进行跨物种脑电解码,性能优于现有方法。
CIRCLES通过检索反事实样例,提升视觉上下文学习中视觉语言模型(VLMs)的推理能力。
CoT推理会降低VLM的不确定性估计质量,导致模型过度自信,但一致性方法仍然有效。
提出了$x^2$-Fusion,通过事件边缘空间统一多模态特征,提升光流和场景流估计精度。
Kestrel是一个免训练的LVLM幻觉缓解框架,通过视觉 grounding 和证据验证的自精炼机制减少幻觉。
BUSSARD利用归一化流检测场景图中的异常关系,性能优于现有方法并具备更强的鲁棒性。
FlowComposer提出了一种基于流匹配的CZSL框架,显式融合属性和对象特征,提升模型泛化能力。
分析了MLLM在人脸识别解释上的可靠性,发现其解释存在幻觉问题,并提出了评估框架。
提出Proxy-GRM,通过代理引导的评价标准验证,提升视觉-语言模型奖励模型的标准质量。
FSMC-Pose通过频率空间融合和多尺度自校准,提升复杂环境下牛只骑跨姿态估计的准确性。
BATQuant通过块级优化实现对MXFP4量化的鲁棒性,显著提升MLLM/LLM性能。
V-DyKnow基准测试评估VLMs在时间敏感知识上的表现,揭示了模型在事实更新和跨模态一致性方面的局限性。
研究稀疏多视角视觉推理,提出VIEW2SPACE基准和Grounded Chain-of-Thought方法。
ExpressMind是一个专为高速公路运营设计的预训练多模态大语言模型,提升智能交通认知能力。
现有语音情感识别模型难以泛化到合成语音,因为合成语音与人类语音存在表征不匹配,且SLM倾向于从文本语义推断情感。
HyDRA通过混合证据演绎推理解决开放词汇多模态情感识别中的歧义性问题,并提供可解释的证据。
GAP-MLLM通过几何对齐预训练,增强MLLM在3D空间感知任务中的性能。
Evo-Retriever利用LLM指导的课程演化,通过多视角-路径协同提升多模态文档检索性能。
视觉输入会干扰视觉语言模型的道德推理,绕过基于文本的安全机制,造成安全隐患。
提出CD-FKD,通过跨域特征知识蒸馏提升目标检测模型在单领域泛化中的鲁棒性。
IRIS基准数据集,用于从视频中进行物理动态系统的逆向恢复和辨识研究。
发布LenghuSky-8八年全天云图数据集,含星敏感掩膜和高精度校准,用于云分割和短时预报。
提出一种基于自监督跨模态学习的浮游生物识别方法,有效利用图像和光学测量数据,减少标注需求。
HGP-Mamba是一种基于Mamba的多模态框架,结合组织学和生成的蛋白特征进行癌症生存风险预测。
Fanar 2.0是卡塔尔的以阿拉伯语为中心的生成式AI平台,在资源有限的情况下取得了显著的性能提升。
DermaFlux利用Rectified Flows生成高质量皮肤病灶图像,提升分类性能。
提出SemTok,一种将图像压缩为具有高级语义的1D离散token的语义Tokenizer。
InViC通过意图感知视觉线索增强医学VQA中MLLM对图像的关注,提高临床可靠性。
NeSy-Route是一个用于遥感约束路径规划的大规模神经符号基准。
提出了一个名为VisBrowse-Bench的新型视觉原生搜索基准,用于评估多模态浏览代理的视觉推理能力。
EverTale通过持续角色定制实现持久故事世界模拟,提升角色一致性和视觉故事质量。
提出FG-SGL框架,利用细粒度语义指导微手势识别,提升对细微动作差异的感知能力。
提出一种双曲多模态生成表示学习框架HMGRL,解决广义零样本多模态信息抽取问题。
针对视频问答中视觉信息丢失问题,提出FrameRepeat框架,通过帧重复增强视觉线索。
提出EVPV方法,通过显式视觉前提验证来提升视觉-语言过程奖励模型的可靠性。
CTRL-S通过多任务多奖励强化学习提升SVG-LLM的推理能力和生成质量。
提出KidsNanny多模态内容审核框架,结合视觉和文本分析提高儿童安全内容检测效率。
针对MLLM在360°图像理解的不足,提出了360Bench基准测试和无训练的Free360框架。
论文提出了DOMINO数据集和PUMA模型,用于提升VLA模型在动态环境下的机器人操作能力。
提出DeepVision-VLA,增强VLA模型视觉表征,提升机器人操作性能。
提出PRIMO R1框架,利用强化学习提升视频MLLM在机器人操作中的过程推理能力,实现更精准的监督。
提出一个多阶段诊断框架,通过认知状态空间追踪视觉语言模型中的幻觉问题。
该论文发布了包含5400张越南胸部X光片的ViX-Ray数据集,用于评估和提升VLM在越南临床领域的表现。
RSGen通过多样化边缘引导,提升布局驱动的遥感图像生成效果,优化目标检测。
提出了EscapeCraft-4D环境,评估大模型在时序感知和跨模态主动感知方面的能力。
VoT模型利用事件驱动推理和多层次对齐,提升文本在时间序列预测中的价值。
论文比较了经典机器学习和深度学习方法在尼泊尔音乐流派分类上的应用,并提出了新的数据集。
SEA-Vision,一个东南亚多语言文档和场景文本理解的综合基准。
提出Adaptive Residual Context(ARC)架构,用于在城市交通图像中高效检测自动驾驶车辆。
提出一种新的对抗性补丁生成框架,用于攻击人脸重识别系统,可实现逃逸和模仿攻击。
提出了一个支持混合XR博士论文答辩的多模态框架,并成功进行了首次实践。
LOOM-CFM通过跨minibatch优化数据噪声耦合,加速Flow-Based生成模型的推理。
研究数据集多样性指标与模型性能的相关性,发现部分指标与模型表现相关。
FlashU框架通过任务感知优化,在统一模型中实现生成和理解任务的加速,且保持性能。
IConE提出了一种不依赖batch size的自监督学习方法,通过全局可学习实例嵌入防止表征坍塌。
AGCD提出一种利用多智能体和跨模态解码进行天气预报的框架,提升预测精度和物理一致性。
该论文扩展了RESTA防御,通过方向性嵌入平滑,增强了视觉语言模型抵抗越狱攻击的鲁棒性。
提出了HalDec-Bench,一个评估图像描述幻觉检测器性能的基准,包含多样的模型和幻觉类型。
提出物理信息指导的多轮对话视觉语言模型,显著提升物理异常检测性能。
HYDRA通过Representation-Harmonized Tokenization统一多模态生成与理解,达到新的SOTA。
论文提出了一种并行Token预测方法PTP,加速VLM文档解析,提升效率和泛化能力。
论文提出一种基于图学习和交叉注意力的多模态融合框架,用于自闭症谱系障碍分类。
提出QViC-MF框架,利用问题引导的记忆反馈机制,提升长视频理解任务性能。
提出DAIT,利用中间教师网络自适应地将VLM知识迁移到轻量级分类器,提升细粒度图像分类性能。
提出一种多专家融合框架,用于解决多源CT图像的COVID-19检测问题。
VAREX是一个用于评估多模态模型从政府表格中抽取结构化数据的基准。
提出MMKU-Bench,一个用于多模态知识更新的综合评估基准,包含更新知识和未知知识两种场景。
该论文提出一种多模态深度学习框架,利用CT影像和临床数据预测NSCLC新辅助治疗后的主要病理反应。
AnoleVLA是一种轻量级视觉-语言-动作模型,利用深度状态空间模型高效处理多模态序列,提升移动机器人的操作性能。
VTC-Bench是一个评估MLLM工具使用能力的综合基准,包含32种OpenCV工具和680个问题。
提出了Meme Reappraisal任务,构建了MER-Bench数据集,并提出了评估框架。
论文提出IdtVP提示策略和Re3-DAPO强化学习算法,提升VLM在化学反应图解析中的准确性和泛化能力。
ClueNet通过挖掘视觉线索增强视频推理能力,提升VideoQA性能,并缓解幻觉问题。
利用图像编辑模型的空间先验知识,通过少量样本微调实现视频帧插值。
提出MAGIC3模型,通过建模跨模态一致性来检测短视频中的假新闻。
论文提出了MMSpec基准测试,评估视觉语言模型中推测解码的加速效果,并提出了ViSkip方法。
TAEMI利用文本锚定和跨模态注意力机制,提升了情感模仿强度的估计精度,尤其在数据缺失情况下表现鲁棒。
RS-WorldModel统一遥感理解与未来预测,提出新数据集RSWBench-1.1M并超越现有模型。
提出了MM-CondChain基准,用于评估MLLM在视觉组合推理方面的能力,并发现现有模型表现不足。
GRADE基准测试学科知识驱动的图像编辑推理能力,揭示现有模型在该领域的不足。
AutoGaze通过自回归方式选择关键视频帧,减少计算量,提升多模态大模型处理长视频的能力。
EndoCoT通过迭代细化潜在思想状态,并将其与扩散模型的去噪过程桥接,增强了MLLM的推理能力。
SciMDR提出一种合成和重构框架,构建大规模科学多模态文档推理数据集,提升模型在科学QA任务中的表现。
SceneAssistant通过视觉反馈迭代优化,实现开放词汇的3D场景生成。
ForensicZip通过Forgery驱动的token压缩,加速多模态取证模型并保持检测性能。
BehaviorVLM提出了一种无需微调的视觉语言模型,用于动物行为的姿态估计和行为理解。
LatentGeo通过学习隐空间表示来解决多模态几何推理中辅助线构建的难题。
GlyphBanana通过agentic workflow和glyph模板注入,提升文本渲染的精确度,尤其在复杂字符和公式渲染方面。
论文研究MLLM的置信度校准问题,提出CDRL和CA-TTS框架,提升模型性能并实现置信度感知。
提出了EgoIntent,一个用于评估第一视角视频中细粒度意图理解的基准数据集。
Hoi3DGen通过高质量交互数据和文本到3D流程,显著提升了3D人机交互生成的质量和保真度。
EvoTok提出了一种统一的图像Tokenizer,通过残差演化过程弥合视觉理解和生成之间的差距。
LoV3D利用3D视觉语言模型,结合区域体积评估进行纵向脑MRI分析,辅助阿尔茨海默病诊断。
提出SeGP-CL方法,通过语义几何保持解决VLM持续学习中的灾难性遗忘问题,提升稳定性和前向迁移能力。
提出了HomeSafe-Bench,评估VLMs在家庭环境中不安全行为检测的能力,并提出了一种高效的检测架构HD-Guard。
提出一种基于双向跨注意力和时间建模的多模态情感识别框架,提升了非约束环境下的情感识别性能。
SLIP通过语言信息预训练传感器模型,提升跨领域零样本迁移能力,实现语义理解和生成推理。
ProtoSR通过融合自由文本知识,提升了结构化放射报告生成模型的细粒度判别能力,在Rad-ReStruct数据集上取得领先成果。
提出Think While Watching框架,提升MLLM在连续视频流上的多轮推理能力,并减少输出token。
论文提出一种解耦评估框架和ZeroSense基准,用于更准确评估视觉文本压缩的质量。
提出RICE-NET模型,利用多模态深度学习区分脑胶质瘤术后复发和放射性损伤。
提出了VTEdit-Bench,用于评估通用图像编辑模型在虚拟试穿任务中的性能。
提出CRAN-PM模型,利用跨分辨率注意力高效预测高分辨率PM2.5浓度。
提出了OSCBench基准测试,用于评估文本到视频生成模型对物体状态变化的理解能力。
提出显式逻辑通道验证和增强多模态大语言模型在零样本任务中的表现。
BackdoorIDS是一种零样本的视觉编码器后门检测方法,基于注意力的劫持和恢复现象。
IDRL框架通过解耦多模态表示和个体感知融合,提升抑郁症诊断的准确性和鲁棒性。
HouseMind通过tokenization统一了建筑平面图的理解、生成和编辑,提高了空间推理和可控性。
该论文分析了视觉语言模型识别艺术风格的机制,并与艺术史家的认知进行对比。
该论文针对文本到图像生成中的颜色逼真度问题,提出了数据集、评估指标和优化方法。
GroundCount通过结合目标检测模块增强VLM,显著提升了计数任务的准确率和效率。
提出一种结合对比学习和视频质量评估的视频识别方法SSL-V3,提升低质量视频识别的准确率。
提出一种终身模仿学习框架,利用多模态潜在空间和增量调整实现策略持续优化。
GLM-OCR提出了一种高效的0.9B参数多模态模型,用于文档理解,具有高性能和高效率。
ARMADA框架有效将视觉-语言模型的知识迁移到纯语言模型,无需昂贵的多模态预训练。
提出了跨模态距离不变位置编码DIPE,缓解了MLLM长文本中视觉信息衰减问题。
论文提出6ABOS,一个基于6S的EnMAP高光谱影像大气校正开源框架,适用于水体反射率提取。
提出HanMoVLM,用于中国艺术绘画的专业评估,提升VLM在艺术领域的理解和评估能力。
该论文通过代码作为感知媒介,提升MLLM在STEM领域的可视化感知能力。
提出CTCNet,用于复杂环境下的无人机交通场景理解,并构建了大规模多模态数据集Traffic-VQA。
WalkGPT通过深度感知分割实现基于视觉语言的行人导航,解决现有模型对空间理解的不足。
UniCom通过压缩连续语义表示,统一多模态理解与生成,实现卓越的图像编辑可控性。
提出了一种平台无关的多模态数字人建模框架,支持AI驱动的人机交互研究。
提出ROVA框架,增强视频理解模型在真实扰动下的鲁棒性,并构建了PVRBench基准测试。
针对CG图像质量评估,提出基于检索增强的VLM框架R4-CGQA,提升VLM对CG图像质量的评估能力。
UniStitch统一几何和语义特征,用于提升图像拼接性能。
提出一种基于视觉-语言模型的AIRT缺陷认知分析框架,无需训练即可检测碳纤维复合材料的内部缺陷。
提出了IMTBench,一个多场景跨模态图像机器翻译评测基准,用于评估端到端图像翻译系统的性能。
BEACON通过预测BEV可负担性热图,解决语言条件下的遮挡导航问题。
PathMem提出一种记忆增强的病理学MLLM框架,有效融合结构化知识并提升诊断推理能力。
ACADiff利用临床信息指导扩散模型,用于脑部多模态图像补全,提升诊断性能。
提出CourtSI数据集和基准,用于评估VLMs在运动场景中的空间智能,揭示模型差距。
InternVL-U是一个轻量级的多模态统一模型,以40亿参数实现了高效的理解、推理、生成和编辑能力。
提出了 MissBench,用于评估多模态情感分析模型在不平衡缺失模态下的性能,并提供评估指标MEI和MLI。
VLM-Loc利用视觉语言模型进行点云地图中的文本定位,提升复杂环境下的定位精度。
提出一种高效的视觉语言模型个性化方法Ego,通过内部注意力机制提取视觉token,实现概念记忆和描述。
LogoDiffuser提出一种免训练的多语言logo生成方法,通过可控注意力机制融合文字和视觉元素。
SACA框架通过步进式对比对齐,从不完美轨迹中提取密集监督,提升VLN-CE任务性能。
论文提出了EXPLORE-Bench基准,用于评估MLLM在长时程自我中心场景预测中的推理能力。
提出CVS方法,通过评估问题对答案有效性的影响,实现视觉语言SFT的无训练数据选择。
论文提出了MUGEN基准测试LALMs的多音频理解能力,并提出了改进策略。
提出了OOD-MMSafe基准测试MLLM在因果链中识别潜在风险的能力,并提出CASPO框架提升模型安全性。
提出TriFusion-SR,一种用于联合三模态医学图像融合和超分辨率的框架。
TemporalDoRA通过时序建模改进了手术视频问答的鲁棒性,并提出了REAL-Colon-VQA数据集。
论文提出了一个大规模自动构建的越南语视觉问答数据集,并探索了Transformer架构。
Omni Parsing框架统一多模态数据解析,实现从感知到认知的递进式解析,并构建了相关数据集和模型。
提出了MM-tau-p$^2$基准,用于评估具身用户适应性的多模态Agent的鲁棒性。
X-GS框架统一了3DGS架构,赋能多模态模型,实现实时的语义增强在线SLAM。
提出基于视觉-语言模型的合成数据生成和评估框架,用于遥感图像增强,并构建了ARAS400k数据集。
提出全景语言模型PLM,用于理解复杂全景场景,超越传统多视角拼接。
GeoAlignCLIP通过多粒度一致性学习增强遥感图像中文本对齐,提升细粒度视觉语言理解。
ALARM模型通过自复述和多音频编码器融合,提升了音频推理能力,并在多项基准测试中取得领先。
提出了一种基于强化学习的后训练策略,提升统一视觉语言模型的多模态交错生成能力。
该论文探讨了驾驶场景下VLM的一致性和时间推理能力,并提出了改进方案。
EvoPrompt通过控制prompt的进化路径,实现VLMs在小样本学习中的稳定和知识保留。
PruneSID通过协同重要性和多样性,高效压缩VLM中的视觉Token,提升推理速度。
MORE-R1通过强化学习引导LVLM进行逐步推理,显著提升了多模态对象-实体关系抽取性能。
OmniEarth是一个遥感视觉-语言模型的综合评估基准,包含感知、推理和鲁棒性三个维度。
TopoOR提出了一种新的手术室场景拓扑表示方法,提升手术过程理解和预测能力。
EvoDriveVLA通过协同感知-规划蒸馏,提升自动驾驶视觉-语言-动作模型的性能和稳定性。
提出开放世界运动预测框架,解决现实场景中目标类别动态变化的问题。
该论文提出了一种基于IMLE的分布蒸馏框架,将流模型提炼为单步策略,实现机器人实时多模态轨迹控制。
ICDAR 2025 DIMT挑战赛关注复杂布局文档图像的端到端机器翻译。
该论文提出OddGridBench基准测试MLLM在细粒度视觉差异识别上的能力,并提出OddGrid-GRPO进行优化。
SpaceSense-Bench:大规模多模态航天器感知与姿态估计基准数据集。
CLoE通过专家一致性学习解决医学图像分割中模态缺失问题,提升分割精度。
IntroSVG通过生成器-评论家框架,结合渲染反馈,提升文本到SVG的生成质量。
针对VLMs微调中前景注意力漂移问题,提出自适应前景引导的提示调优方法。
CoCo提出一种代码驱动的CoT推理框架,用于精确、可控的文本到图像生成,并构建了CoCo-10K数据集。
CAST模型通过预测视觉状态转换,提升了视频检索的一致性和时间连贯性。
提出了一种检索增强方法RAF,提升无模板头部avatar的表情泛化能力。
UNBOX利用LLM和扩散模型,在纯语义搜索下揭示黑盒视觉模型的内在逻辑和潜在偏差。
论文提出GR3D方法,增强MLLM对三维空间推理能力,无需额外训练,提升了zero-shot性能。
MetaWorld-X提出了一个基于VLM专家分层世界模型,用于解决人形机器人复杂操作任务。
BioGait-VLM通过融合视觉、语言和生物力学信息,提升步态分析的泛化性和可解释性。
提出一种无需匈牙利算法的DETR训练方法,通过跨注意力机制实现query和目标的隐式匹配。
Echo2ECG利用多视角超声心动图增强ECG特征,提高心脏表型预测和检索性能。
VLMs在文本识别上表现出色,但在排版识别方面存在差距,论文对此进行了系统研究和改进。
论文提出了一个大规模跨模态地理定位数据集CORE,并提出了物理规律感知的跨模态地理定位框架PLANET。
提出Visual Self-Fulfilling Alignment,通过威胁图像训练VLM提升安全性,无需安全标签。
提出X-AVDT,利用生成器内部音视频一致性线索,提高深度伪造检测的鲁棒性和泛化性。
提出一种无需LLM的实时目标导航方法R2F,显著提升导航效率。
该论文揭示了视觉语言模型在时空推理上的局限性,并提出了基于时空轨迹生成的解决方案。
提出StructBiHOI框架,用于生成长时程双手与物体交互的结构化动作。
该论文提出了一种基于Rectified Flow的AI模型,用于预测脑肿瘤患者放疗后的MRI图像。
M³-ACE通过多智能体协作校正视觉感知,提升多模态数学推理性能。
SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升视觉语言模型在少样本分类和OOD检测上的性能。
提出一种统一的后训练框架,使语音基础模型能够生成多种类型的语句级表示。
提出一种概念引导微调方法,通过对齐模型内部相关性与概念掩码,提升ViT模型的鲁棒性。
提出一种检索增强的Text-to-CT生成方法,利用检索到的解剖结构信息指导生成,提高图像质量和临床一致性。
综述多模态数学推理研究,提出统一的感知-对齐-推理范式,并探讨未来方向。
论文提出SP-CLIP框架,通过语义提示增强视觉语言模型,提升零样本动作识别性能。
SBARThez利用多模态、多语言嵌入和实体注入提升摘要的准确性和简洁性。
FlowTouch提出了一种视角不变的视觉-触觉预测模型,利用局部3D网格实现跨域泛化。
提出了一种利用合成视觉数据在零视听资源下进行视听语音识别的框架。
SiMO提出一种单模态可操作的多模态协同感知框架,解决模态失效问题,提升鲁棒性。
提出一种面向LALM的歧义情感识别方法,通过分布推理和链式思考提升模型对复杂情感的理解。
提出两种多模态融合策略,RGIF和RGMAF,用于提升异构传感器下无人机检测的鲁棒性和精度。
提出ALOOD方法,利用语言表示进行LiDAR OOD目标检测,提升自动驾驶安全性。
MERLIN提出了针对电磁信号的低信噪比鲁棒多模态LLM框架,并构建了数据集和基准。
论文提出一种神经科学启发的视觉-语言-动作三元架构SaiVLA-0,实现高效计算和可复现性。
提出了场景自适应的混合专家VLA模型SAMoE-VLA,用于提升自动驾驶决策的稳定性和安全性。
利用多模态大语言模型生成缺陷图像,提升电力线绝缘子缺陷检测效果。
提出了一种基于LVLM的关系建模方法,用于提升跨视角无人机地理定位的准确性。
针对ABAWE表情识别挑战,提出了一种鲁棒的多模态框架,有效处理模态缺失和数据不平衡问题。
提出用于多模态终身理解的MM-Lifelong数据集和递归多模态Agent(ReMA)模型,解决现有模型记忆瓶颈和全局定位崩溃问题。
该论文提出了一种在视觉语言模型生成文本前预测幻觉风险的方法。
论文研究了AI在多模态协同场景下构建共同基础的难题,并提出了DPIP数据集进行评估。
NaiLIA提出了一种多模态美甲设计检索方法,能更好地理解复杂的用户意图和颜色偏好。
OpenFrontier提出了一种免训练的视觉语言导航框架,利用语义先验实现高效的零样本导航。
WavSLM通过蒸馏WavLM表征,实现单流语音语言建模,无需文本监督。
构建了孟加拉国首个国家级多语种平行多模态语料库,覆盖多种濒危语言。
Wiki-R1通过课程学习强化学习框架,提升MLLM在知识库VQA上的推理能力,达到SOTA。
提出ASR-TRA,一种基于强化学习的测试时自适应框架,提升ASR在噪声和口音环境下的鲁棒性。
论文提出一种基于数字孪生的纺织品分拣系统,利用VLM进行分类和异物识别。
Mario提出了一个统一的框架,利用LLM在多模态图上进行推理,解决跨模态一致性和异构模态偏好的问题。
提出一种复杂度感知的自适应VLA框架,通过视觉信息判断任务复杂度,提升推理效率和鲁棒性。
UniPAR提出了一个统一的Transformer框架,用于处理多种模态下的行人属性识别任务。
Aura框架通过整合多维外部因素,显著提升了航空时间序列预测的准确性和适应性。
提出了 UniM 基准,用于评估多模态大模型在任意模态组合的理解和生成能力。
该研究提出一种基于多目视觉和颜色注意力机制的蓝光应急车辆检测系统。
通过机器想象补充视觉知识,增强零样本常识推理能力,有效缓解文本知识的偏差。
VisionPangu是一个17亿参数的多模态模型,通过高质量监督提升图像细节描述能力。
AdaIAT通过自适应地增强生成文本的注意力来减轻LVLM中的幻觉问题,并保持语言连贯性。
提出了一种新的动态授权与合法性感知的VLM知识产权保护框架,支持按需授权和自适应部署。
FedAFD提出了一种新的多模态联邦学习框架,通过对抗融合和蒸馏提升客户端和服务器端的学习效果。
提出了用于多模态脑肿瘤分割的联邦学习框架FedMEPD,解决了模态异构和个性化问题。
提出一个两阶段结构驱动的图像-文本对比学习框架,用于自动生成CT报告,提高临床效率。
K-Gen利用多模态大语言模型和关键点引导生成 interpretable 自动驾驶轨迹,性能优于现有方法。
提出一种低资源、可控的潜在音频扩散方法,通过选择性时频引导和潜在控制头实现细粒度音频控制。
FocusGraph提出了一种图结构的帧选择框架,用于长视频问答,提升推理效率和性能。
RANGER模型通过专家混合和自适应检索重排序,提升病理报告生成的质量。
CubeComposer原生生成4K分辨率360°视频,提升VR沉浸式体验。
FeedAIde利用多模态大语言模型,通过情境感知提问,引导用户提交更完善的App反馈报告。
构建了首个大规模文档解析物理重建基准Real5-OmniDocBench,用于评估VLM在真实场景下的鲁棒性。
提出一种基于视觉-语言推理的杂乱衣物检索方案,实现安全准确的单件衣物抓取。
Crab$^{+}$通过显式合作解决AV-LLM中的负迁移问题,实现更全面的视听场景理解。
FastWave提出了一种优化的扩散模型用于音频超分辨率,降低了计算成本并提高了训练速度。
针对组合图像检索的判别性查询嵌入,提出可学习属性权重和目标相对负采样。
利用人脸空想性错觉,分析多种视觉模型在歧义情况下的判别能力,揭示了表征选择对模型行为的影响。
论文提出了RIVER Bench,一个评估视频LLM实时交互能力的新基准,并提供了一种改进方法。
GeoSeg提出一种免训练的遥感图像推理驱动分割框架,无需标注数据即可进行精准分割。
Phi-4-reasoning-vision-15B是一个紧凑型开源多模态推理模型,注重数据质量和架构设计。
BLOCK是一个开源的二阶段MLLM Minecraft皮肤生成流程,通过MLLM和FLUX.2模型实现像素级皮肤生成。
提出一种新的多模态单应性估计方法,通过合成数据和网络设计增强泛化能力。
提出了一种n-gram注入Transformer解码器的方法,用于手写文本识别中的动态语言模型自适应,提升跨领域识别精度。
DeepScan是一个免训练框架,通过层级扫描、重聚焦和证据增强推理,提升LVLM的视觉理解能力。
预训练VLA模型在持续学习中表现出惊人的抗遗忘能力,简单经验回放即可有效。
提出Utonia,一个统一的自监督点云Transformer编码器,适用于多个领域。
ULTRA提出了一个统一框架,实现人形机器人自主全身运动操作,提升了感知和任务规范下的泛化能力。
研究原生多模态模型,揭示视觉和语言数据互补性,发现视觉比语言更需要数据。
LoGeR提出一种混合记忆模块,用于提升长视频序列三维重建的全局一致性。
该论文提出了UniG2U-Bench,评估统一模型在多模态理解中生成能力的有效性。
COP-GEN利用扩散Transformer对多模态地球观测数据进行条件生成建模。
提出CAT框架,通过条件激活传输,在保证图像质量的同时降低T2I模型生成不安全内容。
提出AWDiff模型,利用小波变换和扩散模型进行肺部超声图像生成,提升图像质量。
TinyIceNet:低功耗SAR海冰分割网络,用于星载FPGA推理,实现近实时海冰监测。
论文提出三种与设计实践对齐的生成式AI交互方法,提升设计师对AI输出的控制力。
提出EduAIGV-1k数据集和EduVQA模型,评估AI生成教育视频质量。
针对医学图像分类小样本学习中的类别不平衡问题,提出一种半监督方法,利用无标签数据提升模型性能。
TRACE通过生成式推理和判别式表示学习,提升通用多模态检索性能,实现任务自适应。
提出了新的3D Referring Expression Segmentation任务(3D-DRES),并构建了数据集DetailRefer和基线模型DetailBase。
LLandMark是一个多智能体框架,用于地标感知的多模态交互式视频检索,提升越南场景的检索效果。
提出Think-as-You-See (TaYS),一个针对视频流的并行化CoT推理框架,提升LVLM在视频理解任务中的效率和响应速度。
提出一种多模态先验引导的重要性采样方法,用于稀疏视角下的新视角合成。
该论文通过探针实验揭示LVLMs处理图结构数据时,节点和边信息编码的阶段性差异。
CoFL通过预测连续流场实现语言条件导航,无需离散动作预测,并在真实场景中实现了zero-shot部署。
BrandFusion提出一个多智能体框架,用于在文生视频中无缝集成品牌,提升商业价值。
研究了VLM在古希腊文本识别中的应用,提出了数据集并评估了模型性能。
研究了MLLM在文档信息提取中是否需要OCR,发现强大MLLM可媲美OCR+MLLM。
ITO通过多重对齐和训练时融合,提升图像-文本对比学习的模态一致性和表征能力。
针对遥感VQA中MLLM的幻觉问题,提出一种无需训练的推理方法RADAR,提升性能并减少幻觉。
iGVLM通过动态指令引导的视觉编码,提升了多模态模型在复杂推理任务中的性能。
ShareVerse提出了一种多智能体一致性视频生成框架,用于共享世界建模。
提出M3IRT框架,用于评估MLLM的跨模态推理能力,并优化多模态benchmark。
提出PhysFusion,利用雷达和视觉信息融合,提升水面目标检测精度和鲁棒性。
提出LaST-VLA框架,通过潜在时空推理提升自动驾驶视觉-语言-动作模型性能,解决语义-感知解耦和感知-符号冲突。
SeeThrough3D通过显式建模遮挡关系,实现了3D布局条件下的高质量图像生成。
VLMs推理能力不足源于训练数据中的报告偏差,扩大规模不能解决,需有针对性地数据标注。
提出一种基于检索增强的测试时适配器,利用少量带标注样本提升开放词汇分割性能。
提出了一个用于对话情绪识别的混合专家模型MiSTER-E,有效融合语音和文本信息。
论文研究了大型多模态模型在上下文学习中的分类能力,并提出了CIRCLE方法提升开放世界分类效果。
MovieTeller利用工具增强和渐进式抽象生成ID一致且连贯的电影梗概。
Fase3D提出了一种高效的无编码器傅里叶变换3D场景大模型,显著提升3D数据处理效率。
论文提出世界模型应基于一致性三位一体原则,并构建了评估基准CoW-Bench。
提出一种新的无监督在线视频稳定框架,无需配对数据,性能优于现有方法。
WARM-CAT通过积累无监督知识和动态调整原型,解决组合零样本学习中的分布偏移问题。
提出一种基于弱监督的视觉-语言模型,用于描述人脑显微图像中的细胞结构。
提出一种基于物理信息的潜在关系图框架,用于建模心脏血流特征,以诊断心脏疾病。
WISER通过检索-验证-精炼流程,结合图像和文本检索,实现无需训练的零样本组合图像检索。
SubspaceAD是一种无需训练的少样本异常检测方法,基于预训练模型特征和子空间建模。
该论文提出通过不变的推理快照建模专家AI诊断对齐框架,提高临床决策支持系统的人工对齐评估。
SPM-Bench是一个用于评估LLM在扫描探针显微镜领域的自动多模态基准测试,具有高权威性和低成本。
MM-NeuroOnco构建了大规模脑肿瘤MRI多模态诊断基准,并提出了NeuroOnco-GPT模型。
MViR通过多视角视觉语义表示提升假新闻检测性能,融合图像和文本信息。
MSJoE通过联合优化MLLM和采样器,提升长视频理解效率和准确率。
该论文通过因果干预探究了视觉语言模型中OCR信息的路由机制和瓶颈位置。
提出了一个半监督多模态域泛化框架,解决了数据量少和域偏移的问题。
DPE是一种诊断驱动的迭代训练方法,通过诊断盲点动态调整数据,持续提升LMMs性能。
提出CheXficient模型,通过主动数据管理实现高效的胸部X光影像基础模型预训练。
提出TrajTok视频tokenizer,通过联合训练动态分割视频轨迹,提升视频理解性能和效率。
论文揭示了现有多模态大语言模型中隐空间推理的无效性,并提出显式文本想象方法CapImagine。
SPATIALALIGN框架通过DPO微调T2V模型,提升视频中动态空间关系与文本提示的对齐。
AMLRIS通过对齐感知掩码学习提升指代图像分割效果,关注可信线索。
研究了Caption模型和Text-to-Image模型之间的风格差异,并提出了一种新的量化方法。
HulluEdit通过正交子空间编辑,单次推理有效减少大视觉语言模型中的对象幻觉,同时保持通用能力。
针对3D LVLM在3D空间感知上的不足,提出了基于球坐标的位置编码SoPE,增强了模型对3D几何结构的理解。
提出了一种无需真实caption的membership inference攻击方法MoFit,有效识别扩散模型训练集成员。
提出了首个智能眼镜VQA基准SUPERGLASSES,并构建了检索增强的智能眼镜Agent SUPERLENS。
ViCLIP-OT是首个越南语图像-文本检索基础模型,结合对比学习和最优传输损失。
NoLan通过动态抑制语言先验,有效缓解了大型视觉语言模型中的对象幻觉问题。
WeaveTime解决了视频LLM在流式处理中时间感知不足的问题,提升了准确性和效率。
Brain3D利用3D视觉Transformer和分阶段对齐方法,实现脑肿瘤MRI自动报告生成。
提出了一种基于RGB-Event数据和预训练模型的公里标识别方法,并构建了大规模数据集EvMetro5K。
WoG通过条件空间建模,提升VLA模型动作生成的精细度和泛化性。
PatchDenoiser通过多尺度patch学习和融合,高效降噪医学图像,保留细节。
GLoTran通过全局-局部双重感知提升MLLM在高分辨率富文本图像翻译任务上的性能。
MindDriver通过渐进式多模态推理,提升VLM在自动驾驶中的规划能力,并提出数据标注和强化微调方法。
提出了MEDSYN基准,评估MLLM在复杂临床病例中多证据融合的诊断能力,揭示了模型在跨模态证据利用上的不足。
提出MemFeed任务,利用MLLM提供图像记忆性改进的自然语言反馈,并构建了MemBench基准。
GFPL框架通过生成式联邦原型学习解决资源受限和数据不平衡的联邦学习问题。
DynamicGTR通过动态选择图拓扑表示提升VLM在图问答任务中的性能,实现精度和简洁性的平衡。
FewMMBench基准测试用于评估多模态大语言模型在少样本学习方面的能力。
UniVBench旨在统一评估视频基础模型在理解、生成、编辑和重建等方面的能力。
提出了FAQ基准测试,提升VLM在视频深度伪造时间一致性推理能力。
提出一种难度感知的分组归一化方法Durian,提升多模态LLM的推理能力。
SigVLP提出了一种新的视觉-语言预训练方法,通过分块和旋转位置编码解决CT体积数据变异性问题。
TranX-Adapter 通过优化 MLLM 中语义和伪影特征的融合,提升 AI 生成图像检测的鲁棒性。
提出一种基于神经网络的自适应稀疏度图卷积字典学习方法,增强了解释性和鲁棒性。
提出动态多模态激活引导方法,通过语义感知的干预缓解大型视觉语言模型中的幻觉问题。
VCC-Net利用视觉认知指导胸部X光诊断,提升AI辅助诊断的可靠性和可解释性。
针对多模态晚期交互检索,提出基于注意力引导聚类的索引压缩方法,提升检索效率。
Spa3R通过自监督学习,从2D图像中提取3D空间信息,提升VLM的空间推理能力。
XMorph通过LLM辅助的混合深度智能,实现可解释的脑肿瘤诊断,提高了诊断准确率。
提出一种质量可控的文本到图像检索方法,利用语言模型扩展短查询并控制图像质量。
提出CG-DMER框架,通过对比生成学习解耦多模态ECG表征,提升心电图分析性能。
UDVideoQA数据集旨在评估视频语言模型在城市交通场景下多物体时空推理能力。
利用DeepSpeed加速Vision Transformer在图像任务上的分布式训练,评估其性能和可扩展性。
VAUQ提出一种视觉感知的不确定性量化框架,用于评估LVLM对视觉依赖预测的置信度。
CrystaL通过对齐完整和损坏图像的潜在表示,提升多模态大语言模型视觉理解能力。
该论文分析了MLLM在图像标注中的应用潜力,并提出了TagLLM框架提高标注质量。
论文提出一种基于EKF融合深度相机和深度学习的无人机人员距离估计和跟随系统。
LongVideo-R1提出了一种高效的、基于推理的多模态Agent,用于低成本的长视频理解。
TextPecker通过量化结构异常来提升视觉文本渲染的保真度和语义对齐。
E-MMKGR构建电商多模态知识图谱,通过GNN学习统一的物品表示,提升推荐和搜索效果。
提出一种基于数据增强的联邦学习方法,解决跨模态医学图像分割泛化问题。
提出MAGNET模型,通过模态引导的图专家网络和熵触发路由,提升多模态推荐效果。
PromptCD提出一种测试时行为控制方法,通过对比学习提升LLM和VLM的可靠性和安全性。
提出了NativeEmbodied基准,用于评估VLM驱动的具身智能体在原生低级动作空间中的技能。
提出SurgAtt-Tracker,通过时序重排序和运动感知优化,实现稳定准确的手术视野关注点追踪。
该论文提出了一种基于物理现象的解释性方法,用于分析多模态LLM中的跨模态偏差和公平性问题。
论文提出了一个大规模视频推理数据集VBVR,并构建了可验证的评估框架VBVR-Bench,用于研究视频推理能力。
NovaPlan利用闭环视频语言规划,实现零样本长程机器人操作任务。
StructXLIP通过提取图像结构信息,增强视觉语言模型的跨模态对齐,提升检索性能。
HeatPrompt利用视觉-语言模型和卫星图像,零样本预测城市热需求,提升预测精度。
CORE框架利用VLM进行在线上下文推理和环境感知,实现开放世界中机器人的情境安全。
提出一种基于张量余弦积(Cproduct)的高效视觉Transformer,降低计算和内存成本。
RL-RIG利用强化学习和反射机制,提升图像生成模型在空间推理上的能力。
提出了一种用于零样本伪装对象分割的渐进式发现-分割-选择(DSS)机制。
ApET通过近似误差引导的token压缩方法,在保证性能的同时显著提升了VLMs的推理效率。
M3S-Net利用多尺度数据和新型跨模态融合,显著提升了超短期光伏功率预测精度。
TextShield-R1是首个基于强化学习的MLLM篡改文本检测方案,提升了篡改文本检测的准确性和可解释性。
提出一种适用于工业环境的免训练开放词汇3D感知方法,解决现有模型泛化性差的问题。
TraceVision提出一种轨迹感知的视觉-语言模型,提升空间理解和交互能力。
提出一种基于原型引导数据合成的无学习多模态数据集蒸馏框架,提高跨架构泛化能力。
提出VGGT-MPR,利用VGGT解决自动驾驶环境下的多模态地点识别问题,实现高性能检索和重排序。
提出DeepfakeJudge框架,通过自举生成-评估过程提升深度伪造检测模型推理能力并进行评估。
Pose-VLA通过解耦和预训练,提升VLA模型在机器人任务上的泛化性和效率。
DReX是一个可解释的深度学习多模态推荐框架,通过增量更新优化用户和物品表示。
本文提出一个基于Iconclass词汇表,结合YOLOv8和推荐算法的数字化艺术品分类和推荐系统。
提出TeHOR框架,利用文本和外观信息指导3D人体和物体联合重建,提升语义一致性和视觉逼真度。
该论文系统性地评估了数据匿名化对基于内容的图像检索性能的影响。
针对视觉语言模型在罕见物体推理上的不足,提出一种高效的即插即用模块,提升模型性能。
CLCR通过跨层语义协同表示,解决了多模态学习中语义不对齐和误差传播的问题,提升了表征质量。
提出了Tri-Subspace Disentanglement框架,通过解耦子空间提升多模态情感分析性能。
提出一种高效的LVLM对抗攻击检测防御方法,结合图像变换和数据整合,无需训练。
该论文提出一个多模态框架,用于对齐人类语言描述和视觉感知数据,并验证了其有效性。
针对VLA中视觉偏见导致的counterfactual failures,提出了LIBERO-CF基准和CAG缓解方法。
该论文提出了M-Attack-V2,通过精细化细节攻击显著提升了黑盒LVLM对抗攻击的成功率。
A.R.I.S. 通过深度学习 YOLOx 模型,实现了高效的电子垃圾自动分类和回收。
CORAL通过显式对齐人-物对应关系提升虚拟试穿效果,改善细节保留。
提出ArtToMus框架,用于直接将艺术作品转化为音乐,无需文本转换。
提出了AI GameStore,通过玩人类游戏来评估通用人工智能,并评估了VLMs的性能。
RetouchIQ提出了一种基于通用奖励模型的MLLM图像润饰框架,提升了图像编辑的语义一致性和感知质量。
GraphThinker通过构建事件图增强视频推理,利用强化学习减少幻觉。
LATA通过Laplacian平滑改进医学VLM的校准不确定性,提升预测效率和类别平衡。
提出QuPAINT框架,利用物理先验知识提升量子材料光学图像识别能力。
EAGLE利用专家模型引导MLLM,无需微调即可提升工业异常检测的准确性和可解释性。
提出一种多模态对比变分自编码器,用于解决非小细胞肺癌生存预测中模态缺失问题。
SpectralGCD利用CLIP跨模态相似性,通过谱滤波和知识蒸馏实现高效广义类别发现。
提出一种结合形式验证和深度学习的图像检索框架,提升复杂关系查询的可信度和可验证性。
SubQuad通过优化流程和目标函数,实现了免疫组库分析的加速、减负和公平性提升。
EA-Swin利用嵌入无关的Swin Transformer有效检测AI生成视频,并提出了新的EA-Video数据集。
利用AlphaEarth Embeddings和深度学习模型进行地表高度推断的研究,效果初步验证。
EntropyPrune通过矩阵熵指导视觉token剪枝,加速多模态大语言模型推理。
论文提出一种基于视觉信息增益的选择性训练方法,提升LVLM的视觉 grounding 能力并缓解语言偏见。
BadCLIP++提出了一种隐蔽且持久的多模态对比学习后门攻击框架,有效抵抗检测和微调。
TimeOmni-VL提出了一种视觉中心的时间序列统一模型,用于理解和生成任务,并引入了Bi-TSI和TSUMM-Suite。
提出一种基于显著性感知的多路径推理方法SAP,解决视觉语言模型推理中视觉信息利用不足的问题。
研究表明,在组合泛化任务中,当数据受限时,面向对象的表征优于密集表征。
提出了SAW-Bench,一个评估模型在真实世界视频中具身感知能力的基准。
提出CLIP-MHAdapter,一种基于注意力机制的CLIP轻量级适配方法,用于街景图像属性分类。
提出视频分类拆分任务,无需额外数据即可将粗粒度类别拆分为细粒度子类别,提升视频理解精度。
DressWild提出了一种从单张自然图像生成服装缝纫图案和3D模型的feed-forward方法。
提出了一种高效的Analytical Diffusion模型GoldDiff,通过动态选择“Golden Subset”加速推理,显著提升了模型的可扩展性。
提出Visual Self-Refine框架,利用像素级视觉反馈提升LVLM在图表解析中的准确性。
RoboGene自动化生成多样且符合物理规律的机器人任务,提升VLA预训练效果。
论文针对印度场景设计高效OCR系统,提出两种训练策略并构建了两个SOTA模型。
提出一种基于金字塔特征提取和UNI基础模型的自动病理报告生成框架。
ReMoRa通过精炼的运动表征,提升多模态大语言模型在长视频理解上的性能。
该论文研究了动态声源运动场景下的空间音频问答,并提出了相应的解决方案。
RefineFormer3D是一种高效的3D医学图像分割模型,兼顾精度和效率。
HyPCA-Net提出了一种混合并行融合的级联注意力网络,用于提升多模态医学图像分析的性能和效率。
FLAM分解场景为独立因子,学习隐变量动作,提升多实体环境下视频生成质量和策略学习。
论文提出了一种结合气象数据、天空图像和光伏历史数据的混合深度学习光伏功率预测方法。
该论文评估了多模态大语言模型在视觉表格属性归因任务上的表现,发现其归因能力远低于问答能力。
提出了ChartEditBench基准,用于评估多模态大模型在多轮图表编辑中的能力。
MRC-GAT模型通过结合多模态数据和图注意力网络,实现了阿尔茨海默病的高精度诊断。
CAMEL是首个用于预测心脏事件的ECG语言模型,优于现有方法。
CEMRAG通过融合临床概念和多模态RAG,提升放射报告生成的可解释性和准确性。
提出CARE Drive框架,评估自动驾驶视觉语言模型对人类理由的响应性,提高决策可解释性。
论文通过信息论方法分析多模态Transformer中视觉信息如何转化为语言。
提出PADE方法,利用LVLM内部注意力动态增强视觉核心区域,缓解幻觉问题。
提出语义引导的3D高斯溅射方法,有效去除多视角重建中的瞬态物体,提升重建质量。
首次系统评估开源多模态大语言模型在人脸变形攻击检测中的零样本能力,效果显著。
该论文研究了Vision-Language-Action模型中动作Tokenizers的设计原则,并提出了ActionCodec。
提出了用于评估视觉语言模型在热成像上的性能的结构化基准ThermEval,揭示了现有模型在该领域的不足。
COrAL框架通过正交化和非对称掩码,显式建模多模态数据的冗余、独特和协同信息,提升表征质量。
AnchorWeave通过局部几何记忆融合解决长时视频生成中全局三维重建不一致问题。
提出了一种基于CLIP语义对齐的Web规模多模态摘要框架。
CT-Bench数据集发布,包含CT病灶标注和多模态问答,用于提升AI病灶理解能力。
RF-GPT通过视觉编码器和LLM理解RF信号,实现无线通信领域的高级推理。
提出VIPA框架,通过视觉信息部分注意力机制提升指代图像分割精度。
提出GOT-JEPA,利用模型预测预训练框架和OccuSolver提升通用目标跟踪的泛化性和遮挡处理能力。
提出通用元学习框架和算法隐式学习概念,Transformer实现跨域、跨模态和高类别任务的元学习。
研究发现视觉和语篇 grounding 使信息分布更均匀,支持上下文相关的UID假设。
VIGIL提出了多模态图像重构中幻觉检测基准,并构建了多阶段检测流水线。
VariViT针对可变尺寸图像设计,通过改进的位置编码和批处理策略提升ViT在医学图像上的性能。
MATEO是一个多模态基准,用于评估LVLM在时间推理和规划方面的能力,特别是针对真实世界的任务。
DriveFine通过混合扩散VLA模型,结合生成与精炼专家,提升自动驾驶决策的精确性和鲁棒性。
MoRL通过强化学习和链式运动推理,统一运动理解与生成,显著提升逻辑推理和感知真实性。
比较TrOCR和Qwen在历史文本OCR上的误差模式,分析其对学术研究的影响。
验证方法比策略学习更有效地提升视觉-语言-动作对齐,并提出了CoVer框架。
UniT提出多模态链式思考测试时扩展框架,提升统一模型在复杂任务中的推理能力。
提出Categorical Flow Maps,加速类别数据的少步生成,实现优异性能。
UniDFlow通过解耦理解和生成,优化多模态偏好对齐,实现多模态任务的SOTA性能。
DeepGen 1.0提出轻量级多模态模型,在图像生成和编辑方面表现出色。
提出ExStrucTiny基准数据集,用于评估通用视觉语言模型在文档图像结构化信息抽取方面的能力。
论文提出了视觉推理基准VRB,用于评估MLLM解决小学视觉问题的能力,揭示了模型在空间推理方面的局限性。
SAM3-LiteText通过知识蒸馏,大幅减少SAM3文本编码器参数,提升视觉语言分割效率。
提出3DGSNav,利用3D高斯溅射增强视觉语言模型在对象导航中的空间推理能力。
论文提出Hadamard线性注意力(HLA),旨在以更高阶有理函数近似softmax,提高效率。
提出KAN-FIF轻量级框架,用于气象卫星上热带气旋的物理信息预测,精度高、速度快、参数少。
提出一种新型强化学习状态估计方法,通过学习度量空间提升多模态信息融合的鲁棒性。
论文研究局部视觉-语言模型在新生儿复苏活动识别上的应用,并超越了ViT。
提出Spatial Chain-of-Thought框架,提升扩散模型在空间理解和推理生成方面的能力。
该论文评估了VLMs在法语PDF转Markdown上的性能,并提出了新的评估基准。
论文提出了任务可适应的VAE模型(TAVAE),用于解释视觉皮层中的上下文调制现象。
提出了IncompeBench,一个用于音乐信息检索的高质量、开放许可基准测试集。
提出一种多任务学习框架,利用FR指标作为监督信号,提升游戏视频的无参考视频质量评估。
提出Region-to-Image Distillation方法,提升MLLM在细粒度多模态感知上的单次推理能力。
该论文提出JEPA-VLA模型,通过融入视频预测嵌入提升VLA模型在机器人操作任务中的性能和泛化性。
Hi-SAM通过解耦语义标记和分层Transformer结构,提升多模态推荐系统的效果,并在大规模场景下验证有效性。
Code2Worlds框架利用编码LLM生成具有物理规律的动态4D世界,解决多尺度和语义物理鸿沟问题。
提出自适应去偏Tsallis熵(ADTE)用于测试时自适应,解决CLIP模型在不平衡数据上的偏差问题。
该论文提出了一种基于目标对齐视觉对比解码的方法,旨在缓解多模态大语言模型中的目标幻觉问题。
针对电商场景,论文提出了一种适配通用视觉语言模型的方法,并构建了新的评估体系。
提出STVG-R1,通过视觉提示和强化学习,在时空视频定位任务上实现SOTA。
提出Vector-to-Graph方法,解决MLLM在工程图审核中结构盲视问题,提升审核准确率。
TD-FusionUNet模型利用哈达玛变换和DCT进行野火蔓延预测,在精度和效率间取得平衡。
EmoSpace提出了一种基于视觉-语言对齐的细粒度情感原型学习框架,用于生成沉浸式情感内容。
SToRM通过监督式Token缩减,在保证性能的同时显著降低多模态LLM在自动驾驶中的计算成本。
GENIUS评估UMM在生成式流体智力方面的能力,提出新的评估标准和方法。
GameDevBench是一个评估智能体游戏开发能力的多模态基准测试。
ViLaVT通过语言引导的特征调制,增强了LVLM在多图和视频空间推理上的能力。
Hibiki-Zero无需对齐数据即可实现同步语音翻译,并通过强化学习优化延迟。
Pram利用多模态语言模型解决多商品流问题,实现高效且鲁棒的资源分配。
研究金融图像表示的多视角学习和对抗鲁棒性,探索融合策略对预测性能的影响。
CLEF 2026 FinMMEval Lab推出首个多语言多模态金融LLM评估框架,包含三个互联任务。
提出Chart Specification,通过结构化表示和细粒度监督提升VLM图表转代码的结构保真度。
FlowCache提出了一种针对自回归视频生成的缓存框架,显著加速视频生成。
该论文解释了RL在VLM后训练中泛化性优于SFT的原因,并提出难度引导的SFT方法。
论文提出了CyclingVQA基准测试,评估VLMs在自行车辅助空间感知和规划中的泛化能力。
提出了一种基于强化学习和课程学习的领域自适应VLM训练方法RCPA。
该论文提出了一种基于扩散模型的生成先验方法,用于解决稀疏视图CT重建问题。
该论文研究了VLM和纯视觉backbone在端到端驾驶中的互补性,并提出了结合二者优势的混合驾驶方案。
提出了一个大规模动态视觉推理数据集TwiFF-2.7M,并提出了相应的TwiFF模型,在动态视觉问答任务上取得了显著提升。
提出MP-HOI框架,利用多模态先验指导文本驱动的3D人-物交互动作生成,提升交互真实性。
VLA-JEPA通过无泄漏的状态预测,提升视觉-语言-动作模型在泛化性和鲁棒性方面的表现。
Fake-HR1自适应地进行推理,提升了图像合成检测的效率和性能。
提出基于扩散模型的耦合推理框架,用于语义分解任务,优于传统谐振器网络。
论文提出VersaViT,通过多任务协作训练优化MLLM中的视觉骨干网络,提升其在视觉任务上的性能。
Reason-IAD通过知识引导和动态推理提升工业异常检测的准确性和可解释性。
提出了ARK基准,用于评估多模态检索在知识和推理方面的能力,并分析了现有模型的不足。
SAKED通过稳定知识解码降低LVLM幻觉,提升视觉语言模型的可靠性。
Covo-Audio提出了一个7B参数的端到端语音LLM,在多项任务中表现出色。
研究通过忠实度分析,提升医学扩散模型在MRI合成中的可解释性,增强AI在医疗应用中的可信度。
提出一种基于离散通信的自监督学习方法,通过二元编码学习结构化视觉表示。
该论文提出VideoAfford,利用多模态大语言模型进行视频中3D可供性的学习和推理。
LELA是首个基于LLM的无训练视频仇恨内容定位框架,优于现有无训练基线。
MieDB-100k是一个大规模、高质量的医学图像编辑数据集,促进医学图像编辑模型的发展。
该论文提出一种基于视觉-语言表征的谱聚类方法,显著提升了聚类性能。
Singpath-VL是一种用于宫颈细胞学AI辅助诊断的多模态大模型,通过合成数据集和微调实现。
提出了一种训练自由的视觉注意力干预算法,通过增强任务相关视觉token的注意力来减少LVLM中的幻觉。
提出XMCC,一种可解释的多模态CoT压缩器,通过强化学习优化压缩决策,提升推理效率并提供可解释性。
该论文提出了一种新颖的知识蒸馏框架Align-TI,用于压缩多模态大语言模型,提升性能。
ArtifactLens利用少量标注数据,解锁预训练VLM的伪影检测能力,在AIGC领域实现SOTA。
ArcFlow通过非线性流蒸馏加速文本到图像的生成,实现高质量快速生成。
GEBench提出了一个评估GUI图像生成模型在动态交互和时间一致性方面的基准。
研究人机协作中语言和手势如何演化为高效的共享抽象,并构建多模态协同模型。
AnomSeer通过强化MLLM对时序数据结构细节的推理,提升了异常检测、定位和解释的精度。
TiFRe通过文本引导的帧采样和帧匹配融合,在减少计算成本的同时提升视频语言任务性能。
开发了一种用于鼻咽癌MRI图像合成的统一基础模型,提升RT规划准确性。
Omni-Video 2利用MLLM理解用户指令,指导视频扩散模型实现统一的视频生成与编辑。
提出基于预训练模型的零样本方法,用于CT和MR图像的自动身体区域检测。
OV-Encoder通过编解码器对齐的稀疏性,在多模态理解上取得显著性能提升。
论文提出一种顶向下注意力机制,增强全局工作空间架构在多模态任务中的噪声鲁棒性和泛化能力。
该论文提出了一种通过rollout增强学习视觉语言模型自校正能力的方法,并在多个基准测试中取得了领先成果。
Vista针对流式视频QA,提出场景感知的优化方案,实现高效且可扩展的推理。
提出Demo-ICL任务和基准,用于评估MLLM从视频演示中学习的能力,并提出Demo-ICL模型。
提出BiManiBench基准测试MLLM在双臂操作中的空间推理、规划和控制能力。
提出了电商短视频理解基准E-VAds,并设计了基于RL的推理模型E-VAds-R1。
论文提出了一个用于评估LVLMs视觉推理过程奖励模型的综合基准测试。
CoTZero通过无标注的分层合成CoT数据,提升视觉语言模型的人类水平视觉推理能力。
论文提出了UReason基准测试,揭示了统一多模态模型中推理在视觉合成中的悖论现象。
V-Retrver通过视觉证据驱动的Agent推理,提升通用多模态检索的准确性和可靠性。
论文刻画了扩散模型的泛化能力,提出了基于数据依赖的脊流形,并分析了推理过程中的reach-align-slide现象。
GenArena提出一种基于pairwise比较的视觉生成模型评估框架,提升了评估的稳定性和与人类感知的对齐。
提出RISE-Video基准测试,评估视频生成模型在理解隐式世界规则方面的推理能力。
LSA通过对齐语义特征增强交通视频生成的时间一致性,无需额外控制信号。
OmniVideo-R1通过查询意图和模态注意力增强音视频推理能力,提升了混合模态理解性能。
提出FSR框架,模拟人类视觉机制,有效剪枝VLMs中的视觉tokens,提升效率与精度。
提出了变分推测解码VSD,通过优化草稿路径来加速LLM和MLLM的推理,提高解码效率。
提出了AGFF-Embed,自适应融合全局和细粒度信息的MLLM嵌入,并结合EGA提升性能。
该论文研究了视觉语言模型(VLM)潜在空间的政治和文化倾向,揭示了模型间的显著差异。
研究了LLM如何辅助医护人员理解患者健康数据,提升临床决策效率。
Shiva-DiT通过残差学习的可微Top-k选择加速Diffusion Transformer。
LoGoSeg通过融合局部和全局特征,实现了高效且泛化性强的开放词汇语义分割。
该论文提出了一种迭代精炼框架,提升视觉语言模型在几何空间推理方面的能力。
VLN-Pilot利用大型视觉语言模型实现室内无人机自主导航,无需人工遥控。
构建多模态数据集,开发AI模型辅助成釉细胞瘤诊断与治疗决策。
DECO提出了一种解耦多模态扩散Transformer,用于灵巧双臂操作。
XEmoGPT提出了一种可解释的多模态情感识别框架,提升了情感线索感知和推理能力。
SOMA-1M是一个大规模、多分辨率、像素级对齐的SAR-光学遥感数据集,促进多模态遥感算法研究。
LMMRec利用LLM提取动机,融合多模态信息,提升推荐系统性能。
提出了BusyBox,一个评估VLA模型在操作具有熟悉物理特征的新物体时泛化能力的物理基准。
论文揭示了多语言视觉-语言模型在非西方文化背景下的反事实幻觉问题,并提出了新的评估基准。
提出一种基于并行Swin Transformer的3D MRI合成CT方法,用于MRI引导的放疗计划。
Dolphin-v2通过可扩展的Anchor Prompting实现了通用文档解析,提升了多种文档的解析性能。
VRIQ基准测试VLMs的视觉推理能力,发现感知是主要瓶颈。
RAL通过强化学习直接优化多模态LLM的内部注意力分布,提升感知能力和跨模态对齐。
Mask-LLaVA通过结合多层次视觉特征,实现了视觉语言模型的高效推理,减少了计算需求。
本文提出了一种基于深度学习的指甲疾病分类方法,利用对抗训练和Grad-CAM可视化提高模型的可靠性和可解释性。
OmniSIFT提出了一种模态非对称的token压缩框架,用于优化多模态大模型的效率。
VISTA-Bench揭示了现有VLM在理解视觉化文本时存在显著的性能下降,与纯文本理解能力有较大差距。
NeuroCanvas利用VLLM将多通道脑电信号转化为图像,实现高效鲁棒的癫痫检测。
提出了一个双阶段TransUNet框架,用于融合多源降水数据,提升季节性和极端降水估计。
纵向评估了多模态LLM的安全性,发现其抗对抗性攻击能力随迭代发生漂移。
APE通过视觉查询交互式地帮助用户优化文本到图像生成的提示词,提升图像与用户意图的对齐。
ERNIE 5.0 是一个统一多模态理解和生成的原生自回归基础模型,具有弹性训练和MoE架构。
提出一种基于视觉语言模型(VLM)的无标注航天器检测与分割框架,显著提升了航天器图像处理性能。
提出RGBD指代多目标跟踪任务,构建DRSet数据集,提出DRTrack框架。
AGILE利用Agentic生成方法,从视频中重建鲁棒的、物理上合理的交互物体。
PIO-FVLM通过目标导向的视觉token缩减加速VLM推理,保持性能的同时显著提升效率。
LEAD方法通过层级专家对齐解码,提升放射报告生成的准确性并减少幻觉。
VILLAIN系统通过多智能体协作,使用视觉-语言模型验证图像-文本声明,并在AVerImaTeC任务中取得领先。
提出DU-VLM模型,用于理解图像退化并用于图像复原,通过分层结构预测任务和多模态链式思考实现。
EgoActor通过VLM将高层指令转化为机器人具体的空间感知行为。
BrainVista通过多模态自回归框架模拟自然状态下大脑的动态预测,实现先进的fMRI编码。
Model-Dowser通过参数重要性评估进行稀疏微调,有效缓解多模态大模型中的灾难性遗忘。
该论文提出一种新的多模态大型语言模型(MLLM)方法,用于解决GMNER中的模态偏差问题,提升性能。
VaLR通过动态生成视觉对齐的潜在token,提升MLLM在多步推理中的视觉信息保持能力。
Seg-ReSearch通过交错推理和外部搜索,突破MLLM的知识瓶颈,提升了分割性能。
该论文研究了五种突厥语机器翻译,利用合成数据和检索方法优化了翻译效果。
提出了首个综合性的医学多模态联邦学习(MMFL)基准Med-MMFL,促进该领域研究。
提出H-GIVR框架,通过历史信息引导迭代视觉推理,动态纠错,提高多模态大模型的推理准确性。
SAGA是一种基于注意力机制的对抗攻击方法,能高效攻击大型视觉语言模型。
该论文比较了视觉语言模型在文本和图像形式的空间n-back任务中的工作记忆表现,发现文本形式表现更优。
提出基于双Prompt调整的主动CLIP适应框架,显式建模不确定性以优化样本选择。
CoFT提出了一种无需人工标注的视觉语言模型微调框架,通过双模型协作提升性能。
该论文提出了一种层自适应的视觉定位和解码增强方法,提升了视觉问答任务的性能。
提出Guided Verifier框架,通过动态验证器实时监督MLLM推理过程,减少错误传播,提升推理能力。
ECG-R1通过协议引导和模态解耦,提升MLLM在心电图判读的可靠性。
KVSmooth通过平滑KV-Cache,缓解多模态大语言模型中的幻觉问题,无需额外训练。
QVLA提出了一种面向具身控制的动作中心量化框架,有效压缩VLA模型并提升性能。