Multimodal Learning 相关度: 8/10

IAD-Unify: A Region-Grounded Unified Model for Industrial Anomaly Segmentation, Understanding, and Generation

Haoyu Zheng, Tianwei Lin, Wei Wang, Zhuonan Wang, Wenqiao Zhang, Jiaqi Zhu, Feifei Shao
arXiv: 2604.12440v1 发布: 2026-04-14 更新: 2026-04-14

AI 摘要

IAD-Unify提出一种统一的工业异常检测框架,实现分割、理解和生成三项任务。

主要贡献

  • 提出IAD-Unify双编码器统一框架
  • 构建Anomaly-56K综合评估平台
  • 验证了区域定位对理解的重要性

方法论

使用冻结的DINOv2提取区域特征,通过token注入到Qwen3.5-4B视觉语言模型,实现多任务联合。

原文摘要

Real-world industrial inspection requires not only localizing defects, but also explaining them in natural language and generating controlled defect edits. However, existing approaches fail to jointly support all three capabilities within a unified framework and evaluation protocol. We propose IAD-Unify, a dual-encoder unified framework in which a frozen DINOv2-based region expert supplies precise anomaly evidence to a shared Qwen3.5-4B vision-language backbone via lightweight token injection, jointly enabling anomaly segmentation, region-grounded understanding, and mask-guided generation. To enable unified evaluation, we further construct Anomaly-56K, a comprehensive unified multi-task IAD evaluation platform, spanning 59,916 images across 24 categories and 104 defect variants. Controlled ablations yield four findings: (i) region grounding is the decisive mechanism for understanding, removing it degrades location accuracy by >76 pp; (ii) predicted-region performance closely matches oracle, confirming deployment viability; (iii) region-grounded generation achieves the best full-image fidelity and masked-region perceptual quality; and (iv) pre-initialized joint training improves understanding at negligible generation cost (-0.16 dB). IAD-Unify further achieves strong performance on the MMAD benchmark, including categories unseen during training, demonstrating robust cross-category generalization.

标签

工业异常检测 多模态学习 视觉语言模型 统一框架

arXiv 分类

cs.CV cs.AI