arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-13 至 2026-02-13 共收录 46 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2602.11636 2026-02-13 cs.CV cs.AI 81%

ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning

ScalSelect: 可扩展的无训练多模态数据选择用于高效的视觉指令微调

Changti Wu, Jiahuai Mao, Yuzhuo Miao, Shijie Lian, Bin Yu, Xiaopeng Lin, Cong Huang, Lei Zhang, Kai Chen

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ScalSelect提出一种无训练、可扩展的多模态数据选择方法,通过线性时间复杂度实现高效视觉指令微调,实验显示其性能接近甚至超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/ScalSelect}{ScalSelect}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11733 2026-02-13 cs.CV cs.AI 62%

Adapting Vision-Language Models for E-commerce Understanding at Scale

大规模电商理解中的视觉-语言模型适应

Matteo Nulli, Vladimir Orshulevich, Tala Bazazo, Christian Herold, Michael Kozielski, Marcin Mazur, Szymon Tuzel, Cees G. M. Snoek, Seyyed Hadi Hashemi, Omar Javed, Yannick Versley, Shahram Khadivi

机构 * eBay Inc.(eBay公司) University of Amsterdam(阿姆斯特丹大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种方法,通过大规模实验研究,展示如何通过针对性适应通用视觉-语言模型以提升电子商务性能,同时保持多模态能力,并提出新的评估套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05578 2026-02-13 cs.CV 57%

LoGoSeg: Integrating Local and Global Features for Open-Vocabulary Semantic Segmentation

LoGoSeg:整合局部和全局特征以实现开放词汇语义分割

Junyang Chen, Xiangbo Lv, Zhiqiang Kou, Xingdong Sheng, Ning Xu, Yiguo Qiao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 LoGoSeg通过整合局部和全局特征,提升开放词汇语义分割的精度与效率,减少幻觉和漏检问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07497 2026-02-13 cs.CL 57%

From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection

从本土迷因到全球监管:跨文化评估视觉-语言模型在仇恨迷因检测中的应用

Mo Wang, Kaixuan Ren, Pratik Jalan, Ahmed Ashraf, Tuong Vy Vu, Rahul Seetharaman, Shah Nawaz, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Nile University(尼罗大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Johannes Kepler University(约翰尼斯·开普勒大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过跨文化评估揭示视觉-语言模型在仇恨迷因检测中的文化偏见问题,并提出本土语言提示和一样本学习等改进策略以提升模型的公平性和鲁棒性。

Comments 12 pages, 5 figures, Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2602.11596 2026-02-13 cs.AI 70%

MAPLE: Modality-Aware Post-training and Learning Ecosystem

MAPLE: 多模态感知的后训练与学习生态系统

Nikhil Verma, Minjung Kim, JooYoung Yoo, Kyung-Min Jin, Manasa Bharadwaj, Kevin Ferreira, Ko Keun Kim, Youngjoon Kim

机构 * LG Electronics Toronto AI Lab, Toronto, Canada(LG电子多伦多AI实验室) LG Electronics CTO AI Lab, Seoul, Republic of Korea(LG电子CTO AI实验室)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 MAPLE通过模态感知的后训练与学习生态系统,提升多模态强化学习的准确性、收敛速度和稳定性。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10078 2026-02-13 cs.SD cs.LG 67%

Improving Speech Emotion Recognition with Mutual Information Regularized Generative Model

通过互信息正则化生成模型改进语音情感识别

Chung-Soo Ahn, Rajib Rana, Sunil Sivadas, Carlos Busso, Jagath C. Rajapakse

机构 * College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院) University of Southern Queensland(南方昆士兰大学) NCS Group(NCS集团) Language Technologies Institute, School of Computer Science, Carnegie Mellon University(计算机科学学院语言技术研究所,卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出了一种基于互信息正则化的生成模型,通过跨模态对齐和特征合成提升语音情感识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09378 2026-02-13 cs.SD cs.AI cs.MM eess.AS 67%

Prevailing Research Areas for Music AI in the Era of Foundation Models

基础模型时代音乐AI的主流研究领域

Megan Wei, Mateusz Modrzejewski, Aswin Sivaraman, Dorien Herremans

机构 * Brown University(布朗大学) Warsaw University of Technology(华沙技术大学) Indiana University(印第安纳大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文探讨了基础模型时代音乐AI的研究领域,涵盖基础模型、多模态系统、数据集、效率、生成模型应用及版权问题,旨在揭示未来研究方向。

Journal ref Proceedings of Machine Learning Research, PMLR 303:1-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11941 2026-02-13 cs.IR cs.AI 57%

IncompeBench: A Permissively Licensed, Fine-Grained Benchmark for Music Information Retrieval

IncompeBench: 一个宽松许可、细粒度的音乐信息检索基准

Benjamin Clavié, Atoof Shakir, Jonah Turner, Sean Lee, Aamir Shakir, Makoto P. Kato

机构 * National Institute of Informatics (NII)(日本国立信息学研究所) ETHZ(苏黎世联邦理工学院) University of Tsukuba(茨口大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 IncompeBench提供了一个高质量、宽松许可的音乐信息检索基准,包含大量标注数据和多样化查询,用于评估和改进音乐检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04899 2026-02-13 cs.AI 57%

Human Behavior Atlas: Benchmarking Unified Psychological and Social Behavior Understanding

人类行为图谱:统一心理与社会行为理解的基准测试

Keane Ong, Wei Dai, Carol Li, Dewei Feng, Hengzhi Li, Jingyao Wu, Jiaee Cheong, Rui Mao, Gianmarco Mengaldo, Erik Cambria, Paul Pu Liang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 人类行为图谱通过统一基准和三种模型提升心理与社会行为理解的多模态性能

Comments Accepted to ICLR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08930 2026-02-13 cs.SD 50%

No Word Left Behind: Mitigating Prefix Bias in Open-Vocabulary Keyword Spotting

无词遗留:减轻开放式词汇关键词定位中的前缀偏差

Yi Liu, Chuan-Che Huang, Xiao Quan

机构 * University of California San Diego, Dept. of Electrical and Computer Engineering(加州大学圣迭戈分校电子与计算机工程系) Bose Corporation(博世公司)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出EPS方法,通过减轻开放式词汇关键词定位中的前缀偏差,显著提升识别准确率,同时保持其他数据集的性能。

Comments Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2506.18314 2026-02-13 q-bio.QM cs.LG q-bio.NC 86%

BrainSymphony: A parameter-efficient multimodal foundation model for brain dynamics with limited data

BrainSymphony: 一种参数高效、多模态的基础模型,用于在有限数据下的脑动态

Moein Khajehnejad, Forough Habibollahi, Devon Stoliker, Adeel Razi

机构 * Turner Institute for Brain and Mental Health(大脑与心理健康Turner研究所) School of Psychological Sciences, Monash University(墨尔本大学心理学科学学院) Cortical Labs(皮层实验室) CIFAR Azrieli Global Scholars Program(CIFAR阿兹里埃利全球学者计划)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 BrainSymphony是一种参数高效、多模态的基础模型,通过整合fMRI和扩散MRI数据,实现有限数据下的脑动态分析,优于更大模型并提升神经科学应用。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11455 2026-02-13 cs.AI 83%

Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning

应得之 credit:跨模态连接驱动精确强化学习用于 MLLM 推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, SJTU(EPIC实验室,上海交通大学)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 通过跨模态连接驱动精确强化学习,提升多模态大语言模型的推理能力,仅引入1.2%开销即超越基线模型。

Comments 20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22335 2026-02-13 cs.RO cs.CV 57%

UP-SLAM: Adaptively Structured Gaussian SLAM with Uncertainty Prediction in Dynamic Environments

UP-SLAM:适应性结构高斯SLAM与动态环境中的不确定性预测

Wancai Zheng, Linlin Ou, Jiajie He, Libo Zhou, Xinyi Yu, Yan Wei

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UP-SLAM通过并行框架解耦跟踪与建图,利用概率八叉树和不确定性估计器提升动态环境中的SLAM性能。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2504.04988 2026-02-13 cs.CV cs.AI 84%

Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model

遥感检索增强生成:通过多模态数据集和检索增强生成模型连接遥感图像与综合知识

Congcong Wen, Yiting Lin, Xiaokang Qu, Nan Li, Yong Liao, Xiang Li, Hui Lin

机构 * School of Cyber Science and Technology, University of Science and Technology of China(信息科学技术学院,中国科学技术大学) China Academy of Electronics and Information Technology(电子信息技术研究院)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-RAG框架,通过多模态数据集和检索增强生成模型,提升遥感图像与综合知识的连接能力,有效提升复杂查询的语义推理性能。

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine (GRSM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11737 2026-02-13 cs.CV cs.CL 81%

Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding

关注关键要素:通过对象对齐的视觉对比解码缓解多模态大语言模型中的对象幻觉

Boqi Chen, Xudong Liu, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) Amazon(亚马逊) MBZUAI(穆罕默德·本·拉什德智能科学技术研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种通过对象对齐的视觉对比解码缓解多模态大语言模型中对象幻觉的方法,具有计算开销低且兼容性强的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09255 2026-02-13 cs.RO cs.AI 79%

STaR: Scalable Task-Conditioned Retrieval for Long-Horizon Multimodal Robot Memory

STaR:可扩展的任务条件检索用于长时多模态机器人记忆

Mingfeng Yuan, Hao Zhang, Mahan Mohammadi, Runhao Li, Jinjun Shan, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究所) University of Toronto Robotics Institute(多伦多大学机器人研究所) Department of Earth and Space Science(地球与空间科学系) Lassonde School of Engineering(拉索nde工程学院) York University(约克大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 STaR通过任务条件检索算法提升机器人长时多模态记忆的可扩展性和上下文推理能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11673 2026-02-13 cs.CV 57%

RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval

RI-Mamba:用于鲁棒文本到形状检索的旋转不变Mamba

Khanh Nguyen, Dasith de Silva Edirimuni, Ghulam Mubashar Hassan, Ajmal Mian

机构 * The University of Western Australia(西澳大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 RI-Mamba是一种旋转不变的状态空间模型,用于提升文本到形状检索的鲁棒性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11223 2026-02-13 cs.SE cs.HC 50%

Patient Digital Twins for Chronic Care: Technical Hurdles, Lessons Learned, and the Road Ahead

慢性病护理中的患者数字双胞胎:技术障碍、经验教训与未来之路

Micheal P. Papazoglou, Bernd J. Krämer, Mira Raheem, Amal Elgammal

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文探讨了患者医疗数字双胞胎在慢性病护理中的技术挑战与未来发展方向,提出了基于本体驱动建模和联邦分析的实施方法,并强调了标准对齐、隐私治理和多模态推理等关键技术。

Comments Feature Article, Patient Medical Digital Twins, Under Review in IEEE SOftware

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 2 篇

2602.12160 2026-02-13 cs.CV 57%

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11980 2026-02-13 cs.CV 57%

Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation

空间链式思考:连接理解与生成模型以实现空间推理生成

Wei Chen, Yancheng Long, Mingqiao Liu, Haojie Ding, Yankai Yang, Hongyang Wei, Yi-Fan Zhang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SCoT框架,通过结合MLLMs的推理能力与扩散模型的生成能力,提升空间推理生成任务的性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 11 篇

2510.23276 2026-02-13 cs.CL 83%

A Cocktail-Party Benchmark: Multi-Modal dataset and Comparative Evaluation Results

宴会派对基准:多模态数据集和比较评估结果

Thai-Binh Nguyen, Katerina Zmolikova, Pingchuan Ma, Ngoc Quan Pham, Christian Fuegen, Alexander Waibel

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院) Carnegie Mellon University, USA(卡内基梅隆大学) Interactive-AI LLC(Interactive-AI公司) Meta AI, UK(Meta AI)

专题命中 多模态评测 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CL

AI总结 本文提出多模态上下文感知识别任务,通过结合音频和视觉线索提升重叠对话识别性能,展示多模态在解决宴会派对问题中的关键作用。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 81%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11340 2026-02-13 cs.AI 79%

Bi-Level Prompt Optimization for Multimodal LLM-as-a-Judge

双层提示优化用于多模态LLM作为裁判

Bo Pan, Xuan Kan, Kaitai Zhang, Yan Yan, Shunwen Tan, Zihao He, Zixin Ding, Junjie Wu, Liang Zhao

机构 * Meta AI Emory University(埃默里大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出BLPO框架,通过双层优化提升多模态LLM在评估AI生成图像时的提示效果,解决上下文限制导致的优化瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12087 2026-02-13 cs.LG 78%

Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL

不确定性几何:用于强化学习中多模态状态估计的度量空间学习

Alfredo Reichlin, Adriano Pacciarelli, Danica Kragic, Miguel Vasco

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习系) KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种学习多模态状态估计的度量空间方法,通过自适应整合多种传感器模态,提升了RL任务中的鲁棒性和状态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09523 2026-02-13 cs.CV 70%

Singpath-VL Technical Report

Singpath-VL 技术报告

Zhen Qiu, Kaiwen Xiao, Zhengwei Lu, Xiangyu Liu, Lei Zhao, Hao Zhang

机构 * LBP Singpath AI Lab(LBP Singpath人工智能实验室)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 Singpath-VL通过合成数据集和多阶段微调,提升宫颈细胞学中的细粒度形态感知与诊断分类能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 67%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11678 2026-02-13 cs.AI cs.CV 62%

Beyond Pixels: Vector-to-Graph Transformation for Reliable Schematic Auditing

超越像素:用于可靠图示审计的向量到图转换

Chengwei Ma, Zhen Tian, Zhou Zhou, Zhixian Xu, Xiaowei Zhu, Xia Hua, Si Shi, F. Richard Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Guangdong Power Grid Co., Ltd.(广东电网公司) Shanghai University(上海大学) Carleton University(卡尔顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出向量到图转换方法,通过将CAD图转换为属性图,提升工程图示审计的准确性,克服基于像素方法的局限性。

Comments 4 pages, 3 figures. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10081 2026-02-13 cs.CL cs.AI 62%

Anagent For Enhancing Scientific Table & Figure Analysis

一个增强科学表格及图表分析的代理

Xuehang Guo, Zhiyong Lu, Tom Hope, Qingyun Wang

机构 * College of William \& Mary The Allen Institute for AI (AI2)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07011 2026-02-13 cs.CV cs.AI eess.IV 62%

MAU-GPT: Enhancing Multi-type Industrial Anomaly Understanding via Anomaly-aware and Generalist Experts Adaptation

MAU-GPT:通过异常感知和通用专家适应增强多类型工业异常理解

Zhuonan Wang, Zhenxuan Fan, Siwen Tan, Yu Zhong, Yuqian Yuan, Haoyuan Li, Hao Jiang, Wenqiao Zhang, Feifei Shao, Hongwei Wang, Jun Xiao

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MAU-GPT通过异常感知和通用专家适应机制,提升多类型工业异常理解的性能,实现更高效的质量控制。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06352 2026-02-13 cs.AI cs.HC 57%

Leveraging Generative AI for Human Understanding: Meta-Requirements and Design Principles for Explanatory AI as a new Paradigm

利用生成式AI实现人类理解:解释性AI作为新范式的核心要求与设计原则

Christian Meske, Justin Brenne, Erdi Uenal, Sabahat Oelcer, Ayseguel Doganguen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出解释性AI作为新范式,通过生成式AI能力帮助人类理解和决策,定义五个核心维度和十条设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏