Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System
Fair-Eye Net:一种公平、可信的多模态集成青光眼全流程人工智能系统
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 Fair-Eye Net通过多模态融合和公平性优化,实现青光眼全流程AI系统,提升诊断准确性与公平性,助力全球眼科健康公平。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Fair-Eye Net:一种公平、可信的多模态集成青光眼全流程人工智能系统
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 Fair-Eye Net通过多模态融合和公平性优化,实现青光眼全流程AI系统,提升诊断准确性与公平性,助力全球眼科健康公平。
一种用于通用膝部病理的多模态视觉基础模型
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 OrthoFoundation是一种多模态视觉基础模型,通过自监督学习在膝关节影像上实现高泛化能力,提升骨科影像诊断的准确性和效率。
MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准
机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。
DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估
机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) ; Vantor, Linköping, Sweden(林奈瑞典)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。
Comments Under review at ICPR 2026
Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。
ME-WARD:一种多模态人体工学分析工具,用于从惯性与视频数据中评估肌肉骨骼风险
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 ME-WARD是一种多模态工具,利用惯性和视频数据评估人体工学风险,通过整合多种运动捕捉技术提供可靠且经济的解决方案。
Comments 19 pages
Journal ref Expert Systems With Applications 278 (2025) 127212
UniPACT:一种多模态框架,用于基于原始ECG和结构化EHR的预后问题回答
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 UniPACT通过多模态融合和结构化提示机制,实现对ECG和EHR的预后问题回答,取得优异的AUROC性能。
Comments Accepted to IEEE ICASSP 2026
领域感知的几何多模态学习用于多领域蛋白质-配体亲和力预测
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 DAGML通过领域感知的几何多模态学习框架,有效提升多领域蛋白质-配体亲和力预测的准确性和鲁棒性。
VaseVQA: 古代希腊陶器的多模态代理与基准
机构 * University of Adelaide(阿德莱德大学) ; University of Liverpool(利物浦大学) ; University of Technology Sydney(悉尼技术大学) ; The Australian National University(澳大利亚国立大学) ; La Trobe University(拉特罗布大学)
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。
PixFoundation: 我们在像素级视觉基础模型的方向正确吗?
专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。
Comments Under Review
SpatialMath: 基于空间认知的符号推理框架用于数学问题解决
机构 * Indian Institute of Technology Delhi(印度理工学院德里) ; Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎克) ; Microsoft Research(微软研究院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 SpatialMath通过整合空间表示到结构化符号推理链中,提升多模态模型在视觉密集型数学问题中的推理能力。
EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理
机构 * Zhongguancun Laboratory(中关村实验室) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。
StyleDecoupler: 可泛化艺术风格解耦
机构 * Wechat AI, Tencent, China(腾讯微信AI,腾讯,中国)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 StyleDecoupler通过信息论方法分离多模态视觉模型中的纯风格特征,实现艺术风格的可泛化解耦,并在大规模艺术数据集上展示出强大的风格检索和生成模型评估能力。
基于高斯混合Copula模型的场景参数联合概率估计
机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ; Department of Computer Science, University of Tübingen(图宾根大学计算机科学系)
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出利用高斯混合Copula模型对自动驾驶场景参数进行联合概率估计,通过实验证明其在安全验证中的有效性。
Comments 9 pages, 4 figures; This work has been submitted to the IEEE for possible publication; Code available at: https://codeocean.com/capsule/1003615/tree
MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft Research(微软研究院) ; CMU(卡内基梅隆大学) ; Rutgers University(罗格斯大学) ; Yale University(耶鲁大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。
Comments ICLR 2026
MultiVis-Agent:一种带有逻辑规则的多智能体框架,用于可靠且全面的跨模态数据可视化
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong University of Science(香港科学大学)
专题命中 多模态Agent :cross-modal(title);multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 MultiVis-Agent通过引入逻辑规则的多智能体框架,提升多模态数据可视化的可靠性与全面性,实现高评分和高完成率。
Comments Accepted to SIGMOD 2026
SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境
机构 * University of Virginia(弗吉尼亚大学) ; UC San Diego(加州大学圣地亚哥分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。
Comments Conference: NeurIPS 2025 (main)
为何保留你的怀疑?多智能体老虎机系统中的视觉不确定性交易
机构 * Sun Yat-sen University(中山大学) ; University of Washington(华盛顿大学) ; Snap Inc.(Snap公司) ; Syracuse University(雪城大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 Agora通过去中心化市场交易机制提升多智能体系统在视觉任务中的协调效率与经济性。
Comments Accepted to ICLR 2026
代理AI在软物质中的自主实验室:分类、基准和开放挑战
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本文探讨了自主实验室在软物质中的应用,提出了基于智能体的环境交互框架,回顾了闭环实验的主要方法,并指出了多模态表示、校准不确定性、安全探索和共享基准基础设施等开放挑战。
DV-VLN:基于可靠大语言模型的视觉-语言导航的双重验证
机构 * Robotics Engineering Program, College of Engineering, Zhejiang Normal University(浙江师范大学工程学院机器人工程专业) ; Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Department of Health Technology and Informatics, The Hong Kong Polytechnic University(香港理工大学健康科技与信息技术系)
专题命中 多模态Agent :cross-modal(abstract)
AI总结 DV-VLN通过生成-验证范式提升大语言模型在视觉-语言导航中的可靠性,通过双重验证机制提高导航决策的准确性和可解释性。
针对代理编码助手的提示注入攻击:对技能、工具和协议生态系统漏洞的系统分析
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文系统分析了代理编码助手的提示注入攻击漏洞,提出三维分类法并揭示防御不足,强调需架构级防护而非碎片化措施。
通过同质Transformer模型实现无配对多模态数据的联邦学习
机构 * Department of Biomedical Engineering, Linköping University, Sweden(_linköping大学生物医学工程系) ; Department of Computer and Information Science, Linköping University, Sweden(_linköping大学计算机与信息科学系) ; Center for Medical Image Science and Visualization (CMIV), Linköping University, Sweden(_linköping大学医学影像科学与可视化中心)
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);multimodal foundation model(abstract)
AI总结 本文提出通过同质Transformer模型实现联邦学习,解决无配对多模态数据的训练问题,通过公共锚点对齐和子空间稳定化微调方法,在不传输私有数据的情况下实现全局模型统一表示。
DeepInsert: 早期层绕过以实现高效且高性能的多模态理解
机构 * UIUC(伊利诺伊大学) ; Amazon(亚马逊) ; Capital One ; Apple(苹果) ; Stony Brook University(石溪大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。
Comments To be presented at EACL 2026 (Main Conference)
统一的跨模态注意力-混合器基于结构-功能连接组融合的神经精神疾病诊断
机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) ; Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS), Georgia State University, Georgia Institute of Technology, and Emory University(跨机构神经影像与数据科学转化研究中心(TReNDS),佐治亚州立大学、佐治亚理工学院和埃默里大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出ConneX方法,通过统一的跨模态注意力和MLP-Mixer实现结构-功能连接组的多模态融合,提升神经精神疾病诊断性能。
Comments Published in the Proceedings of the 47th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2025). IEEE Xplore. DOI: 10.1109/EMBC58623.2025.11254194
一种多模态融合平台,用于高动态场景中的联合环境感知与信道探测
专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract)
AI总结 本文提出一种多模态融合平台,用于高动态场景中联合环境感知与信道探测,支持多频段多天线测量和高精度环境感知。
MLLMRec: 基于图细化的多模态推荐偏好推理范式
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract)
AI总结 MLLMRec通过图细化和多模态大语言模型提升多模态推荐的用户偏好推理与物品表示学习准确性。
AGSP-DSA: 一种用于鲁棒多模态融合的自适应图信号处理框架,具有动态语义对齐
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM
AI总结 AGSP-DSA通过自适应图信号处理和动态语义对齐,实现鲁棒的多模态融合,提升情感分析和多媒体分类的性能。
多模态传感器整合:智能车辆融合技术综述
机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(工程学院、环境研究与技术中心、加州大学河滨分校) ; School of Transportation and Logistics, Southwest Jiaotong University(交通运输与物流学院、西南交通大学)
专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV、cs.MM
AI总结 本文综述了多传感器融合技术在自动驾驶中的应用,分析了深度学习方法、多模态数据集及新兴趋势,强调了其提升系统适应性和鲁棒性的潜力。
Comments Accepted by IEEE IV 2025
Journal ref Proceedings of the 2025 IEEE Intelligent Vehicles Symposium (IV), pp. 1817-1824, 2025
通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘
机构 * UC San Diego(加州大学圣迭戈分校) ; University of New South Wales(新南威尔士大学) ; Adobe Research(Adobe研究)
专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV
AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。
Comments 9 pages
基于流匹配的连续归一化流用于多模后验的学得谐均估计
机构 * Mullard Space Science Laboratory, University College London(穆尔空间科学实验室,伦敦大学学院) ; Alan Turing Institute(艾伦·图灵研究所)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出基于流匹配的连续归一化流,用于高效估计多模后验的边际似然,解决了传统方法在处理复杂后验时的局限性。
Comments Submitted to 44th International Workshop on Bayesian Inference and Maximum Entropy Methods in Science and Engineering