UEval: A Benchmark for Unified Multimodal Generation
UEval:一个统一多模态生成的评估基准
机构 * Princeton University(普林斯顿大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL
AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
UEval:一个统一多模态生成的评估基准
机构 * Princeton University(普林斯顿大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL
AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。
多模态大语言模型中模态干扰的诊断与缓解
机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。
Ostrakon-VL:面向食品服务与零售商店的领域专家MLLM
机构 * Rajax Network Technology (Taobao Shangou of Alibaba)(Rajax网络技术(淘宝商购的阿里巴巴))
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 Ostrakon-VL通过多阶段训练策略在FSRS场景中取得新突破,实现60.1的高分表现,超越现有模型并展示更高参数效率。
DrivIng: 一个具有完整数字孪生集成的大规模多模态驾驶数据集
机构 * Department of Computer Science and AImotion Bavaria, Technische Hochschule Ingolstadt(计算机科学系和AImotion巴伐利亚,因斯布鲁克大学) ; School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 DrivIng是一个具有完整数字孪生集成的大规模多模态驾驶数据集,提供高精度定位和多传感器数据,用于自动驾驶感知算法的评估和仿真到现实测试。
Comments Copyright 2026 IEEE. This is the accepted manuscript (postprint), not the final published version. For code and dataset, see https://github.com/cvims/DrivIng
MuSLR:多模态符号逻辑推理
机构 * National University of Singapore(新加坡国立大学) ; Stanford University(斯坦福大学) ; Peking University(北京大学) ; UniMelb(墨尔本大学) ; University of Auckland(奥克兰大学) ; MBZUAI(穆斯林人工智能研究所) ; University of California, Santa Barbara(加州大学圣芭芭拉分校)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 MuSLR提出了一种多模态符号逻辑推理基准,通过形式逻辑规则提升VLMs的推理能力,显著提升链式推理性能及复杂逻辑处理效果。
Comments Accepted by NeurIPS 2025
GAZELOAD:用于工业人机协作中心理负荷的多模态眼动数据集
机构 * Department of industrial Automation Technology TU Berlin(工业自动化技术系 柏林技术大学)
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 GAZELOAD数据集通过多模态眼动数据支持工业人机协作中心理负荷的估计与分析,包含眼动信号、环境数据及自我报告评分,用于算法开发与评估。
基于超网络的自适应聚合用于多模态多实例学习在预测冠状动脉钙化去除中的应用
机构 * Department of Advanced Information Technology, Kyushu University(九州大学先进信息技术系) ; Department of Cardiovascular Medicine, Kyushu University(九州大学心血管医学系)
专题命中 多模态评测 :multimodal(title);分类 cs.CV
AI总结 本文提出HyperAdAgFormer,通过超网络自适应聚合策略,用于多模态多实例学习预测冠状动脉钙化去除的必要性。
Comments Accepted to ISBI 2026
基于相机-IMU融合的新型数据集与道路表面分类框架
机构 * Voxar Labs(Voxar实验室) ; Centro de Informática(计算机中心) ; Universidade Federal de Pernambuco(佩纳布卢克联邦大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于相机-IMU融合的新型数据集和框架,通过多模态注意力机制提升道路表面分类的鲁棒性和泛化能力。
从受约束的稀疏航空影像中融合3D合成孔径雷达实现城市神经表面重建
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出融合3D SAR与航空影像的城市神经表面重建框架,通过引入雷达空间约束提升稀疏视角下的重建精度和鲁棒性。
从粒子到代理:幻觉作为空间模拟中认知摩擦的度量
机构 * Computational Social Science. ETH Zürich(ETH Zurich计算社会科学) ; Virginia Tech School of Architecture(弗吉尼亚理工大学建筑学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出代理环境模拟,通过认知摩擦度量揭示建筑空间的象征性模糊,挑战传统HCI范式,提出人类中心的认知编排框架。
Comments Paper selected for the workshop Human Cognition, AI, and the Future of HCI: Navigating the Disruptive and Wild Landscape of Large Language Models and Agentic AI as part of the Human-Computer Interaction (HCI) conference of the Alpine region (AlpCHI 2026) hosted at the Congressi Stefano Franscini, March 1st to March 5th, 2026 on Monte Verità in Ascona, Switzerland
PCICF:一种行人穿越识别与分类框架
机构 * Chalmers University of Technology(楚德斯技术大学) ; University of Gothenburg(戈尔达堡大学) ; Volvo Cars(沃尔沃汽车公司)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 PCICF提出了一种基于空间填充曲线的行人穿越识别与分类框架,利用合成数据集和真实世界数据集进行系统性训练和评估,以支持运营设计领域事件分析。
ChartE$^{3}$: 一个全面的端到端图表编辑基准
机构 * Fudan University(复旦大学) ; Tencent(腾讯)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。
Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3
基于AI的生物化学复发预测:从活检和前列腺切除样本
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出基于AI的模型,利用活检和前列腺切除样本预测生物化学复发风险,展示了AI在前列腺癌预后评估中的应用价值。
Comments 39 pages, 6 tables, 11 figures
当广告成为资料:利用LLMs揭示大规模网络广告中的隐形风险
机构 * The University of New South Wales(新南威尔士大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Queensland University of Technology(昆士兰理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 利用LLMs揭示广告流中的隐私信息泄露风险,展示其在大规模数据中的高精度推断能力。
Comments The ACM Web Conference 2026
原始变换器可以成为强大的图学习者
机构 * McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; Huawei Noah’s Ark Lab, Montreal(华为诺亚实验室,蒙特利尔) ; University of Oxford(牛津大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 本研究证明原始变换器可通过简单修改成为强大图学习者,提出PPGT架构在图学习任务中表现优异。
AI增强的密度驱动最优控制(D2OC)用于去中心化环境映射
机构 * Department of Mechanical Engineering, New Mexico Institute of Mining and Technology(机械工程系,新墨西哥矿业与技术研究院)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出AI增强的密度驱动最优控制方法,用于在传感和通信受限条件下实现多智能体环境映射,通过自适应机制提升密度估计精度和鲁棒性。