arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-03 至 2026-03-03 共收录 206 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 44 篇

2602.23166 2026-03-03 cs.CV 79%

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

AgentVista: 评估在超挑战性现实视觉场景中的多模态代理

Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

机构 * Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 AgentVista 是一个评估多模态代理在超挑战性现实视觉场景中能力的基准,通过真实场景和复杂工具交互任务揭示现有模型在长时间多模态工具使用方面的不足。

Comments The project website is available at https://agentvista-bench.github.io/, and the code is available at https://github.com/hkust-nlp/AgentVista

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19424 2026-03-03 cs.CV 79%

Hepato-LLaVA: An Expert MLLM with Sparse Topo-Pack Attention for Hepatocellular Pathology Analysis on Whole Slide Images

Hepato-LLaVA:一种基于稀疏拓扑包注意力机制的专家多模态大语言模型,用于肝细胞病理分析的整张图像

Yuxuan Yang, Zhonghao Yan, Yi Zhang, Bo Yun, Muxi Diao, Guowei Zhao, Kongming Liang, Wenbin Li, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) Department of Pathology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(pathology department, 国家癌症中心/国家癌症临床研究中心/癌症医院, 中国医学科学院和北京协和医学院)

专题命中 多模态评测 :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 Hepato-LLaVA通过稀疏拓扑包注意力机制和HepatoPathoVQA数据集,实现肝细胞病理分析的高精度诊断与描述。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00595 2026-03-03 cs.CV 79%

UNICBench: UNIfied Counting Benchmark for MLLM

UNICBench: 多模态多层级计数基准与评估工具包

Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao

机构 * Northwestern Polytechnical University(北华大学) Hong Kong University of Science and Technology(香港科技大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Sun Yat-sen University(中山大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 UNICBench是一个统一的多模态计数基准,通过准确的地面真实值和分层报告,评估45种最先进的MLLMs在图像、文本和音频计数任务上的性能,揭示了模型在推理和难分支上的不足。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00490 2026-03-03 cs.AI 79%

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

LifeEval: 一种面向日常生活中自体视角的多模态基准,用于辅助AI

Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai University of Electric Power(上海电力大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 LifeEval 是一个面向日常生活中自体视角的多模态基准,用于评估实时任务导向的人机协作,揭示了在动态环境中实现有效交互的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22339 2026-03-03 cs.CV 79%

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

CircuitSense: 一种层次化的MLLM基准,连接视觉理解和符号推理在工程设计过程

Arman Akbari, Jian Gao, Yifei Zou, Mei Yang, Jinru Duan, Dmitrii Torbunov, Yanzhi Wang, Yihui Ren, Xuan Zhang

机构 * Northeastern University(东北大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 多模态评测 :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 CircuitSense提出一个层次化基准,评估工程设计中视觉理解与符号推理的能力,揭示闭源模型在符号推导上的不足,强调数学理解对电路综合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00055 2026-03-03 cs.LG cs.AI 79%

M3-AD: Reflection-aware Multi-modal, Multi-category, and Multi-dimensional Benchmark and Framework for Industrial Anomaly Detection

M3-AD:面向工业异常检测的反思-aware 多模态、多类别和多维基准与框架

Chao Huang, Yanhui Li, Yunkang Cao, Wei Wang, Hongxi Huang, Jie Wen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hunan University(湖南大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 M3-AD提出了一种反思-aware 的多模态框架,通过RA-Monitor提升工业异常检测的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16953 2026-03-03 cs.LG stat.ML 78%

ICYM2I: The illusion of multimodal informativeness under missingness

ICYM2I: 多模态信息性在缺失情况下的错觉

Young Sang Choi, Vincent Jeanselme, Pierre Elias, Shalmali Joshi

机构 * Department of Biomedical Informatics, Columbia University(生物医学信息学系,哥伦比亚大学) Seymour, Paul, and Gloria Milstein Division of Cardiology, Department of Medicine, Columbia University Irving Medical Center(塞缪尔、保罗和格洛丽亚米尔斯坦心脏病科,哥伦比亚大学伊万格琳医学中心)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 ICYM2I框架通过逆概率加权修正,解决多模态学习中因缺失模式变化导致的信息增益估计偏差问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00938 2026-03-03 cs.CV cs.AI 73%

Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos

超越8位:HDR-UGC视频的主观和客观质量评估

Shreshth Saini, Bowen Chen, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21950 2026-03-03 cs.CV 70%

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13671 2026-03-03 cs.CV cs.LG 70%

FiLo: Zero-Shot Anomaly Detection by Fine-Grained Description and High-Quality Localization

FiLo:通过细粒度描述和高质量定位实现零样本异常检测

Zhaopeng Gu, Bingke Zhu, Guibo Zhu, Yingying Chen, Hao Li, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所基础模型研究中心) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Objecteye Inc., Beijing, China(Objecteye公司) Central South University, Hunan, China(中南大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 FiLo通过细粒度描述和高质量定位实现零样本异常检测,提升检测和定位性能。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22373 2026-03-03 cs.CL cs.AI cs.CV 67%

VisJudge-Bench: Aesthetics and Quality Assessment of Visualizations

VisJudge-Bench: 可视化美学与质量评估

Yupeng Xie, Zhiyang Zhang, Yifan Wu, Sirong Lu, Jiayi Zhang, Zhaoyang Yu, Jinlin Wang, Sirui Hong, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DeepWisdom(深智科技) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VisJudge-Bench提出首个可视化质量评估基准,通过VisJudge模型显著提升对可视化美学和质量的判断精度。

Comments 62 pages, 27 figures, 8 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06905 2026-03-03 cs.AI cs.CL cs.CV cs.LG 67%

Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering

元适应性提示蒸馏用于少样本视觉问答

Akash Gupta, Amos Storkey, Mirella Lapata

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出元适应性提示蒸馏方法,通过固定软提示提升少样本视觉问答性能,实验表明在低数据情况下优于ICL和参数高效微调方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00994 2026-03-03 cs.HC 67%

VizQStudio: Iterative Visualization Literacy MCQs Design with Simulated Students

VizQStudio: 基于模拟学生的迭代可视化素养多选题设计

Zixin Chen, Yuhang Zeng, Sicheng Song, Yanna Lin, Xian Xu, Huamin Qu, Meng Xia

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 VizQStudio通过模拟学生帮助教师迭代设计高质量可视化素养多选题,提升评估设计的灵活性和适应性。

Comments TVCG fast track (PVIS 2026 TVCG Track) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00080 2026-03-03 cs.DL 67%

From Static Repositories to Agentic Knowledge Webs: ResearchTwin and the S-Index for Federated Human-AI Research Discovery

从静态仓库到代理知识网络:ResearchTwin和S-指数用于联邦人机研究发现

Martin G. Frasch

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract)

AI总结 ResearchTwin通过S-指数量化多模态研究影响,利用联邦架构实现人机协同的知识发现。

Comments 15 pages, 1 figure, https://github.com/martinfrasch/ResearchTwin

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16110 2026-03-03 cs.CV cs.AI 62%

OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis

OmniCT:迈向统一的切片-体积LVLM以实现全面的CT分析

Tianwei Lin, Zhongwei Qiu, Wenqiao Zhang, Jiang Liu, Yihan Xie, Mingjian Gao, Zhenxuan Fan, Zhaocheng Li, Sijing Li, Zhongle Xie, Peng LU, Yueting Zhuang, Ling Zhang, Beng Chin Ooi, Yingda Xia

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云学术院) Hupan Lab(虎派实验室)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 OmniCT提出了一种统一的切片-体积LVLM,通过空间一致性增强、器官级语义增强和MedEval-CT数据集,实现了全面的CT分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06218 2026-03-03 cs.CV cs.AI 62%

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

EgoNight: 向夜间视角理解迈进的挑战性基准

Deheng Zhang, Yuqian Fu, Runyi Yang, Yang Miao, Tianwen Qian, Xu Zheng, Guolei Sun, Ajad Chhatkuli, Xuanjing Huang, Yu-Gang Jiang, Luc Van Gool, Danda Pani Paudel

机构 * East China Normal University(东华大学) HKUST(GZ)(香港科技大学(广州)) Nankai University(南开大学) Fudan University(复旦大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 EgoNight提出首个夜间视角视觉基准,通过日夜间对齐视频和人工验证构建VQA任务,揭示低光照条件下模型性能下降问题,并引入辅助任务推动模型泛化能力提升。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00530 2026-03-03 cs.AI cs.CL 62%

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

CityLens:评估大型视觉-语言模型用于城市社会经济感知

Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02872 2026-03-03 cs.CL cs.AI 62%

Decoding Open-Ended Information Seeking Goals from Eye Movements in Reading

从阅读中的眼动解码开放性信息寻求目标

Cfir Avraham Hadar, Omer Shubi, Yoav Meiri, Amit Heshes, Yevgeni Berzak

机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology(数据与决策科学学院,技术离子-以色列理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究首次通过阅读中的眼动数据自动解码开放性信息寻求目标,开发了多模态LLM模型并展示了在目标选择和文本重构上的显著成果。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16235 2026-03-03 cs.CV cs.AI 62%

AI-Powered Dermatological Diagnosis: From Interpretable Models to Clinical Implementation A Comprehensive Framework for Accessible and Trustworthy Skin Disease Detection

AI赋能的皮肤病诊断:从可解释模型到临床实施 一个全面的框架,用于可访问且可信的皮肤疾病检测

Satya Narayana Panda, Vaishnavi Kukkala, Spandana Iyer

机构 * Department of Business Analytics/Data Science Engineering University of New Haven(商业分析/数据科学工程系 罗德岛大学) Department of Healthcare University of New Haven(医疗健康系 罗德岛大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出了一种结合家族史数据和临床影像的AI框架,旨在提升皮肤病诊断的准确性与临床应用的可行性。

Comments 9 pages, 5 figures, 1 table. Code available at https://github.com/colabre2020/Enhancing-Skin-Disease-Diagnosis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01874 2026-03-03 cs.CR cs.AI 57%

Phishing the Phishers with SpecularNet: Hierarchical Graph Autoencoding for Reference-Free Web Phishing Detection

用SpecularNet欺骗钓鱼者:用于无参考网页钓鱼检测的分层图自编码

Tailai Song, Pedro Casas, Michela Meo

机构 * AIT Austrian Institute of Technology(奥地利技术研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 SpecularNet通过分层图自编码架构实现无参考网页钓鱼检测,以高效且准确的方式识别钓鱼网站,显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04201 2026-03-03 cs.CV 57%

SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios

SToLa:具有触觉常识推理的自适应触觉-语言框架在开放性场景中

Ning Cheng, Jinan Xu, Jialing Chen, Bin Fang, Wenjuan Han

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SToLa通过专家混合架构实现触觉与语言模态的自适应统一,解决开放性场景中触觉常识推理的挑战,提升多模态推理性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01225 2026-03-03 cs.CL 57%

Can Thinking Models Think to Detect Hateful Memes?

思考模型能否通过思考来检测仇恨言论?

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Qatar University(卡塔尔大学) Qatar Computing Research Institute(卡塔尔计算研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出基于强化学习的后训练框架,通过任务特定奖励和GRPO目标提升基于思考的多模态模型在检测仇恨言论中的推理能力,实验表明在准确性、F1值和解释质量上均有显著提升。

Journal ref In Companion Proceedings of the ACM Web Conference 2026 (WWW Companion 26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01174 2026-03-03 cs.CV 57%

VP-Hype: A Hybrid Mamba-Transformer Framework with Visual-Textual Prompting for Hyperspectral Image Classification

VP-Hype:一种结合视觉-文本提示的混合Mamba-Transformer框架用于超光谱图像分类

Abdellah Zakaria Sellam, Fadi Abdeladhim Zidi, Salah Eddine Bekhouche, Ihssen Houhou, Marouane Tliba, Cosimo Distante, Abdenour Hadid

机构 * Institute of Applied Sciences and Intelligent Systems (ISASI), CNR(应用科学与智能系统研究所(ISASI),CNR) Dept. of Engineering for Innovation, University of Salento(创新工程系,萨勒诺大学) VSC Laboratory, Department of Electronics and Automation, University of Biskra(VSC实验室,电子与自动化系,比斯克拉大学) Dept. of Computer Science and AI, University of the Basque Country (UPV/EHU)(计算机科学与人工智能系,巴斯克国家大学(UPV/EHU)) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi(索邦大学阿布扎克人工智能中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 VP-Hype通过混合Mamba-Transformer架构和双模态提示,实现超光谱图像分类的高准确率与低样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02456 2026-03-03 cs.AI cs.CR 57%

VPI-Bench: Visual Prompt Injection Attacks for Computer-Use Agents

VPI-Bench:用于计算机使用代理的视觉提示注入攻击

Tri Cao, Bennett Lim, Yue Liu, Yuan Sui, Yuexin Li, Shumin Deng, Lin Lu, Nay Oo, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(国立新加坡大学) Cyber Emerging Tech and R&D Co(网络安全与研发公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VPI-Bench基准,用于评估计算机使用代理和浏览器使用代理在视觉提示注入攻击下的鲁棒性,发现当前代理在某些平台上被欺骗率达51%和100%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00707 2026-03-03 cs.CV 57%

Towards Khmer Scene Document Layout Detection

面向柬埔寨场景文档布局检测

Marry Kong, Rina Buoy, Sovisal Chenda, Nguonly Taing, Masakazu Iwamura, Koichi Kise

机构 * Techo Startup Center, Ministry of Economy and Finance, Cambodia(技术创业中心,经济财政部,柬埔寨) Osaka Metropolitan University, Japan(大阪 Metropolitan 大学,日本)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种针对柬埔寨场景文档布局检测的新框架,包含数据集、增强工具和YOLO-based基线,以处理几何畸变和复杂布局。

Comments 17 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00590 2026-03-03 cs.AI 57%

Fair in Mind, Fair in Action? A Synchronous Benchmark for Understanding and Generation in UMLLMs

公平在心,公平在行?一个用于理解与生成的同步基准:UMLLMs的公平性评估

Yiran Zhao, Lu Zhou, Xiaogang Xu, Zhe Liu, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 IRIS基准通过同步评估UMLLMs的理解与生成任务公平性,揭示系统性偏见现象并提供公平性优化指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00478 2026-03-03 cs.LG cs.CV 57%

Benchmarking Few-shot Transferability of Pre-trained Models with Improved Evaluation Protocols

基于改进评估协议的预训练模型少样本迁移性基准测试

Xu Luo, Ji Zhang, Lianli Gao, Heng Tao Shen, Jingkuan Song

机构 * University of Electronic Science and Technology of China(电子科技大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FEWTRANS基准和HPE协议,揭示预训练模型选择对少样本迁移性能的主导作用,并分析全微调在避免过拟合方面的有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01051 2026-03-03 hep-ex cs.SE 50%

CelloAI Benchmarks: Toward Repeatable Evaluation of AI Assistants

CelloAI Benchmarks: 向AI助手评估的可重复性迈进

Mohammad Atif, Kriti Chopra, Fang-Ying Tsai, Ozgur O. Kilic, Tianle Wang, Zhihua Dong, Douglas Benjamin, Charles Leggett, Meifeng Lin, Paolo Calafiura, Salman Habib

专题命中 多模态评测 :multimodal(abstract)

AI总结 CelloAI Benchmarks提出了一套针对高能物理和高性能计算领域AI助手的可重复性评估基准,涵盖代码文档、代码生成和图形数据分析三个评估赛道,旨在提升科学编码辅助的可靠性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19957 2026-03-03 stat.CO astro-ph.CO astro-ph.IM 50%

SunBURST: Deterministic GPU-Accelerated Bayesian Evidence via Mode-Centric Laplace Integration

SunBURST:基于模式中心拉普拉斯积分的确定性GPU加速贝叶斯证据计算

Ira Wolfson

专题命中 多模态评测 :multimodal(abstract)

AI总结 SunBURST通过模式中心拉普拉斯积分实现高维贝叶斯证据计算,结合GPU并行加速,适用于高斯和近高斯后验,提供高精度且高效的结果。

Comments 46 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 8 篇

2603.01050 2026-03-03 cs.CV cs.AI 84%

MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline

MM-DeepResearch: 一种简单而有效的多模态代理搜索基线

Huanjin Yao, Qixiang Yin, Min Yang, Ziwang Zhao, Yibo Wang, Haotian Luo, Jingyi Zhang, Jiaxing Huang

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MM-DeepResearch通过Hyper-Search和DR-TTS方法,构建了多模态代理搜索基线,实现了高效多模态研究任务的处理。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏