arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9251 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9251 篇

2607.16283 2026-07-21 cs.CV cs.AI 新提交 62%

GenSyn10: A Multi-Generative AI Dataset For Benchmarking Image Classification

GenSyn10:用于图像分类基准测试的多生成式人工智能数据集

Md Faraz Kabir Khan, Saeed Anwar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大利亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对生成式AI输出检测难的问题,引入GenSyn10数据集,由三种模型生成图像。通过标准化协议整理数据,评估17个分类模型,结果显示CIFAR-10训练模型在该数据集上有一定准确率,确立其为合成图像检测基准,助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14333 2026-07-17 cs.CV cs.CL 新提交 62%

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

SD-MAR:通过合成数据和强化学习进行多图像分析推理

Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang, Dmitriy Bespalov, Wesley Rose, Huzefa Rangwala

机构 * Stevens Institute of Technology(史蒂文斯理工学院) AGI Foundations for AWS(AWS的通用人工智能基金会) Amazon Web Services (AWS)(亚马逊网络服务公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29059 2026-07-17 cs.CV cs.AI 版本更新 62%

Flow Matching in Feature Space for Stochastic World Modeling

特征空间中的流匹配用于随机世界建模

Francois Porcher, Nicolas Carion, Karteek Alahari, Shizhe Chen

机构 * FAIR at Meta(Meta的FAIR)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FlowWM,在预训练特征空间中直接进行流匹配,通过可微一步投影机制实现高效训练,在合成和真实基准上提升感知性能、模式覆盖和时域鲁棒性。

Comments 24 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26842 2026-07-17 cs.LG cs.AI cs.CV 版本更新 62%

VAN-AD: Visual Masked Autoencoder with Normalizing Flow For Time Series Anomaly Detection

VAN-AD:基于归一化流的视觉掩码自编码器用于时间序列异常检测

PengYu Chen, Shang Wan, Xiaohou Shi, Yuan Chang, Yan Sun, Sajal K. Das

机构 * School of Computer Science (National Pilot Software Engineering School)(计算机学院(国家级试点软件工程学院)) Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute Beijing(中国电信研究院北京) Department of Computer Science, Missouri University of Science and Technology(计算机科学系,密苏里科技大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VAN-AD,通过归一化流模块和自适应分布映射模块改进视觉掩码自编码器,提升时间序列异常检测的泛化能力和局部感知能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10057 2026-07-16 quant-ph cs.AI cs.CV cs.LG 交叉投稿 62%

Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation

量子电路视觉:用于量子代码生成的视觉人工智能代理的成本感知评估

Dongping Liu, Aoyu Zhang, Luyao Zhang

机构 * Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究人工智能代理对量子电路图的理解及代码生成成本,提出量子电路视觉评估框架,构建基准并评估模型,发现中级模型在成本-准确性上平衡最佳,电路深度是失败主因,提出级联路由策略并开源数据集及代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交 62%

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 62%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09629 2026-07-14 cs.CV cs.AI 版本更新 62%

4DR360: State Reasoning for Joint 3D Detection and Occupancy Prediction in 4D Radar-Camera Full-Scene Perception

4DR360:用于4D雷达-相机全场景感知中联合3D检测和占用预测的状态推理

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Songkai Wang, Siyuan Cao, Hui-liang Shen

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对4D雷达-相机全场景感知,提出\method框架,遵循跨模态状态推理范式,通过状态引导的BEV增强和多普勒引导的时间融合进行联合3D检测和占用预测,扩展数据集并实验,提升多任务学习效果。

Comments 5 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01042 2026-07-14 cs.IR cs.AI cs.CL 版本更新 62%

Can Argus Judge Them All? Comparing VLMs Across Domains

阿格斯能评判一切吗?跨领域比较视觉语言模型

Harsh Joshi, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Niharika Jain, Sarthak Jain, Jiechao Gao, Usman Naseem

机构 * Bharati Vidyapeeth(巴哈提大学) Macquarie University(麦考瑞大学) DSEU-Okhla Vivekananda Institute of Professional Studies(维维kananda专业研究学院) IIIT-Delhi(德里印度理工学院) Center for SDGC(SDGC中心) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交 62%

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07708 2026-07-09 cs.CL cs.AI cs.CE cs.LG 新提交 62%

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解

Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Sydney(悉尼大学) Nanjing University(南京大学) University of Oxford(牛津大学) The University of Science and Technology of China(中国科学技术大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17298 2026-07-09 cs.CV cs.AI 版本更新 62%

Explain Before You Answer: A Survey on Compositional Visual Reasoning

回答之前先解释:组合视觉推理综述

Fucai Ke, Joy Hsu, Zhixi Cai, Zixian Ma, Xin Zheng, Xindi Wu, Sukai Huang, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Ranjay Krishna, Jiajun Wu, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Griffith University(格里菲斯大学) Princeton University(普林斯顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。

Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05880 2026-07-08 cs.CV cs.AI 新提交 62%

Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context

哈里森.Rad 1.5技术报告:一种可根据图像、先验知识和临床背景起草报告的放射学基础模型

Suneeta Mall, Vladimir Nekrasov, Ashnil Kumar, Sajith Karunasena, Aiden Nibali, Alix Bird, Mateo Diaz Shine, Jarrel Seah

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对放射科报告积压问题,提出HR1.5多模态大语言模型,通过三阶段训练,用特定评分框架评估,该模型是唯一达模拟FRCR及格标准的系统,在多方面准确率最高,还研究了可解释性等以支持临床应用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06521 2026-07-08 cs.CV cs.CL 版本更新 62%

BabyVision: Visual Reasoning Beyond Language

BabyVision:超越语言的视觉推理

Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li

机构 * UniPat AI xbench Alibaba Group(阿里巴巴集团) MoonShot AI StepFun Peking University(北京大学) Tsinghua University(清华大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学) G Labs Equal Core Contributors(0G Labs 等核心贡献者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。

Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04241 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

Hierarchical Multi-to-Single-Modal Knowledge Distillation for Disruption Prediction in EAST

用于EAST中破裂预测的分层多对单模态知识蒸馏

Qiang Chen, Xiao Wang, Hao Si, Qingquan Yang, Meiwen Chen, Jianhua Yang, Xiaofeng Han, Yunhu Jia, Ran Chen, Liang Wang, Jin Tang, Guosheng Xu

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Institute of Plasma Physics, Chinese Academy of Sciences(中国科学院等离子体物理研究所) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University(安徽大学光电子信息获取与控制技术国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对等离子体破裂威胁,提出分层多对单模态知识蒸馏框架。训练多模态教师模型,推理时仅保留时间序列学生模型,通过多层面蒸馏转移知识,降低推理成本,为EAST高效破裂预测提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04147 2026-07-07 cs.CV cs.AI 新提交 62%

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

HCSU:用于细粒度历史书法风格理解的数据集和基准测试

Yinsheng Yao, Yan Liu, Chen Ye

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。

Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03210 2026-07-07 cs.LG cs.AI cs.CL 新提交 62%

Transition Information Density: Morphological Trajectories, Synesthetic Perception, and Structured Interpolation in Neural Training (or: The Synesthetic AI)

过渡信息密度:神经训练中的形态轨迹、联觉感知和结构化插值(或:联觉人工智能)

Sam Mao

机构 * New York University(纽约大学) Interactive Media Arts(互动媒体艺术)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 介绍过渡信息密度及位置标识,基于联觉等实证背景研究。通过结构化插值训练的探针在语音/语言和语义描述媒介中维度更低,贡献相关定义、框架及实验设计,区分轨迹结构等因素。

Comments 38 pages, 9 figures, 4 tables. Empirical results from structured interpolation training across four representational mediums. Pipeline scripts, experimental data, and the Synesthesia Grid algorithm available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 62%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25533 2026-07-07 cs.CV cs.AI 版本更新 62%

VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

VISOR++:基于通用视觉输入的大型视觉语言模型转向

Ravikumar Balakrishnan, Mansi Phute

机构 * HiddenLayer, USA(HiddenLayer美国分校) Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型行为控制,针对现有方法局限,提出VISOR++,通过优化视觉输入实现行为控制,无需运行时访问模型内部,在多模型上验证有效性且能保持无关任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02007 2026-07-03 cs.CL cs.CV 新提交 62%

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

EduArt:评估大型语言模型艺术史知识的教育级基准

Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) Villa i Tatti – The Harvard University Center for Italian Renaissance Studies(哈佛大学意大利文艺复兴研究中心(I Tatti)) University of Copenhagen(哥本哈根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出EduArt基准,包含871道人工出题的艺术史题目,评估多模态大模型在不同格式和语言下的知识掌握与推理能力,发现格式显著影响表现,多选题高估模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31980 2026-07-02 cs.CL cs.AI cs.HC 新提交 62%

DigitalCoach: Communication and Grounding Gaps in Human and Agentic Computer Use Coaching

DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距

Meng Chen, Anya Ji, Tsung-Han Wu, Tobias Maringgele, David M. Chan, Alane Suhr, Amy Pavel

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新 62%

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31745 2026-07-01 cs.CV cs.AI 新提交 62%

JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering

JL1-CC&QA:扩展JL1-CD基准,增加变化描述和问答

Ziyuan Liu, Ruifei Zhu, Ouqiao Ma, Yuantao Gu

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学电子工程系,北京信息科学与技术国家研究中心) Chang Guang Satellite Technology Co., Ltd. (CGSTL)(长光卫星技术股份有限公司) College of Communications Engineering, Army Engineering University of PLA(中国人民解放军陆军工程大学通信工程学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出JL1-CC&QA多任务基准,通过变化描述和问答扩展JL1-CD,利用吉林一号卫星图像和三级标注流程,推动遥感变化理解。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30576 2026-06-30 cs.CV cs.AI 62%

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization

超越2D匹配:用于几何感知跨视角目标地理定位的统一单阶段框架

Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu

机构 * Beihang University(北航) Meituan(美团)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出GAGeo单阶段框架,利用3D基础模型和对比损失,结合多模态提示和相机位姿,实现跨视角目标地理定位,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30026 2026-06-30 cs.CV cs.AI 62%

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

机构 * NTU Singapore(南洋理工大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学) AI2(人工智能研究所) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。

Comments Project page: https://musebench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29928 2026-06-30 cs.CV cs.AI 62%

Latent-CURE for Breast Cancer Diagnosis

Latent-CURE:用于乳腺癌诊断的潜在空间推理框架

Weiyi Zhao, Xiaoyu Tan, Lu Gan, Liang Liu, Xihe Qiu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大模型在乳腺癌超声诊断中因数据不平衡而忽略罕见恶性特征的问题,提出基于潜在空间非对称加权思维链的Latent-CURE框架,强制模型先推断BI-RADS形态描述符再诊断,并采用双非对称优化策略保护恶性特征,实现透明且鲁棒的诊断。

Comments 11 pages, 4 figures, 3 tables. Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29213 2026-06-30 cs.CL cs.CV 62%

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

OCR-VLM能阅读天城文吗?一项压力测试基准与后纠正研究

Aditya Pratap Singh

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究通过合成退化条件和真实扫描图像,系统评估了10种OCR系统在天城文(印地语)上的表现,发现专用OCR-VLM在退化条件下最脆弱,真实扫描性能远低于合成文本,并提出了错误分类和后纠正方法。

Comments 9 pages, 5 figures. Benchmark and code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 62%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22536 2026-06-29 cs.CV cs.CL 版本更新 62%

SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation

SpaceDG: 在视觉退化下评估空间智能的基准测试

Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学) The University of Tokyo(东京大学) Beihang University(北航) Northwestern Polytechnical University(西北工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SpaceDG,首个针对退化感知空间理解的大型数据集,通过物理基础的退化合成引擎生成9种退化类型,评估多模态大语言模型在视觉退化下的空间推理能力,并展示在退化条件下微调可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 62%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏