arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26172 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4484 篇

2605.07575 2026-05-12 cs.CV cs.AI 62%

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

响应-G1:面向前瞻性流视频理解的显式场景图建模

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu

机构 * Northwestern Polytechnical University(北华大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 响应-G1通过显式场景图建模提升前瞻性流视频理解,通过三阶段流程实现视频证据与查询条件的结构化对齐,提高响应时机的可解释性和准确性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI 62%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09272 2026-05-12 cs.AI cs.CL cs.CV 62%

Towards Conversational Medical AI with Eyes, Ears and a Voice

面向有眼睛、耳朵和声音的对话式医疗AI

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院) Stanford University(斯坦福大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AI co-clinician系统,利用音频视频数据实现实时临床决策,通过TelePACES评估标准显示其在管理计划和诊断差异方面接近医生,但在体格检查和疾病特异性推理上仍有不足。

Comments Video examples are available on Youtube: https://youtu.be/y5Vaa_SN1t0, https://youtu.be/dC4icb75vLQ, and https://youtu.be/E7iEvWo-E6c

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07436 2026-05-12 cs.CV cs.AI cs.ET 62%

Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition

提示到保护:多模态大语言模型在建筑危险识别中的比较研究

Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系) Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了五种先进多模态大语言模型在建筑危险识别中的表现,发现提示策略显著影响性能,CoT提示效果最佳,GPT-4.5和GPT-o3表现突出,强调了提示设计在提升建筑安全应用准确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07640 2026-05-11 cs.CV cs.AI 62%

LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation

LithoBench:用于遥感岩石学解释的大型多模态模型基准测试

Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han

机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机学院) PRADA Lab, King Abdullah University of Science and Technology(科廷大学PRADA实验室) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LithoBench,一个用于评估遥感岩石学解释中地质语义理解的多级基准,包含10000个专家标注实例,涵盖12种岩石类型,通过专家反馈的半自动化流程提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00814 2026-05-11 cs.CV cs.AI 62%

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

持久视觉记忆:在大型视觉-语言模型中维持感知以实现深度生成

Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PVM模块,通过增强视觉证据的持续访问能力,解决LVLMs中视觉信号稀释问题,提升复杂推理任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07140 2026-05-11 cs.CV cs.AI 62%

Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition

基于骨架的人体动作识别的概念驱动逻辑推理神经符号框架

Talha Ilyas, Deval Mehta, Zongyuan Ge

机构 * Department of ECSE, Faculty of Engineering, Monash University, Australia(莫纳什大学工程学院电子与计算机工程系,澳大利亚) AIM for Health Lab, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院健康人工智能实验室,澳大利亚) Department of DSAI, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院数据科学与人工智能系,澳大利亚)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种神经符号框架,将骨架动作识别转化为概念驱动的一阶逻辑推理,通过结合表征学习与符号推理,提升动作识别的可解释性。

Comments Accepted In Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06815 2026-05-11 cs.AI cs.CV 62%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 62%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18744 2026-05-11 cs.AI cs.LG 62%

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench: 一个全面的多任务多模态时间序列推理基准,用于通用模型

Fangxu Yu, Xingang Guo, Lingzhi Yuan, Haoqiang Kang, Hongyu Zhao, Lianhui Qin, Furong Huang, Bin Hu, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :VLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 TSRBench通过4125个问题和15个任务评估通用模型的时间序列推理能力,揭示了感知和推理中的缩放定律失效以及多模态融合的不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09907 2026-05-11 cs.AI cs.CV 62%

Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis

学习提出问题:基于推理和求解器适应的数据合成

Yongxian Wei, Yilin Zhao, Zixuan Hu, Li Shen, Xinrui Chen, Runxi Cheng, Sinan Du, Hao Yu, Chun Yuan, Dian Li

机构 * Tsinghua University(清华大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于推理和求解器适应的数据合成方法,通过生成相关问题对并利用推理模型生成中间步骤,提升问题设计策略,实验表明在多个基准上实现了3.4%的平均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 62%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24867 2026-04-30 cs.CV cs.AI 62%

Time Blindness: Why Video-Language Models Can't See What Humans Can?

时间盲:为什么视频语言模型无法看到人类能看见的东西?

Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny

机构 * KAUST(卡士大学) VILA Lab, MBZUAI(VILA实验室,MBZUAI)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17729 2026-04-29 cs.CV cs.AI 62%

SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition

SARE:基于样本的自适应推理用于无训练细粒度视觉识别

Jingxiao Yang, DaLin He, Miao Pan, Kaixiang Yao, Ge Su, Wenqi Zhang, Yifeng Hu, Tangwei Li, Yuke Li, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Netease Yidun AI Lab(网易云智AI实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SARE提出一种样本自适应推理框架,通过结合快速候选检索与细粒度推理,利用历史失败经验提升无训练细粒度视觉识别的准确性和效率。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 62%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07605 2026-04-28 cs.CV cs.AI 62%

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

Fine-R1: 通过链式推理使多模态大语言模型在细粒度视觉识别中脱颖而出

Hulingxiao He, Zijun Geng, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Fine-R1通过链式推理监督微调和三元组增强策略优化,提升多模态大语言模型在细粒度视觉识别中的表现,仅用4次训练即超越现有模型。

Comments Published as a conference paper at ICLR 2026. The models are available at https://huggingface.co/collections/StevenHH2000/fine-r1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM 62%

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23348 2026-04-28 cs.CV cs.AI 62%

EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试

He Hu, Tengjin Weng, Zebang Cheng, Yu Wang, Jiachen Luo, Björn Schuller, Zheng Lian, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Queen Mary University of London(女王学院伦敦大学) Technical University of Munich(慕尼黑技术大学) Imperial College London(伦敦帝国学院) Tongji University(同济大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 EmoTrans旨在评估多模态视频中情感动态理解能力,包含1000个手工标注的视频片段和3000多个任务特定问题-答案对,通过四个任务形成从粗粒度检测到深度推理的评估框架,发现当前大语言模型在细粒度情感动态建模上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI 62%

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20904 2026-04-24 cs.LG cs.AI 62%

Reinforcing privacy reasoning in LLMs via normative simulacra from fiction

通过小说中的规范仿像强化大语言模型的隐私推理

Matt Franchi, Madiha Zahrah Choksi, Harold Triedman, Helen Nissenbaum

机构 * Cornell Tech(康奈尔科技)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文通过从小说中提取规范仿像,结合监督学习和GRPO强化学习,提升大语言模型的隐私推理能力,验证了小说来源的规范仿像在现实领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM 62%

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06211 2026-04-22 cs.CL cs.AI cs.CV 62%

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

PuzzleWorld: 一个用于谜题 hunt 中多模态、开放式推理的基准

Hengzhi Li, Justin Zhang, Brendon Jiang, Alexander Naehu, Regan Song, Megan Tjandrasuwita, Chanakya Ekbote, Steven-Shine Chen, Adithya Balachandran, Wei Dai, Rebecca Chang, Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 PuzzleWorld 是一个包含667个谜题 hunt 风格问题的基准,用于评估逐步、开放式和创造性多模态推理。每个谜题都标注了最终答案、详细推理轨迹和认知技能标签,揭示了当前模型在推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12320 2026-04-21 cs.CV cs.AI cs.MM 62%

EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports

EgoEsportsQA:一种用于电子竞技感知与推理的视角视频基准

Jianzhe Ma, Zhonghao Cao, Shangkui Chen, Yichen Xu, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EgoEsportsQA基准,通过六阶段流程收集1745对高质量问答对,评估视频大语言模型在虚拟环境中的感知与推理能力,揭示模型在战术推理和微操作方面的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07562 2026-04-21 cs.CL cs.AI cs.CY cs.LG 62%

Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs

基于推理的无监督文本聚类细化方法

Tunazzina Islam

机构 * Department of Computer Science(计算机科学系)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型作为语义评判者,对无监督聚类结果进行推理细化,通过三个阶段提升聚类的连贯性与可解释性,实验证明其在社交媒体数据中优于传统方法。

Comments Accepted to the Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16893 2026-04-21 cs.CV cs.LG 62%

EasyVideoR1: Easier RL for Video Understanding

EasyVideoR1: 更容易的视频理解强化学习

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出EasyVideoR1框架,通过高效预处理、统一奖励系统和混合训练策略,提升视频理解任务的训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16528 2026-04-21 cs.CV cs.AI 62%

Expert-Annotated Embryo Image Dataset with Natural Language Descriptions for Evidence-Based Patient Communication in IVF

具有自然语言描述的专家标注胚胎图像数据集:用于基于证据的患者沟通的体外受精

Nicklas Neu, Thomas Ebner, Jasmin Primus, Bernhard Schenkenfelder, Raphael Zefferer, Mathias Brunbauer, Florian Kromp

机构 * Software Competence Center Hagenberg(海因斯贝格软件能力中心) Kepler Universitätsklinikum, Kinderwunsch Zentrum(凯普勒大学医院,生育中心) Wunschkind Klinik Dr. Brunbauer(布鲁纳auer生育诊所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个包含胚胎图像和自然语言描述的专家标注数据集,用于提升体外受精中胚胎选择的可解释性和透明度,支持基于证据的决策和患者沟通。

Comments 7 pages, 3 figures, in submission to Nature Scienfitic Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 62%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10562 2026-04-20 cs.CV cs.AI cs.CL cs.CY 62%

Seeing the Intangible: Survey of Image Classification into High-Level and Abstract Categories

看见无形:图像分类到高级和抽象类别的调查

Delfina Sol Martinez Pandiani, Valentina Presutti

机构 * University of Bologna(博洛尼亚大学) University of Bologna Department of Computer Science(博洛尼亚大学计算机科学系) University of Bologna Department of Modern Languages, Literatures(博洛尼亚大学现代语言文学系) Centrum Wiskunde en Informatica(数学与信息学研究中心) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克奎恩特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文通过系统回顾高阶视觉理解的研究,探讨了抽象概念在自动图像分类中的处理,揭示了高阶视觉推理的挑战与机遇,强调了混合AI系统的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14967 2026-04-20 cs.CV cs.AI 62%

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

UniDoc-RL: 基于分层动作和密集奖励的粗到细视觉RAG

Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Zhiwu Lu

机构 * DeepGlint-AI

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 UniDoc-RL通过分层动作空间和密集奖励方案,提升视觉RAG系统的细粒度视觉语义处理能力,实现端到端训练,实验显示优于现有方法。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23304 2026-04-20 cs.CV cs.AI 62%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏