arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4536 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4536 篇

2601.05172 2026-01-12 cs.CV cs.AI 62%

CoV: Chain-of-View Prompting for Spatial Reasoning

CoV:基于视角链的立体推理

Haoyu Zhao, Akide Liu, Zeyu Zhang, Weijie Wang, Feng Chen, Ruihan Zhu, Gholamreza Haffari, Bohan Zhuang

机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) Monash University(墨尔本大学) AIML, Adelaide University(阿德莱德大学AIML)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。

Comments Code link https://github.com/ziplab/CoV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11930 2026-01-12 cs.CV cs.AI 62%

AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning

AtomThink: 多模态慢思考与原子步骤推理

Kun Xiang, Zhili Liu, Terry Jingchen Zhang, Yinya Huang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Hanhui Li, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学) Noah’s Ark Lab(诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 AtomThink通过引入原子步骤推理,提升多模态大语言模型的推理性能和效率。

Comments TPAMI accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04073 2026-01-08 cs.CV cs.AI cs.CL 62%

Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts

在跨模态冲突下分析大型多模态模型的推理一致性

Zhihao Zhu, Jiafeng Liang, Shixin Jiang, Jinlan Fu, Ming Liu, Guanglu Sun, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出逻辑图扰动协议,通过主动视觉上下文细化方法,解决大型多模态模型在跨模态冲突下的推理一致性问题,提升推理鲁棒性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03590 2026-01-08 cs.CV cs.AI 62%

Can LLMs See Without Pixels? Benchmarking Spatial Intelligence from Textual Descriptions

大语言模型能否通过像素感知空间智能?基于文本描述的空间智能基准测试

Zhongbin Guo, Zhen Yang, Yushan Li, Xinyue Zhang, Wenyu Gao, Jiacheng Wang, Chengzhi Li, Xiangrui Liu, Ping Jian

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SiT-Bench通过文本描述评估大语言模型的空间智能,揭示其在全局一致性方面的不足,并表明显式空间推理可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00088 2026-01-08 cs.RO cs.AI cs.LG 62%

Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail

Alpamayo-R1: 联结推理与动作预测以实现通用的自动驾驶在长尾场景

NVIDIA, :, Yan Wang, Wenjie Luo, Junjie Bai, Yulong Cao, Tong Che, Ke Chen, Yuxiao Chen, Jenna Diamond, Yifan Ding, Wenhao Ding, Liang Feng, Greg Heinrich, Jack Huang, Peter Karkus, Boyi Li, Pinyi Li, Tsung-Yi Lin, Dongran Liu, Ming-Yu Liu, Langechuan Liu, Zhijian Liu, Jason Lu, Yunxiang Mao, Pavlo Molchanov, Lindsey Pavao, Zhenghao Peng, Mike Ranzinger, Ed Schmerling, Shida Shen, Yunfei Shi, Sarah Tariq, Ran Tian, Tilman Wekel, Xinshuo Weng, Tianjun Xiao, Eric Yang, Xiaodong Yang, Yurong You, Xiaohui Zeng, Wenyuan Zhang, Boris Ivanovic, Marco Pavone

机构 * NVIDIA

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 Alpamayo-R1通过整合因果推理与轨迹规划,提升了自动驾驶在长尾场景中的规划准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00905 2026-01-06 cs.CV cs.AI 62%

Evaluating Contextual Intelligence in Recyclability: A Comprehensive Study of Image-Based Reasoning Systems

评估可回收性中的情境智能:图像推理系统的全面研究

Eliot Park, Abhi Kumar, Pranav Rajpurkar

机构 * Harvard College(哈佛学院) Stanford University(斯坦福大学) Department of Biomedical Informatics(生物医学信息学系) Harvard Medical School(哈佛医学院)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用先进视觉-语言模型评估物品可回收性,探讨其在不同场景下的表现,揭示模型在情境理解上的进展与不足。

Comments x

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24404 2026-01-01 cs.LG cs.CV 62%

Lifting Vision: Ground to Aerial Localization with Reasoning Guided Planning

提升视觉:基于推理引导的地面到空中定位

Soham Pahari, M. Srinivas

机构 * School of Computer Science, UPES(UPES计算机科学学院) Department of CS&E, NIT Warangal(NIT Warangal计算机科学与工程系)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ViReLoc框架,通过视觉推理实现地面到空中定位,无需依赖GPS数据,提升空间推理和跨视角检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23545 2025-12-30 cs.CV cs.AI 62%

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

PathFound: 一种促进证据寻求病理诊断的代理多模态模型

Shengyi Hua, Jianfeng Wu, Tianle Shen, Kangzhe Hu, Zhongzhen Huang, Shujuan Ni, Zhihong Zhang, Yuan Li, Zhe Wang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) Shanghai Innovation Institute(上海创新研究院) Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) Institute of Pathology, Fudan University(复旦大学病理研究所) Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15759 2025-12-30 cs.CL cs.AI cs.CV 62%

Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs

视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享

Yunxin Li, Zhenyu Liu, Baotian Hu, Wei Wang, Yuxin Ding, Xiaochun Cao, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。

Comments 21 pages, 7 figures; Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22545 2025-12-30 cs.CV cs.AI 62%

Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains

跨多模态领域自奖励的推理框架

Jesen Zhang, Ningyuan Liu, Kaitong Cai, Sidi Liu, Jing Yang, Ziliang Chen, Xiaofei Sun, Keze Wang

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 SR-MCR通过自奖励机制提升多模态推理的连贯性和准确性,在视觉基准测试中取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI 62%

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20934 2025-12-25 cs.CV cs.AI cs.CL cs.MA 62%

Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning

归纳式视觉编程:从经验中演化工具库以进行空间推理

Shengguang Wu, Xiaohan Wang, Yuhui Zhang, Hao Zhu, Serena Yeung-Levy

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 通过从经验中归纳学习工具库,TVP在空间推理任务中实现了更高效的工具发现和重用,优于现有方法。

Comments Project Website: https://transductive-visualprogram.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19609 2025-12-23 cs.CV cs.AI 62%

MapTrace: Scalable Data Generation for Route Tracing on Maps

MapTrace: 用于地图路线追踪的可扩展数据生成

Artemis Panagopoulou, Aveek Purohit, Achin Kulshrestha, Soroosh Yazdani, Mohit Goyal

机构 * Google XR(谷歌XR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18745 2025-12-23 cs.CV cs.CL cs.LG 62%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17532 2025-12-22 cs.CV cs.AI 62%

Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding

Robust-R1: 为鲁棒视觉理解的退化感知推理

Jiaqi Tang, Jianmin Chen, Wei Wei, Xiaogang Xu, Runtao Liu, Xiangyu Wu, Qipeng Xie, Jiafei Wu, Lei Zhang, Qifeng Chen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Robust-R1通过结构化推理链显式建模视觉退化,提升多模态大语言模型在现实世界退化下的鲁棒性与抗干扰能力。

Comments Accepted by AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08976 2025-12-19 cs.LG cs.AI 62%

Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs

peek-a-boo推理:多模态大语言模型中的对比区域遮挡

Isha Chaturvedi, Anjana Nair, Yushen Li, Adhitya Rajendra Kumar, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究机构) Princeton University(普林斯顿大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13752 2025-12-17 cs.CV cs.AI 62%

STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning

STAR:用于统一多模态学习的堆叠自回归方案

Jie Qin, Jiancheng Huang, Limeng Qiao, Lin Ma

机构 * Meituan Inc(美团公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13747 2025-12-17 cs.CV cs.AI 62%

Why Text Prevails: Vision May Undermine Multimodal Medical Decision Making

为何文本占上风:视觉可能损害多模态医疗决策制定

Siyuan Dai, Lunxiao Li, Kun Zhao, Eardi Lila, Paul K. Crane, Heng Huang, Dongkuan Xu, Haoteng Tang, Liang Zhan

机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) University of Pittsburgh(匹兹堡大学) NC State University(北卡罗来纳州立大学) University of Washington(华盛顿大学) University of Maryland(马里兰大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。

Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11827 2025-12-17 cs.CY cs.AI cs.CV 62%

Assessing Greenspace Attractiveness with ChatGPT, Claude, and Gemini: Do AI Models Reflect Human Perceptions?

利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?

Milad Malekzadeh, Magdalena Biernacka, Elias Willberg, Jussi Torkko, Edyta Łaszkiewicz, Tuuli Toivonen

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16313 2025-12-17 cs.LG cs.AI cs.CL 62%

Retrieval Enhanced Feedback via In-context Neural Error-book

通过上下文神经错误本增强的检索反馈

Jongyeop Hyun, Bumsoo Kim

机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。

Comments Accepted at EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 62%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08820 2025-12-10 cs.CV cs.AI 62%

Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning

无需训练的双双曲适配器用于更高效的跨模态推理

Yi Zhang, Chun-Wun Cheng, Junyi He, Ke Yu, Yushun Tang, Carola-Bibiane Schönlieb, Zhihai He, Angelica I. Aviles-Rivero

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无需训练的双双曲适配器方法,通过双曲空间嵌入提升跨模态推理性能,实现更高效的领域泛化和少样本识别。

Comments Accepted in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07136 2025-12-09 cs.CV cs.AI 62%

A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning

大规模多模态数据集与基准用于人类活动场景理解和推理

Siyang Jiang, Mu Yuan, Xiang Ji, Bufang Yang, Zeyu Liu, Lilin Xu, Yang Li, Yuting He, Liran Dong, Wenrui Lu, Zhenyu Yan, Xiaofan Jiang, Wei Gao, Hongkai Chen, Guoliang Xing

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of Pittsburgh(匹兹堡大学)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 CUHK-X是一个大规模多模态数据集和基准,用于人类活动场景理解和推理,通过生成逻辑一致的活动序列提升描述一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20549 2025-12-09 cs.LG cs.AI 62%

MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning

MedGR$^2$: 通过生成奖励学习突破医学推理的数据壁垒

Weihai Zhi, Jiayan Guo, Shangyang Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 MedGR$^2$通过生成奖励学习解决医学推理中的数据稀缺问题,实现高效训练和泛化,优于现有方法。

Comments 8 pages, 5 figures

Journal ref AAAI'2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05809 2025-12-08 cs.CV cs.AI 62%

Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling

通过测试时缩放探查世界模型在空间推理中的有效性

Saurav Jha, M. Jehanzeb Mirza, Wei Lin, Shiqi Yang, Sarath Chandar

机构 * MILA – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Institute for Machine Learning, Johannes Kepler University Linz(林茨约瑟夫·夫兰克大学机器学习研究所) Nankai University(南开大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ViSA框架,通过可验证的微断言改进世界模型的空间推理能力,但发现当前模型在复杂任务中仍存在信息瓶颈。

Comments Extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16567 2025-12-08 cs.CV cs.AI 62%

V-CECE: Visual Counterfactual Explanations via Conceptual Edits

V-CECE:通过概念编辑生成视觉反事实解释

Nikolaos Spanos, Maria Lymperaiou, Giorgos Filandrianos, Konstantinos Thomas, Athanasios Voulodimos, Giorgos Stamou

机构 * National Technical University of Athens(国家技术大学雅典)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 V-CECE通过概念编辑生成反事实解释,无需训练即可产生人类水平的可解释性结果。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07755 2025-12-08 cs.CV cs.AI cs.GR cs.RO 62%

SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models

SAT:多模态语言模型的动态空间能力训练

Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko

机构 * Boston University(波士顿大学) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Microsoft Research(微软研究院) New York University(纽约大学)

专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 SAT通过模拟数据提升多模态语言模型在动态空间推理中的能力,实验表明其在多个基准测试中优于现有方法。

Comments Accepted to COLM 2025. Project webpage: https://arijitray.com/SAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03176 2025-12-04 cs.LG cs.AI 62%

Plantain: Plan-Answer Interleaved Reasoning

Plantain: 计划-答案交错推理

Anthony Liang, Jonathan Berant, Adam Fisch, Abhimanyu Goyal, Kalpesh Krishna, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Plantain通过计划-思考-回答的交错推理方式,提升数学推理和编码任务的性能,同时减少响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02942 2025-12-03 cs.CV cs.AI 62%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00194 2025-12-02 cs.CV cs.LG eess.IV q-bio.QM 62%

AutocleanEEG ICVision: Automated ICA Artifact Classification Using Vision-Language AI

AutocleanEEG ICVision:利用视觉-语言AI实现自动化ICA噪声分类

Zag ElSayed, Grace Westerkamp, Gavin Gammoh, Yanchen Liu, Peyton Siekierski, Craig Erickson, Ernest Pedapati

机构 * School of Information Technology University of Cincinnati Ohio, USA(信息科技学院 奥地利辛辛那提大学 美国俄亥俄州)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 ICVision通过视觉-语言AI实现自动化EEG ICA噪声分类,达到专家级准确度并提供可解释结果。

Comments 6 pages, 8 figures

Journal ref Conference ICMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏