arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-25 至 2026-02-25 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2602.20229 2026-02-25 cs.MA 50%

HieraMAS: Optimizing Intra-Node LLM Mixtures and Inter-Node Topology for Multi-Agent Systems

HieraMAS: 优化多智能体系统内的节点LLM混合与节点间拓扑

Tianjun Yao, Zhaoyi Li, Zhiqiang Shen

专题命中 规划推理 :reasoning(abstract)

AI总结 HieraMAS通过分层协作框架结合节点内LLM混合与节点间拓扑优化,提升多智能体系统性能与成本效率。

Comments 22 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05662 2026-02-25 cs.RO cs.CV 50%

DeLTa: Demonstration and Language-Guided Novel Transparent Object Manipulation

DeLTa: 人机交互与语言引导的新透明物体操控演示

Taeyeop Lee, Gyuree Kang, Bowen Wen, Youngho Kim, Seunghyeok Back, In So Kweon, David Hyunchul Shim, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) KIMM(韩国智能媒体实验室)

专题命中 规划推理 :planning(abstract)

AI总结 DeLTa通过整合深度估计、6D姿态估计和视觉-语言规划,实现基于自然语言指令的精确长周期透明物体操控,无需额外训练或类别先验。

Comments Project page: https://sites.google.com/view/DeLTa25/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2602.18296 2026-02-25 cs.CE cs.AI 83%

Context-Aware Mapping of 2D Drawing Annotations to 3D CAD Features Using LLM-Assisted Reasoning for Manufacturing Automation

基于LLM辅助推理的上下文感知2D绘图注释到3D CAD特征映射

Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng, Seung Ki Moon

机构 * Singapore Institute of Manufacturing Technology (SIMTech), A*STAR, Singapore(新加坡制造技术研究所) Advanced Remanufacturing and Technology Centre (ARTC), A*STAR, Singapore(先进再制造与技术中心) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM辅助推理的上下文感知框架,实现2D绘图注释到3D CAD特征的映射,提升制造自动化精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21161 2026-02-25 cs.RO 78%

ActionReasoning: Robot Action Reasoning in 3D Space with LLM for Robotic Brick Stacking

动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠

Guangming Wang, Qizhen Ying, Yixiong Jing, Olaf Wysocki, Brian Sheil

机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。

Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19117 2026-02-25 cs.CV 78%

Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models

保持符号投影布局:用于视觉-语言模型中以物体为中心的空间推理的符号投影布局

Jaeyun Jang, Seunghui Shin, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SymPL通过将以物体为中心的空间推理转化为符号布局形式,提升视觉-语言模型在多视角场景下的推理性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08550 2026-02-25 cs.CV cs.AI cs.LG cs.MM eess.IV 62%

GOT-Edit: Geometry-Aware Generic Object Tracking via Online Model Editing

GOT-Edit:基于几何的通用目标跟踪 via 在线模型编辑

Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系) Academia Sinica(学术院) Microsoft AI(微软人工智能)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GOT-Edit通过在线模型编辑整合几何感知线索,提升通用目标跟踪在遮挡和杂乱环境中的鲁棒性和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13314 2026-02-25 cs.CV cs.AI 57%

Sim2Radar: Toward Bridging the Radar Sim-to-Real Gap with VLM-Guided Scene Reconstruction

Sim2Radar:通过VLM引导的场景重建弥合雷达仿真到现实的差距

Emily Bejerano, Federico Tondolo, Ayaan Qayyum, Xiaofan Yu, Xiaofan Jiang

机构 * Columbia University(哥伦比亚大学) University of California, Merced(加州大学默塞德分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Sim2Radar通过VLM引导的场景重建,利用合成数据提升雷达感知性能,实现3D AP提升3.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20853 2026-02-25 cs.CV 50%

On the Explainability of Vision-Language Models in Art History

关于视觉-语言模型在艺术史中的可解释性

Stefanie Schneider

机构 * Marburg University(马尔堡大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了XAI方法如何使CLIP在艺术史背景下可视化推理,通过零样本定位实验和人类可解释性研究,探讨了可解释性方法的有效性依赖于类别概念稳定性和表示可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13301 2026-02-25 cs.CV 50%

DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving

DriveMamba: 以任务为中心的可扩展状态空间模型用于高效端到端自动驾驶

Haisheng Su, Wei Wu, Feixiang Song, Junjie Zhang, Zhenjie Yang, Junchi Yan

机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(计算机学院与人工智能学院,上海交通大学) SenseAuto

专题命中 视觉空间推理 :planning(abstract)

AI总结 DriveMamba通过动态任务关系建模、隐式视角对应学习和长期时间融合,提升端到端自动驾驶的效率与可扩展性。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2602.20408 2026-02-25 cs.CY cs.AI cs.HC 77%

Examining and Addressing Barriers to Diversity in LLM-Generated Ideas

检验和解决大语言模型生成想法中的多样性障碍

Yuting Deng, Melanie Brucks, Olivier Toubia

机构 * Deng, Brucks, and Toubia(邓, 布鲁克斯和托比亚)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究了LLM生成想法的多样性问题,通过四种研究发现,通过链式推理提示和普通人物提示可分别减少固定现象和改善知识分区,从而提升想法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20532 2026-02-25 cs.LG cs.AI cs.CL 67%

Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training

Actor-Curator: 通过策略改进带状机为RL后训练实现联合适应课程学习

Zhengyao Gu, Jonathan Light, Raul Astudillo, Ziyu Ye, Langzhou He, Henry Peng Zou, Wei Cheng, Santiago Paternain, Philip S. Yu, Yisong Yue

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) Caltech(加州理工学院) RPI(罗切斯特理工学院) MBZUAI(澳门大学人工智能研究院) University of Chicago(芝加哥大学) NEC Laboratories America(NEC美国实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ACTOR-CURATOR通过策略改进带状机实现RL后训练的联合适应课程学习,有效提升训练稳定性和效率。

Comments 37 pages, 8 figures, 1 table. Preprint under review. Equal contribution by first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20332 2026-02-25 cs.CL cs.AI cs.LG 67%

No One Size Fits All: QueryBandits for Hallucination Mitigation

并非万能一种:用于缓解幻觉的QueryBandits

Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 QueryBandits通过在线学习优化查询重写策略,有效缓解闭源模型中的幻觉问题,优于传统静态策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26626 2026-02-25 cs.LG 57%

Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models

递归自聚合解锁大语言模型的深度思考

Siddarth Venkatraman, Vineet Jain, Sarthak Mittal, Vedant Shah, Johan Obando-Ceron, Yoshua Bengio, Brian R. Bartoldson, Bhavya Kailkhura, Guillaume Lajoie, Glen Berseth, Nikolay Malkin, Moksh Jain

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能 chair) CIFAR Fellow

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 递归自聚合通过结合并行与顺序缩放方法,提升大语言模型的推理能力,实验证明其在多个任务中优于传统方法。

Comments 23 pages, 10 figures. Project page: https://rsa-llm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20799 2026-02-25 cs.SE 50%

Unseen-Codebases-Domain Data Synthesis and Training Based on Code Graphs

基于代码图的未见代码库数据合成与训练

Guangsheng Ou, Qiming Zhang, Sirong Chen, Anji Li, Dong Xu, Tiancheng Luo, Dekun Dai, Cuiyun Gao, Long Wang, Jun Zhou, Mingwei Liu, Zibin Zheng

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 10 篇

2509.23115 2026-02-25 cs.LG cs.AI cs.CL 82%

RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility

RHYTHM:基于层次时间标记的人类移动推理

Haoyu He, Haozheng Luo, Yan Chen, Qi R. Wang

机构 * Northeastern University(东北大学) Northwestern University(西北大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RHYTHM通过层次时间标记框架提升人类移动预测的准确性和效率,实现更高效的时空推理与预测。

Comments Advances in Neural Information Processing Systems 39 (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26314 2026-02-25 cs.CL 79%

Latent Thinking Optimization: Your Latent Reasoning Language Model Secretly Encodes Reward Signals in Its Latent Thoughts

潜在思维优化:你的潜在推理语言模型秘密在潜在思维中编码了奖励信号

Hanwen Du, Yuxin Dong, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Department of Biomedical Informatics, The Ohio State University, USA(生物医学信息学系,俄亥俄州立大学) Translational Data Analytics Institute, The Ohio State University, USA(转化数据分析研究所,俄亥俄州立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LTO方法,通过潜在奖励模型优化LLMs的潜在推理过程,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21053 2026-02-25 cs.CV 67%

OCR-Agent: Agentic OCR with Capability and Memory Reflection

OCR-Agent: 具有能力和记忆反思的代理OCR

Shimin Wen, Zeyu Zhang, Xingdou Bian, Hongjie Zhu, Lulu He, Layi Shama, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 OCR-Agent通过能力反思和记忆反思机制,提升VLMs的推理鲁棒性,实现更稳定的答案质量改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20731 2026-02-25 cs.CV cs.AI cs.LG 62%

Communication-Inspired Tokenization for Structured Image Representations

受通信启发的结构化图像表示分词

Aram Davtyan, Yusuf Sahin, Yasaman Haghighi, Sebastian Stapf, Pablo Acuaviva, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern, Switzerland(伯恩大学计算机视觉组) VITA Lab, EPFL, Switzerland(苏黎世联邦理工学院VITA实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COMiT通过受通信启发的分词框架,学习结构化离散视觉分词序列,提升图像重建和语义理解能力。

Comments Project website: https://araachie.github.io/comit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15763 2026-02-25 cs.LG cs.CL 62%

GLM-5: from Vibe Coding to Agentic Engineering

GLM-5:从振动编码到代理工程

GLM-5-Team, :, Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin Chen, Da Yin, Chendi Ge, Chenghua Huang, Chengxing Xie, Chenzheng Zhu, Congfeng Yin, Cunxiang Wang, Gengzheng Pan, Hao Zeng, Haoke Zhang, Haoran Wang, Huilong Chen, Jiajie Zhang, Jian Jiao, Jiaqi Guo, Jingsen Wang, Jingzhao Du, Jinzhu Wu, Kedong Wang, Lei Li, Lin Fan, Lucen Zhong, Mingdao Liu, Mingming Zhao, Pengfan Du, Qian Dong, Rui Lu, Shuang-Li, Shulin Cao, Song Liu, Ting Jiang, Xiaodong Chen, Xiaohan Zhang, Xuancheng Huang, Xuezhen Dong, Yabo Xu, Yao Wei, Yifan An, Yilin Niu, Yitong Zhu, Yuanhao Wen, Yukuo Cen, Yushi Bai, Zhongpei Qiao, Zihan Wang, Zikang Wang, Zilin Zhu, Ziqiang Liu, Zixuan Li, Bojie Wang, Bosi Wen, Can Huang, Changpeng Cai, Chao Yu, Chen Li, Chengwei Hu, Chenhui Zhang, Dan Zhang, Daoyan Lin, Dayong Yang, Di Wang, Ding Ai, Erle Zhu, Fangzhou Yi, Feiyu Chen, Guohong Wen, Hailong Sun, Haisha Zhao, Haiyi Hu, Hanchen Zhang, Hanrui Liu, Hanyu Zhang, Hao Peng, Hao Tai, Haobo Zhang, He Liu, Hongwei Wang, Hongxi Yan, Hongyu Ge, Huan Liu, Huanpeng Chu, Jia'ni Zhao, Jiachen Wang, Jiajing Zhao, Jiamin Ren, Jiapeng Wang, Jiaxin Zhang, Jiayi Gui, Jiayue Zhao, Jijie Li, Jing An, Jing Li, Jingwei Yuan, Jinhua Du, Jinxin Liu, Junkai Zhi, Junwen Duan, Kaiyue Zhou, Kangjian Wei, Ke Wang, Keyun Luo, Laiqiang Zhang, Leigang Sha, Liang Xu, Lindong Wu, Lintao Ding, Lu Chen, Minghao Li, Nianyi Lin, Pan Ta, Qiang Zou, Rongjun Song, Ruiqi Yang, Shangqing Tu, Shangtong Yang, Shaoxiang Wu, Shengyan Zhang, Shijie Li, Shuang Li, Shuyi Fan, Wei Qin, Wei Tian, Weining Zhang, Wenbo Yu, Wenjie Liang, Xiang Kuang, Xiangmeng Cheng, Xiangyang Li, Xiaoquan Yan, Xiaowei Hu, Xiaoying Ling, Xing Fan, Xingye Xia, Xinyuan Zhang, Xinze Zhang, Xirui Pan, Xu Zou, Xunkai Zhang, Yadi Liu, Yandong Wu, Yanfu Li, Yidong Wang, Yifan Zhu, Yijun Tan, Yilin Zhou, Yiming Pan, Ying Zhang, Yinpei Su, Yipeng Geng, Yong Yan, Yonglin Tan, Yuean Bi, Yuhan Shen, Yuhao Yang, Yujiang Li, Yunan Liu, Yunqing Wang, Yuntao Li, Yurong Wu, Yutao Zhang, Yuxi Duan, Yuxuan Zhang, Zezhen Liu, Zhengtao Jiang, Zhenhe Yan, Zheyu Zhang, Zhixiang Wei, Zhuo Chen, Zhuoer Feng, Zijun Yao, Ziwei Chai, Ziyuan Wang, Zuzhou Zhang, Bin Xu, Minlie Huang, Hongning Wang, Juanzi Li, Yuxiao Dong, Jie Tang

机构 * GLM-5 Team(GLM-5团队) Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 GLM-5通过异步强化学习和DSA技术实现高效训练与推理,展现卓越的软件工程能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21178 2026-02-25 cs.CV cs.AI 57%

XMorph: Explainable Brain Tumor Analysis Via LLM-Assisted Hybrid Deep Intelligence

XMorph: 通过LLM辅助混合深度智能进行可解释性脑肿瘤分析

Sepehr Salem Ghahfarokhi, M. Moein Esfahani, Raj Sunderraman, Vince Calhoun, Mohammed Alser

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) TReNDS Center, Georgia State University(TReNDS中心,佐治亚州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 XMorph通过结合LLM和混合深度智能,实现了对脑肿瘤的高效可解释分类,准确率达96.0%。

Comments Accepted in ICCABS 2026: The 14th International Conference on Computational Advances in Bio and Medical Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20926 2026-02-25 cs.AI 57%

HELP: HyperNode Expansion and Logical Path-Guided Evidence Localization for Accurate and Efficient GraphRAG

HELP: 图形节点扩展与逻辑路径引导的证据定位用于准确且高效的图RAG

Yuqi Huang, Ning Liao, Kai Yang, Anning Hu, Shengchao Hu, Xiaoxing Wang, Junchi Yan

机构 * Shanghai Jiao Tong University, China(上海交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 HELP通过HyperNode扩展和逻辑路径引导的证据定位策略,提升图RAG在准确性和效率之间的平衡,实现高效且准确的知识检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20727 2026-02-25 cs.CL 57%

ID-LoRA: Efficient Low-Rank Adaptation Inspired by Matrix Interpolative Decomposition

ID-LoRA: 基于矩阵插值分解的高效低秩适应

Xindian Ma, Rundong Kong, Peng Zhang, Ruoxiang Huang, Yongyu Jiang

机构 * Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ID-LoRA通过基于矩阵插值分解的低秩适应方法,在减少可训练参数的同时保持模型容量,优于现有PEFT技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20639 2026-02-25 cs.AI 57%

Grounding LLMs in Scientific Discovery via Embodied Actions

通过具身动作 grounding LLMs 在科学发现中

Bo Zhang, Jinfeng Zhou, Yuxuan Chen, Jianing Yin, Minlie Huang, Hongning Wang

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。

Comments 24 pages, 7 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14281 2026-02-25 cs.CR cs.CL 57%

MCPShield: A Security Cognition Layer for Adaptive Trust Calibration in Model Context Protocol Agents

MCPShield: 一种用于模型上下文协议代理自适应信任校准的安全认知层

Zhenhong Zhou, Yuanhe Zhang, Hongwei Cai, Moayad Aloqaily, Ouns Bouachir, Linsey Pang, Prakhar Mehrotra, Kun Wang, Qingsong Wen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MCPShield通过元数据引导探测和历史轨迹推理,提升代理在调用MCP工具时的安全性,有效防御MCP攻击。

Comments 21 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 21 篇

2602.20901 2026-02-25 cs.CV cs.LG 88%

SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准

Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Hao Zhu, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) ManyCore State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.LG

AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20878 2026-02-25 cs.AI 79%

Diagnosing Causal Reasoning in Vision-Language Models via Structured Relevance Graphs

通过结构化相关性图诊断视觉-语言模型中的因果推理

Dhita Putri Pratama, Soyeon Caren Han, Yihao Ding

机构 * University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ViLCaR基准,通过结构化相关性图评估视觉-语言模型的因果推理能力,发现其局限性源于结构指导不足而非推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 78%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20291 2026-02-25 cs.CV 78%

De-rendering, Reasoning, and Repairing Charts with Vision-Language Models

图表去渲染、推理与修复:基于视觉-语言模型

Valentin Bonas, Martin Sinnona, Viviana Siless, Emmanuel Iarussi

机构 * Universidad Torcuato Di Tella(托克托迪特拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究理事会) Facultad de Ciencias Exactas y Naturales Universidad de Buenos Aires(布宜诺斯艾利斯大学科学与自然学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出了一种结合图表去渲染、自动分析和迭代改进的框架,利用视觉-语言模型提供基于原则的可视化设计反馈,提升可视化质量和素养。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-02-25 cs.CV 78%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21015 2026-02-25 cs.CV 71%

From Perception to Action: An Interactive Benchmark for Vision Reasoning

从感知到行动:一个交互式基准测试用于视觉推理

Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee

机构 * Singapore University of Technology(新加坡科技设计大学) Singapore Management University (SMU), Singapore(新加坡管理学院) Nanyang Technological University (NTU), Singapore(南洋理工大学) University of Science(科学大学)

专题命中 推理评测 :reasoning(title)

AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。

Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/

详情

展开后加载摘要…

URL PDF HTML 收藏