arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2510.16416 2026-05-19 cs.CV cs.AI 79%

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL:重新审视自监督学习作为视觉语言推理的内在奖励

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(技术大学(TUM)) Meituan(美团) Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SSL4RL框架,利用自监督学习任务作为强化学习的可验证奖励,提升视觉语言推理性能,并通过实验验证其在多模态模型对齐中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15764 2026-05-18 cs.CV cs.AI 79%

GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

GRASP:学习多个人非语言互动中的社会推理

Junho Kim, Xu Cao, Houze Yang, Bikram Boote, Ana Jojic, Fiona Ryan, Bolin Lai, Sangmin Lee, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) Amazon AGI Korea University(亚马逊AGI韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GRASP通过连接高层社会问答与细粒度目光和指代手势事件,提升多个人非语言互动的社会推理能力,包含290万对问题-答案对,提出Social Grounding Reward提升模型性能。

Comments Project page: https://social-reaoning.github.io/grasp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14754 2026-05-15 cs.AI 79%

XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

XDomainBench:诊断高维科学知识组合中的推理崩溃

Gong Zhiren, Tiantong Wu, Jiaming Zhang, Fuyao Zhang, Che Wang, Yurong Hao, Yikun Hou, Foo Ping, Yilei Zhao, Fei Huang, Chau Yuen, Wei Yang Bryan Lim

机构 * Alibaba Group, China(阿里巴巴集团,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 XDomainBench通过系统压力测试科学推理,揭示LLM在跨学科知识组合中的推理崩溃问题,发现领域组合导致直接难度增加和轨迹模式引发的误差累积是根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14704 2026-05-15 cs.CV cs.AI cs.RO 79%

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

SceneFunRI:为任务驱动的功能物体定位推理不可见区域

Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SceneFunRI通过半自动化流程构建了855个实例的基准,要求模型根据任务指令和常识推理推断不可见功能物体的位置,现有模型在推理稳定性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 79%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 79%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL 79%

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05820 2026-05-15 cs.SE cs.AI 79%

From Ranking to Reasoning: Explainable Web API Recommendation via Semantic Reasoning

从排序到推理:通过语义推理实现可解释的Web API推荐

Zishuo Xu, Dezhong Yao, Yao Wan

机构 * School of Software Engineering(软件工程学院) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WAR-R1框架,结合语义推理与自适应推荐,通过轻量级大语言模型生成API推荐及自然语言解释,提升推荐准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-05-15 cs.CL 79%

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12918 2026-05-14 cs.CL 79%

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

CommonWhy:用于评估大语言模型实体基础因果常识推理的数据集

Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 CommonWhy数据集通过15000个为什么问题评估大语言模型的因果关系实体推理能力,揭示现有模型在因果推理和事实生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09100 2026-05-13 cs.CL 79%

GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression

GRC:统一推理驱动生成、检索与压缩

Zhongtao Miao, Qiyu Wu, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GRC框架,通过元潜在标记和统一训练方法,将推理驱动生成、文本表示和上下文压缩整合于单次前向传递中,提升部署效率与训练效果。

Comments Fixed typos in Eq. 4 and GPU names; added details on hybrid paged attention implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13898 2026-05-13 cs.HC cs.AI 79%

Social Human Robot Embodied Conversation (SHREC) Dataset: Benchmarking Foundational Models' Social Reasoning

社交人机具身对话(SHREC)数据集:评估基础模型的社会推理能力

Dong Won Lee, Yubin Kim, Denison Guvenoz, Sooyeon Jeong, Parker Malachowsky, Louis-Philippe Morency, Cynthia Breazeal, Hae Won Park

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SHREC数据集,包含400个真实人机交互视频和10000多个标注,用于评估基础模型在社会推理中的能力,揭示社会机器人在情绪理解、意图跟踪等方面的社会挑战。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11006 2026-05-13 cs.SE cs.AI 79%

An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning

一个经过执行验证的多语言基准用于代码语义推理

Yikun Li, Jinfeng Jiang, Ting Zhang, Chengran Yang, Chenxing Zhong, Yin Yide, Leow Wen Bin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

机构 * Singapore Management University(新加坡管理大学) Monash University(墨尔本大学) Nanjing University of Science and Technology(南京理工大学) GovTech Singapore(新加坡政府科技局)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TraceEval,首个经过执行验证的多语言代码语义推理基准,通过验证执行消除标注偏差,评估10个LLM在零样本下的表现,展示了其在代码语义推理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00400 2026-05-13 cs.AI 79%

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

KEPO:基于知识的偏好优化用于多模态推理及其在医学VQA中的应用

Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) University of California, Irvine(加州大学伊文斯分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 KEPO通过质量门控的在线蒸馏和知识增强的探索策略,提升多模态推理任务的训练稳定性与推理一致性,优于强化学习和在线蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10698 2026-05-12 cs.MA cs.AI 79%

The Bystander Effect in Multi-Agent Reasoning: Quantifying Cognitive Loafing in Collaborative Interactions

多智能体推理中的旁观者效应:量化协作互动中的认知惰性

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示多智能体系统中社交压力引发的认知惰性现象,通过评估22500条轨迹发现模型在协作中逻辑主权崩溃,揭示了主权缺口与对齐幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10410 2026-05-12 cs.LG 79%

Equilibrium Residuals Expose Three Regimes of Matrix-Game Strategic Reasoning in Language Models

均衡残差揭示语言模型在矩阵博弈战略推理中的三种模式

Wenhua Nie, Binhan Luo, Zijie Meng, Jyh-Shing Roger Jang, Ching-Wen Ma

机构 * National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究揭示语言模型在矩阵博弈中存在三种战略推理模式,通过实验发现残差奖励在不同矩阵规模下表现差异,证明残差训练在收益变化时具有转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10327 2026-05-12 quant-ph cs.AI cs.SC 79%

SCALAR: A Neurosymbolic Framework for Automated Conjecture and Reasoning in Quantum Circuit Analysis

SCALAR:用于量子电路分析中自动猜想和推理的神经符号框架

Sean Feeney, Pooja Rao, Andreas Klappenecker, Reuben Tate, Yuri Alexeev, Stefano Mensa, Elica Kyoseva, Stephan Eidenbenz

机构 * 1Department of Computer Science, Texas A\&M University, College Station, USA 2NVIDIA Corporation, Santa Clara, USA Artificial Intelligence Division (CAI-3), Los Alamos National Laboratory, Los Alamos, USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SCALAR框架结合量子模拟、符号猜想生成和LLM解释,通过CUDA-Q平台分析量子电路,生成优化QAOA参数与图不变量的关系猜想,并识别图结构特征与优化景观属性的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10146 2026-05-12 cs.AI cs.CR 79%

Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

在恶意知识编辑下知识密集推理安全风险的基准测试

Qinghua Mao, Xi Lin, Jinze Gu, Jun Wu, Siyuan Li, Yuliang Chen

机构 * School of Computer Science(计算机科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EditRisk-Bench,通过整合恶意场景和多级推理任务,系统评估知识编辑对推理行为的影响,揭示恶意知识编辑导致错误推理的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09929 2026-05-12 cs.LG cs.SE 79%

TeleResilienceBench: Quantifying Resilience for LLM Reasoning in Telecommunications

TeleResilienceBench: 评估大语言模型在电信领域推理中的韧性

Pranshav Gajjar, Emmanuel Ojo, Vijay K Shah

机构 * NextG Wireless Lab, North Carolina State University(NextG无线实验室,北卡罗来纳州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出TeleResilienceBench,通过七个电信子领域评估大语言模型在继承不完整推理并纠正错误时的韧性,发现模型在恢复能力上表现有限,且规模扩大并不必然提升韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09822 2026-05-12 cs.CR cs.AI 79%

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

Oracle Poisoning:污染知识图谱以武器化AI代理推理

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

机构 * Microsoft(微软) UNSW Canberra(新南威尔士大学堪培拉分校) SAP OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。

Comments 26 pages, 3 fugres, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09544 2026-05-12 cs.AI 79%

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09262 2026-05-12 cs.CV cs.CL 79%

Reinforcing Multimodal Reasoning Against Visual Degradation

增强多模态推理以对抗视觉退化

Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文言) University of Maryland, College Park(马里兰大学 College Park 分校) University of Virginia(弗吉尼亚大学) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ROMA框架,通过优化动态增强多模态大语言模型对视觉退化的鲁棒性,提升在多种基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00371 2026-05-12 cs.CL cs.CY cs.SE 79%

Reasoning Trajectories for Socratic Debugging of Student Code: From Misconceptions to Contradictions and Updated Beliefs

为学生代码进行苏格拉底调试的推理轨迹:从误解到矛盾与更新信念

Erfan Al-Hossami, Razvan Bunescu

机构 * University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出推理轨迹生成任务,通过标注的调试问题数据集探讨生成推理轨迹和基于LLM的苏格拉底对话方法,实验显示LLM能生成91%正确的推理轨迹和98.7%有效的对话内容。

Comments 25 pages, 2 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09042 2026-05-12 cs.CL 79%

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

评估大语言模型的语用推理:来自量级多样性的证据

Ye-eun Cho

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过量级多样性评估大语言模型的语用推理能力,发现不同模型和任务结构下语用行为差异显著,评价方法无法单一确定模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08755 2026-05-12 cs.LG 79%

LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss

LAQuant: 一种简单且无开销的大型推理模型量化方法通过分层前瞻损失

Euntae Choi, Sumin Song, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出LAQuant,通过分层前瞻损失和推理领域校准,解决量化中的精度与速度问题,提升推理性能并加快解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08094 2026-05-12 cs.CY cs.AI 79%

MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction

MedThink: 通过教师引导的推理校正提升小模型的诊断准确性

Xinchun Su, Chunxu Luo, Lipeng Ma, Yixuan Li, Weidong Yang

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MedThink通过两阶段知识蒸馏框架提升小语言模型的临床推理能力,在医疗基准测试和胃肠病数据集上均优于传统方法,提升诊断准确率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07143 2026-05-11 cs.CL 79%

Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoning

耐心询问患者:通过 grounded 推理实现面向人类的医疗对话 LLM

Jiayuan Zhu, Jiazhen Pan, Yuyuan Liu, Fenglin Liu, Junde Wu

机构 * University of Oxford(牛津大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出 APP,一种基于 LLM 的医疗助手,通过 grounded 推理和透明诊断提升医疗对话的人性化体验,改进诊断准确性并增强用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07103 2026-05-11 cs.AI cs.MA 79%

ARMOR: An Agentic Framework for Reaction Feasibility Prediction via Adaptive Utility-aware Multi-tool Reasoning

ARMOR:一种通过自适应效用感知多工具推理的代理框架用于反应可行性预测

Ye Liu, Botao Yu, Xinyi Ling, Daniel Adu-Ampratwum, Xia Ning

机构 * Department of Biomedical Informatics(生物医学信息学系) Department of Computer Science and Engineering(计算机科学与工程系) Division of Medicinal Chemistry and Pharmacognosy(药物化学与药理学系) Translational Data Analytics Institute(转化数据分析研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ARMOR通过自适应效用感知多工具推理框架,有效整合多个工具的优势,提升反应可行性预测的准确性,尤其在存在工具预测冲突时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06444 2026-05-08 cs.AI 79%

SCRuB: Social Concept Reasoning under Rubric-Based Evaluation

SCRuB:基于规则评估的社会概念推理

Jamelle Watson-Daniels, Himaghna Bhattacharjee, Skyler Wang, Brandon Handoko, Antonio Li, Anaelia Ovalle, Mahesh Pasupuleti, Candace Ross, Vidya Sarma, Arjun Subramonian, Karen Ullrich, Will van der Vaart, Yijing Xin, Maximilian Nickel

机构 * Meta McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SCRuB框架,用于评估大语言模型在社会概念推理方面的能力,通过专家和模型响应对比,展示前沿模型在五个维度上优于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05955 2026-05-08 cs.CL cs.CV 79%

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

TableVista:在视觉和结构复杂性下多模态表格推理的基准测试

Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Tianjin University(天津大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏