arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-05 至 2026-03-05 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 27 篇

2603.03790 2026-03-05 cs.CL cs.AI 81%

T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning

T2S-Bench 及 Structure-of-Thought:基准测试与提示的综合文本到结构推理

Qinsi Wang, Hancheng Ye, Jinhee Kim, Jinghan Ke, Yifei Wang, Martin Kuo, Zishan Shao, Dongting Li, Yueqian Lin, Ting Jiang, Chiyue Wei, Qi Qian, Wei Wen, Helen Li, Yiran Chen

机构 * duke(杜克大学) meta

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Structure-of-Thought和T2S-Bench,通过显式文本结构化提升模型文本处理性能,实验表明其在多个任务中显著提升准确率。

Comments Dataset and Code have been released at https://t2s-bench.github.io/T2S-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03441 2026-03-05 cs.CL cs.AI 81%

CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field

CareMedEval 数据集:评估生物医学领域中的批判性评估与推理

Doria Bonzi, Alexandre Guiggi, Frédéric Béchet, Carlos Ramisch, Benoit Favre

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CareMedEval数据集用于评估生物医学领域中LLM的批判性评估与推理能力,揭示了现有模型在专业领域中的局限性。

Comments Accepted at LREC 2026. To access the dataset, see https://github.com/bonzid/CareMedEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04319 2026-03-05 cs.CL 79%

AILS-NTUA at SemEval-2026 Task 12: Graph-Based Retrieval and Reflective Prompting for Abductive Event Reasoning

AILS-NTUA 在 SemEval-2026 任务 12: 基于图的检索与反思提示的归纳事件推理

Nikolas Karafyllis, Maria Lymperaiou, Giorgos Filandrianos, Athanasios Voulodimos, Giorgos Stamou

机构 * School of Electrical and Computer Engineering, AILS Laboratory(电气与计算机工程学院,AILS实验室) National Technical University of Athens(雅典国家技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AILS-NTUA 提出基于图检索与反思提示的三阶段系统,在 SemEval-2026 任务 12 中实现 0.95 准确率,揭示多标签因果推理中的系统性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04222 2026-03-05 cs.RO cs.AI 79%

PRAM-R: A Perception-Reasoning-Action-Memory Framework with LLM-Guided Modality Routing for Adaptive Autonomous Driving

PRAM-R:一种具有LLM引导模态路由的感知-推理-行动-记忆框架,用于自适应自动驾驶

Yi Zhang, Xian Zhang, Saisi Zhao, Yinglei Song, Chengdong Wu, Nenad Petrovic, Alois Knoll

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PRAM-R通过LLM引导的模态路由和分层记忆模块,实现高效自适应的多模态感知,提升自动驾驶的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03983 2026-03-05 cs.CV cs.AI 79%

GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery

GeoSeg: 无需训练的推理驱动遥感图像分割

Lifan Jiang, Yuhang Pei, oxi Wu, Yan Zhao, Tianrun Wu, Shulong Yu, Lihui Zhang, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University UniTTEC Co. Ltd. Wuchan Zhongda Chengtou (Ningbo) Holdings. Ltd.

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GeoSeg通过结合大规模语言模型推理与精确定位,无需训练实现遥感图像分割的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI 79%

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07181 2026-03-05 cs.RO cs.AI cs.CV 79%

TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics

TIGeR: 视觉-语言模型中集成工具的几何推理

Yi Han, Enshen Zhou, Shanyu Rong, Jingkun An, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

机构 * Beihang University(北洋大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03590 2026-03-05 cs.MA cs.AI 79%

Social Norm Reasoning in Multimodal Language Models: An Evaluation

多模态语言模型中的社会规范推理:一项评估

Oishik Chowdhury, Anushka Debnath, Bastin Tony Roy Savarimuthu

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了多模态大语言模型在社会规范推理中的能力,发现GPT-4o在文本和图像模态中表现最佳,但所有模型在处理复杂规范时仍有困难。

Comments to be published in ICAART 2026 post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV 75%

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03543 2026-03-05 cs.CL cs.AI 73%

Tucano 2 Cool: Better Open Source LLMs for Portuguese

Tucano 2 Cool: 更好的开源葡萄牙语大语言模型

Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Science and Thought(科学与思想研究中心) Helmholtz-Institut für Strahlen- und Kernphysik(亥姆霍兹辐射与核物理研究所) Bonn Sustainable AI Lab(波恩可持续AI实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Tucano 2推出了一系列开源葡萄牙语大语言模型,通过扩展数据集和改进训练方法,实现了在多种语言任务上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03315 2026-03-05 cs.CL cs.AI cs.LG 67%

M-QUEST -- Meme Question-Understanding Evaluation on Semantics and Toxicity

M-QUEST -- 周期性问题理解评估在语义和毒性上

Stefano De Giorgis, Ting-Chih Chen, Filip Ilievski

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 M-QUEST提出一个语义框架和基准,用于自动提取迷因知识,评估模型在毒性理解上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03330 2026-03-05 cs.CL cs.AI 62%

Certainty robustness: Evaluating LLM stability under self-challenging prompts

确定性鲁棒性:在自我挑战提示下评估LLM的稳定性

Mohammadreza Saadat, Steve Nemzer

机构 * TELUS Digital(TELUS数字公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出确定性鲁棒性基准,评估LLM在自我挑战提示下的稳定性与适应性平衡,揭示模型在交互压力下的可靠性差异。

Comments 20 pages, 7 tables Benchmark and evaluation study of large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03298 2026-03-05 cs.CL cs.AI 62%

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

TATRA: 无需训练的实例自适应提示法通过重述与聚合

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04142 2026-03-05 cs.LG 57%

A Multi-Agent Framework for Interpreting Multivariate Physiological Time Series

多智能体框架用于解释多变量生理时间序列

Davide Gabrielli, Paola Velardi, Stefano Faralli, Bardh Prenkaj

机构 * Sapienza University of Rome Rome Italy ISTC-CNR \& Sapienza University of Rome Rome Italy Technical University of Munich Munich Germany Sapienza University of Rome ISTC-CNR \& Sapienza University of Rome Technical University of Munich

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出Vivaldi多智能体框架,通过对比不同模型表现,发现智能体系统在非思考模型中提升解释质量,但在思考模型中反而降低相关性,强调了计算外部化在医疗AI中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03781 2026-03-05 cs.AI 57%

LifeBench: A Benchmark for Long-Horizon Multi-Source Memory

LifeBench: 一个用于长周期多源记忆的基准

Zihao Cheng, Weixin Wang, Yu Zhao, Ziyang Ren, Jiaxuan Chen, Ruiyang Xu, Shuai Huang, Yang Chen, Guowei Li, Mengshi Wang, Yi Xie, Ren Zhu, Zeren Jiang, Keda Lu, Yihong Li, Xiaoliang Wang, Liwei Liu, Cam-Tu Nguyen

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉贾夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Lifebench是一个用于长周期多源记忆的基准,通过密集连接的长周期事件模拟,推动AI代理在多样且时间延长的上下文中整合声明性和非声明性记忆推理。

Comments A total of 28 pages, 8 pages of main text, and 15 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09937 2026-03-05 cs.AI cs.DC 57%

Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?

为何AI代理在云根因分析中系统性失败?

Taeyoon Kim, Woohyeok Park, Hoyeong Yun, Kyungyong Lee

机构 * Hanyang University(汉阳大学) OKESTRO Co., Ltd.(OKESTRO公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了基于LLM的云根因分析代理在推理、通信和环境交互中的系统性故障,揭示了幻觉数据和不完全探索等普遍问题,并通过改进通信协议减少故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06803 2026-03-05 cs.CL cs.MA 57%

SEVADE: Self-Evolving Multi-Agent Analysis with Decoupled Evaluation for Hallucination-Resistant Irony Detection

SEVADE:基于解耦评估的自演化多智能体分析用于抗幻觉讽刺检测

Ziqi Liu, Ziyang Zhou, Yilin Li, Mingxuan Hu, Yushan Pan, Zhijie Xu, Yangbin Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SEVADE通过自演化多智能体分析框架,结合解耦评估机制,提升抗幻觉讽刺检测的准确率和宏F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06743 2026-03-05 cs.RO cs.AI 57%

TPK: Trustworthy Trajectory Prediction Integrating Prior Knowledge For Interpretability and Kinematic Feasibility

TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测

Marius Baden, Ahmed Abouelazm, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。

Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20505 2026-03-05 cs.AI 57%

MuRAL: A Multi-Resident Ambient Sensor Dataset Annotated with Natural Language for Activities of Daily Living

MuRAL:一个多居所环境传感器数据集,标注有自然语言用于日常活动

Xi Chen, Julien Cumin, Fano Ramparany, Dominique Vaufreydaz

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MuRAL数据集通过自然语言标注多居所环境传感器数据,用于提升LLMs在日常活动识别中的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03515 2026-03-05 cs.CY cs.AI 57%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03334 2026-03-05 cs.CL 57%

The CompMath-MCQ Dataset: Are LLMs Ready for Higher-Level Math?

CompMath-MCQ数据集:大语言模型是否准备好应对高级数学?

Bianca Raimondi, Francesco Pivi, Davide Evangelista, Maurizio Gabbrielli

机构 * Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CompMath-MCQ数据集通过多选格式评估LLMs在高级数学推理中的表现,揭示其在复杂计算数学任务上的挑战。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03300 2026-03-05 cs.CL 57%

Benchmarking Legal RAG: The Promise and Limits of AI Statutory Surveys

法律RAG基准测试:AI立法调研的潜力与局限

Mohamed Afane, Emaan Hariri, Derek Ouyang, Daniel E. Ho

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文评估了三种新兴工具在法律RAG基准测试中的表现,发现STARA性能显著提升,而商业平台表现不佳,同时揭示了DOL律师的遗漏问题,并提出了法律RAG的未来设计原则。

Comments Accepted at the 5th ACM Symposium on Computer Science and Law (CS&Law '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04306 2026-03-05 stat.CO 50%

Theory Discovery in Social Networks: Automating ERGM Specification with Large Language Models

社交网络中的理论发现:利用大语言模型自动化ERGM规范

Yidan Sun, Mayank Kejriwal

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出Forge框架,利用大语言模型自动化ERGM规范,通过验证可行性与稳定性约束,提升社交网络形成机制的建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04176 2026-03-05 cs.DB 50%

Scalable Join Inference for Large Context Graphs

大规模上下文图的可扩展连接推断

Shivani Tripathi, Ravi Shetye, Shi Qiao, Alekh Jindal

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合统计剪枝与LLM推理的可扩展连接推断方法,用于提升大规模上下文图构建的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 50%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 推理评测 :reasoning(abstract)

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01154 2026-03-05 cs.CR 50%

vEcho: A Paradigm Shift from Vulnerability Verification to Proactive Discovery with Large Language Models

vEcho:从漏洞验证到大语言模型主动发现的范式转变

Mingcheng Jiang, Jiancheng Huang, Jiangfei Wang, Zhengzhu Xie, Nan Fang, Guang Cheng, Xiaoyan Hu, Hua Wu

专题命中 推理评测 :reasoning(abstract)

AI总结 vEcho利用大语言模型主动发现漏洞,显著提升检测率并降低误报率,同时发现新的0日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11371 2026-03-05 cs.IR 50%

RAG vs. GraphRAG: A Systematic Evaluation and Key Insights

RAG与GraphRAG:系统评估与关键洞察

Haoyu Han, Li Ma, Yu Wang, Harry Shomer, Yongjia Lei, Zhisheng Qi, Kai Guo, Zhigang Hua, Bo Long, Hui Liu, Charu C. Aggarwal, Jiliang Tang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文系统评估RAG与GraphRAG在文本任务中的表现,提出统一评估协议,揭示两者优势与权衡,并探索整合策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏