arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5824 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5824 篇

2506.04289 2026-05-12 cs.LG q-bio.NC 79%

Relational reasoning and inductive bias in transformers and large language models

变换器中的关系推理与归纳偏置

Jesse Geerts, Andrew Liu, Stephanie Chan, Claudia Clopath, Kimberly Stachenfeld

机构 * Imperial College London(帝国理工学院伦敦分校) Google(谷歌) DeepMind(深度Mind) Columbia University(哥伦比亚大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究了变换器和大语言模型在关系推理中的表现,比较了基于权重学习和上下文学习的机制,发现基于权重学习的模型能进行传递推理,而基于上下文学习的模型则依赖训练数据进行传递推理,预训练可使上下文学习模型更接近权重学习模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19669 2026-05-11 cs.CL 79%

DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference

DiffAdapt:面向令牌高效大语言模型推理的难度自适应推理

Xiang Liu, Xuming Hu, Xiaowen Chu, Eunsol Choi

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出DiffAdapt框架,通过分析推理轨迹中的熵分布,根据问题难度选择不同的推理策略,减少令牌使用量,提升推理效率。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07182 2026-05-11 cs.LG 79%

Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

Star Elastic:多模型一体的推理LLM及其高效预算控制

Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan, Sharath Turuvekere Sreenivas, Aditya Vavre, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Sheldon Liang, Marcin Chochowski, Zijia Chen, Akhiad Bercovich, Ran Zilberstein, Ran El-Yaniv, Yonatan Geifman, Daniel Korzekwa, Yoshi Suhara, Oluwatobi Olabiyi, Ashwath Aithal, Nima Tajbakhsh, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Star Elastic方法,通过单次训练任务添加多个嵌套子模型,降低训练成本并解决静态架构的刚性问题,实现动态预算控制,提升推理准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06882 2026-05-11 cs.AI 79%

How Well Do LLMs Perform on the Simplest Long-Chain Reasoning Tasks: An Empirical Study on the Equivalence Class Problem

LLMs在最简单的长链推理任务上表现如何:等价类问题的实证研究

Chun Zheng, Lianlong Wu, Bingqian Li, Lvting Liu, Yi Zhou

机构 * University of Science and Technology of China(中国科学技术大学) University of Oxford(牛津大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了LLMs在等价类问题上的表现,发现非推理模型无法解决,而推理模型虽更优但仍难以完全解决,且问题难度随连接概率和变量数变化而变化。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18856 2026-05-11 cs.CV cs.AI 79%

Motion-o: Trajectory-Grounded Video Reasoning

Motion-o:基于轨迹的视频推理

Bishoy Galoaa, Shayda Moezzi, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Motion-o通过引入运动链推理,使视频推理模型能够显式且可验证地表示物体运动轨迹,提升动态和轨迹依赖性推理的可监督性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16130 2026-05-11 cs.HC cs.AI 79%

Replicating Human Motivated Reasoning Studies with LLMs

用LLMs复制人类动机性推理研究

Neeley Pate, Adiba Mahbub Proma, Hangfeng He, James N. Druckman, Daniel C. Molden, Gourab Ghoshal, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学) Northwestern University(西北大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过复制四项政治动机性推理研究,发现基础LLM行为与人类行为不一致,且不同模型在回避回答和整合论点方面有相似表现,表明基础LLM可能不模拟人类动机性推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05411 2026-05-08 cs.RO cs.AI 79%

Creative Robot Tool Use by Counterfactual Reasoning

通过反事实推理实现创意机器人工具使用

M. Tuluhan Akbulut, Varun Satheesh, Ahmed Jaafar, Alper Ahmetoglu, Shane Parr, Aditya Ganeshan, Shivam Vats, George Konidaris

机构 * Brown University(布朗大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种因果推理框架,用于识别超出其主要目标的合适工具。通过动态模型模拟实验发现工具与任务的因果关系,并通过几何和物理特征扰动生成反事实工具,实现更可靠的工具选择和更强的技能关键点迁移。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05950 2026-05-04 cs.AI 79%

Training-Free Time Series Classification via In-Context Reasoning with LLM Agents

无需训练的时间序列分类通过LLM代理的上下文推理

Songyuan Sui, Zihang Xu, Xia Hu

机构 * Rice University(Rice大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出FETA框架,利用上下文推理实现无需训练的时间序列分类,通过多代理结构提升效率和可解释性,在多个数据集上取得优异性能。

Comments 8 pages main content, 12 pages total including appendix, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26774 2026-04-30 cs.CV cs.AI 79%

MemOVCD: Training-Free Open-Vocabulary Change Detection via Cross-Temporal Memory Reasoning and Global-Local Adaptive Rectification

MemOVCD:基于跨时间记忆推理和全局局部自适应校正的无训练开放词汇变化检测

Zuzheng Kuang, Honghao Chang, Boqiang Liang, Haoqian Wang, Lijun He, Fan Li, Haixia Bi

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MemOVCD通过跨时间记忆推理和全局局部自适应校正,解决开放词汇变化检测中时间耦合不足和局部碎片化问题,验证了其在多基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26106 2026-04-30 cs.AI 79%

Evaluating Strategic Reasoning in Forecasting Agents

评估预测代理中的战略推理

Tom Liptay, Dan Schwarz, Rafael Poyiadzi, Jack Wildman, Nikos I. Bosse

机构 * FutureSearch(未来搜索)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BTF-2基准测试,通过1417个预测问题评估代理的预测准确性及战略推理能力,发现专家预测者在评估政治和商业领袖的激励、判断其执行计划的可能性及建模制度过程方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01544 2026-04-30 cs.LG 79%

MARVIS: Modality Adaptive Reasoning over VISualizations

MARVIS:基于可视化模态自适应推理

Benjamin Feuer, Lennart Purucker, Oussama Elachqar, Chinmay Hegde

机构 * Stanford University(斯坦福大学) Prior Labs(Prior实验室) New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 MARVIS通过将潜在嵌入空间转换为可视化表示,并利用VLM的空间和细粒度推理能力,实现跨视觉、音频、生物和表格域的预测,以3B参数模型在多个领域超越Gemini 2.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11100 2026-04-29 cs.AI 79%

ReCreate: Reasoning and Creating Domain Agents Driven by Experience

ReCreate:基于经验的推理与创造领域代理框架

Zhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ReCreate框架,通过利用代理交互历史,自动创建和适应领域代理,优于人类设计和现有自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24996 2026-04-29 cs.AI 79%

Sparse Personalized Text Generation with Multi-Trajectory Reasoning

稀疏个性化文本生成与多轨迹推理

Bo Ni, Haowei Fu, Qinwen Ge, Franck Dernoncourt, Samyadeep Basu, Nedim Lipka, Seunghyun Yoon, Yu Wang, Nesreen K. Ahmed, Subhojyoti Mukherjee, Puneet Mathur, Ryan A. Rossi, Tyler Derr

机构 * Department of Computer Science, Vanderbilt University, Nashville, Tennessee(范德比尔特大学计算机科学系) Adobe Research, San Jose, California(Adobe研究) University of Orgeon, Eugene, Oregon(奥尔戈恩大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PAT框架,通过双轨迹检索和强化学习机制提升冷启动场景下个性化文本生成的质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17729 2026-04-29 cs.CV cs.AI 79%

SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition

SARE:基于样本的自适应推理用于无训练细粒度视觉识别

Jingxiao Yang, DaLin He, Miao Pan, Kaixiang Yao, Ge Su, Wenqi Zhang, Yifeng Hu, Tangwei Li, Yuke Li, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Netease Yidun AI Lab(网易云智AI实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SARE提出一种样本自适应推理框架,通过结合快速候选检索与细粒度推理,利用历史失败经验提升无训练细粒度视觉识别的准确性和效率。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13730 2026-04-29 cs.IR cs.AI 79%

R3-REC: Reasoning-Driven Recommendation via Retrieval-Augmented LLMs over Multi-Granular Interest Signals

R3-REC:通过多粒度兴趣信号增强的检索增强型大语言模型推荐

Yuchen Miao, Mingxuan Cui, Yitong Zhu, Yu Wang, Siyang Xu

机构 * Sydney Smart Technology College, Northeastern University, China(悉尼智能技术学院,东北大学,中国)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对序列推荐中的证据不足和动态多维意图建模问题,提出R3-REC框架,通过多级用户意图推理、物品语义提取等模块提升推荐效果,实验显示在多个数据集上优于基线模型。

Comments 5 pages, 4 figures, 2 tables. Accepted to the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 5951-5955, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00823 2026-04-28 cs.AI cs.IT cs.SY eess.SY math.IT 79%

Energy-Aware Routing to Large Reasoning Models

面向大推理模型的节能路由

Austin R. Ellis-Mohr, Max Hartman, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大推理模型的能耗问题,提出基于能量供应与波动平衡的路由策略,通过第二阶分析提升系统性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19060 2026-04-22 cs.AI 79%

Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports

强化学习提升LLM在放射学报告疾病分类中的准确性和推理能力

Yishu Wei, Yi Lin, Adam Flanders, George Shih, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine, New York, NY(人口健康科学系,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Weill Cornell Medicine, New York, NY(放射科,韦尔·柯林斯医学中心,纽约,NY) Department of Radiology, Thomas Jefferson University, Philadelphia, PA(放射科,托马斯·杰斐逊大学,费城,PA)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出两阶段方法,通过监督微调优化疾病标签,再用GRPO提升预测准确性与格式,增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14164 2026-04-22 cs.CL 79%

How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

如何微调一个推理模型?一种教师-学生合作框架来合成学生一致的SFT数据

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Dalian University of Technology(大连理工大学) Nanjing University(南京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TESSY框架,通过交替生成风格和非风格标记,解决教师生成数据与学生分布之间的风格差异问题,提升推理模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05498 2026-04-22 cs.AI 79%

GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning

GRAIL:学习与大规模知识图谱交互以实现检索增强推理

Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GRAIL通过结合LLM引导的随机探索与路径过滤,建立数据合成管道,学习动态决策策略,提升知识图谱检索的精度与简洁性平衡,实验表明在三个知识图谱问答数据集上准确率和F1值分别提升21.01%和22.43%。

Comments This is a duplicate submission of the article "Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision" [arXiv:2510.03323]. The content is identical to the newer version. This entry is being withdrawn to avoid redundancy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17574 2026-04-21 cs.CL 79%

Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation

超越微调:基于上下文学习和推理链的干扰项生成

Elaf Alhazmi, Quan Z. Sheng, Wei Emma Zhang

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚) School of Computer and Mathematical Sciences, Adelaide University, Australia(阿德莱德大学计算机与数学科学学院,澳大利亚) College of Engineering and Computing in Al-Lith, Umm Al-Qura University, Saudi Arabia(乌姆·阿尔·库拉大学阿尔·利思工程与计算学院,沙特阿拉伯)

专题命中 其他推理 :chain-of-thought(title);reasoning(abstract);分类 cs.CL

AI总结 本文提出基于上下文学习和推理链的干扰项生成框架,通过无监督语义检索选择示例,提升生成合理干扰项的能力,实验表明在多个基准测试中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02506 2026-04-21 cs.IR cs.AI 79%

R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms

R3A:强化推理用于用户生成内容平台中的RAG相关性评估

Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaohongshu Inc.(小红书公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 R3A通过意图推理和证据定位解决UGC平台中相关性评估的挑战,提升模型在稀疏反馈和非对称相关性中的表现。

Comments Accepted by ACL Industry 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20435 2026-04-21 cs.AI 79%

Deep reflective reasoning in interdependence constrained structured data extraction from clinical notes for digital health

在临床笔记中进行深度反思推理以提取受相互依赖约束的结构化数据用于数字健康

Jingwei Huang, Kuroush Nezafati, Zhikai Chi, Ruichen Rong, Colin Treager, Tingyi Wanyan, Yueshuang Xu, Xiaowei Zhan, Patrick Leavey, Guanghua Xiao, Wenqi Shi, Yang Xie

机构 * Quantitative Biomedical Research Center, Department of Health Data Science and Biostatistics, Peter O'Donnell School of Public Health, University of Texas Southwestern Medical Center(定量生物医学研究中心,健康数据科学与生物统计学系,彼得·奥·多尼尔公共卫生学院,德克萨斯西南医学中心)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出深度反思推理方法,通过迭代自我批评和修订,提升LLM在临床笔记中提取结构化数据的可靠性,尤其在肿瘤学应用中显著提高了各类变量的准确率和F1分数。

Comments 12 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI 79%

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10846 2026-04-17 cs.LG cs.CR 79%

AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models

AutoRAN:大型推理模型中安全推理的自动化劫持

Jiacheng Liang, Tanqiu Jiang, Yuhui Wang, Rongyi Zhu, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Penn State University(宾夕法尼亚州立大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 AutoRAN通过执行模拟方法,利用较弱但对齐差的模型模拟初始劫持尝试,并通过目标LRM的拒绝泄露的推理模式迭代优化攻击,从而绕过安全防护并扩展有害指令。

Comments 10 pages, ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14507 2026-04-17 cs.CV cs.LG 79%

H2VLR: Heterogeneous Hypergraph Vision-Language Reasoning for Few-Shot Anomaly Detection

H2VLR:异构超图视觉-语言推理用于少样本异常检测

Jianghong Huang, Luping Ji, Weiwei Duan, Mao Ye

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出H2VLR框架,通过统一超图联合建模视觉区域和语义概念,将少样本异常检测转化为高阶推理问题,有效提升异常检测性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01410 2026-04-16 cs.AI 79%

GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning

GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理

Yuchen Ying, Weiqi Jiang, Tongya Zheng, Yu Wang, Shunyu Liu, Kaixuan Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13706 2026-04-16 cs.CL 79%

Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models

Co-FactChecker:一种用于人类-人工智能协作事实核查的框架

Dhruv Sahnan, Subhabrata Dutta, Tanmoy Chakraborty, Preslav Nakov, Iryna Gurevych

机构 * MBZUAI(穆罕默德·本·拉希德人工智能技术 institute) TU Darmstadt(德累斯顿理工大学) IIT Delhi(德里印度理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Co-FactChecker框架,通过将模型的思考轨迹作为共享草稿,利用专家反馈指导推理,提升事实核查的准确性和可解释性。

Comments 11 pages, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12378 2026-04-15 cs.CL 79%

ReasonXL: Shifting LLM Reasoning Language Without Sacrificing Performance

ReasonXL: 不牺牲性能的LLM推理语言迁移

Daniil Gurgurov, Tom Röhr, Sebastian von Rohrscheidt, Josef van Genabith, Alexander Löser, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland University(萨尔兰州立大学) Berliner Hochschule für Technik(柏林技术学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ReasonXL,首个跨领域多语言推理平行语料库,通过SFT+RLVR方法实现LLM在目标语言中推理,保留性能并提升跨语言迁移能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12282 2026-04-15 cs.CL 79%

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning

面向多代理多格式推理的鲁棒现实世界电子表格理解

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li

机构 * CUHK MMLab(CUHK多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SpreadsheetAgent框架,通过多模态逐步阅读推理解决大规模电子表格处理问题,通过结构草图和行列摘要提升推理可靠性,实验表明其在Spreadsheet Bench上表现优异。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12046 2026-04-15 cs.CL 79%

Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration

在不确定性中思考:通过推理校准提升长形式生成的真实性

Xin Liu, Lu Wang

机构 * Computer Science and Engineering University of Michigan(计算机科学与工程系密歇根大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出CURE框架,通过在声明层面教授模型处理不确定性,提升长形式生成的真实性。该方法通过多阶段训练流程对齐模型置信度与声明正确性,并在推理时选择性预测,实验表明其在事实准确性上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏