arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-19 至 2025-12-19 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 6 篇

2504.11900 2025-12-19 cs.CL 79%

Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection

寻找有缺陷的虚构作品:通过情节漏洞检测评估语言模型的复杂推理

Kabir Ahuja, Melanie Sclar, Yulia Tsvetkov

机构 * Paul G. Allen Center for Computer Science & Engineering(保罗·G·艾伦计算机科学与工程中心) University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出通过情节漏洞检测评估语言模型的复杂推理能力,发现先进模型在检测漏洞时表现不佳,且生成故事易引入漏洞。

Comments CoLM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16584 2025-12-19 cs.CV 78%

Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs

Sketch-in-Latents: 在潜在空间中实现多模态统一推理

Jintao Tong, Jiaqi Gu, Yujing Lou, Lubin Fan, Yixiong Zou, Yue Wu, Jieping Ye, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 SkiLa通过在潜在空间中实现多模态统一推理,扩展MLLMs的自回归能力,生成连续视觉嵌入,提升视觉任务性能和多模态泛化能力。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00878 2025-12-19 cs.CL cs.AI 62%

Less is More: Resource-Efficient Low-Rank Adaptation

少即是多:资源高效的低秩适应

Chunlin Tian, Xuyang Wei, Huanrong Liu, Zhijiang Guo, Li Li

机构 * University of Macau(澳门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EffiLoRA通过统一A矩阵和动态B矩阵更新,在多种模型中实现更高效且鲁棒的低秩适应。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16279 2025-12-19 cs.AI cs.CL 62%

QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems

QuadSentinel: 多智能体系统中机器可验证的顺序安全控制

Yiliu Yang, Yilei Jiang, Qunzhong Wang, Yingshui Tan, Xiaoyong Zhu, Sherman S. M. Chow, Bo Zheng, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 QuadSentinel通过四智能体守卫系统,将安全政策转化为机器可验证规则,提升多智能体系统的安全控制效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03226 2025-12-19 cs.AI 57%

Towards Practical GraphRAG: Efficient Knowledge Graph Construction and Hybrid Retrieval at Scale

迈向实用的GraphRAG:高效的图知识库构建与大规模混合检索

Congmin Min, Sahil Bansal, Joyce Pan, Abbas Keshavarzi, Rhea Mathew, Amar Viswanathan Kannan

机构 * SAP

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种高效构建图知识库和混合检索策略的框架,通过降低成本和提升可扩展性,实现大规模检索增强生成在企业环境中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16302 2025-12-19 cs.RO 50%

ManiLong-Shot: Interaction-Aware One-Shot Imitation Learning for Long-Horizon Manipulation

ManiLong-Shot:交互感知的一次学习方法用于长周期操控

Zixuan Chen, Chongkai Gao, Lin Shao, Jieqi Shi, Jing Huo, Yang Gao

机构 * National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ManiLong-Shot通过交互感知原语分解实现长周期操控任务的一次学习,有效提升机器人任务执行能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 15 篇

2512.08976 2025-12-19 cs.LG cs.AI 86%

Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs

peek-a-boo推理:多模态大语言模型中的对比区域遮挡

Isha Chaturvedi, Anjana Nair, Yushen Li, Adhitya Rajendra Kumar, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究机构) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16795 2025-12-19 cs.CL cs.AI cs.CY cs.IR 81%

From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs

从事实到结论:在检索增强的大语言模型中整合演绎推理

Shubham Mishra, Samyek Jain, Gorang Mehrishi, Shiv Tiwari, Harsh Sharma, Pratik Narang, Dhruv Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16287 2025-12-19 cs.CL 79%

Evaluating OpenAI GPT Models for Translation of Endangered Uralic Languages: A Comparison of Reasoning and Non-Reasoning Architectures

评估OpenAI GPT模型用于濒危乌拉尔语系语言的翻译:推理与非推理架构的比较

Yehor Tereshchenko, Mika Hämäläinen, Svitlana Myroniuk

机构 * Metropolia University of Applied Sciences(应用科学大学) University of Helsinki(赫尔辛基大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究比较了OpenAI GPT模型在翻译濒危乌拉尔语系语言中的推理与非推理架构性能,发现推理模型在翻译任务中表现更优。

Comments IWCLUL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 79%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16553 2025-12-19 cs.AI cs.CL 62%

Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild

网络中的针:评估在真实世界中检索和推理网页的基准测试

Yumeng Wang, Tianyu Fan, Lingrui Xu, Chao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Needle in the Web 是一个评估现代搜索代理和LLM在模糊探索性查询中检索和推理真实网页能力的基准测试,揭示了当前搜索系统在处理模糊性和复杂性时的挑战。

Comments Data and code are available at https://github.com/Tango-Whiskyman/Needle_in_the_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16041 2025-12-19 cs.CL cs.AI 62%

Are We on the Right Way to Assessing LLM-as-a-Judge?

我们是否在正确地评估LLM作为裁判?

Yuanning Feng, Sinan Wang, Zhengxiang Cheng, Yao Wan, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Sage评估套件,通过局部和全局一致性指标评估LLM作为裁判的可靠性,发现当前先进模型在复杂情况下存在显著偏好不一致问题,并揭示情境偏好现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI 62%

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 57%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19509 2025-12-19 cs.CL eess.AS 57%

Which Evaluation for Which Model? A Taxonomy for Speech Model Assessment

哪种模型用哪种评估?语音模型评估的分类

Maureen de Seyssel, Eeshan Gunesh Dhekane

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出语音模型评估的分类体系,通过三个正交轴定义评估方面、模型能力及任务要求,帮助选择和优化评估方法。

Comments 57 pages (26 main, 25 appendix, 6 references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16030 2025-12-19 cs.AI 57%

Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets

大型语言模型知道它们不知道什么吗?Kalshibench:通过预测市场评估知识校准的新基准

Lukas Nel

机构 * Lotus AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现大型语言模型普遍存在过度自信问题,表明知识校准需要专门发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16022 2025-12-19 cs.AI 57%

Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting

对话式时间序列基础模型:迈向可解释且有效的预测

Defu Cao, Michael Gee, Jinbo Liu, Hengxuan Wang, Wei Yang, Rui Wang, Yan Liu

机构 * University of Southern California(南加州大学) Amazon AWS(亚马逊AWS)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种对话式时间序列基础模型,通过智能法官机制协调集成模型,提升预测的可解释性和效果。

Comments 31Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17361 2025-12-19 cs.LG cs.CR 57%

Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias

相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持

Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schonherr, Yisroel Mirsky

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。

Journal ref The Network and Distributed System Security Symposium (NDSS). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09670 2025-12-19 cs.AI 57%

MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement

MEML-GRPO:异构多专家互学习用于强化学习可验证奖励的进步

Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MEML-GRPO通过异构多专家互学习机制,提升RLVR在复杂任务中的推理能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15949 2025-12-19 cs.CV 50%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15251 2025-12-19 cs.SE 50%

Input Reduction Enhanced LLM-based Program Repair

输入减少增强的基于大语言模型的程序修复

Boyang Yang, Luyao Ren, Xin Yin, Jiadong Ren, Haoye Tian, Shunfu Jin

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出ReduceFix方法,通过减少故障诱导输入提升基于LLM的程序修复性能,实验表明其在多个基准上显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 10 篇

2512.16824 2025-12-19 cs.LG math.DS 79%

Tiny Recursive Control: Iterative Reasoning for Efficient Optimal Control

Tiny Recursive Control: 迭代推理用于高效的最优控制

Amit Jain, Richard Linares

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 TRC通过递归推理实现高效最优控制,在非线性控制问题中达到接近最优性能,且内存和计算需求显著低于语言模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24342 2025-12-19 cs.CV cs.CL 79%

VAEER: Visual Attention-Inspired Emotion Elicitation Reasoning

VAEER:基于视觉注意力的情感激发推理

Fanhang Man, Xiaoyue Chen, Huandong Wang, Baining Zhao, Han Li, Xinlei Chen

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Peng Cheng Labotory(鹏城实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 VAEER通过结合注意力启发的提示提取与知识引导推理,实现了多标签情绪激发,展示了在社交媒体和灾难图像上的高精度情绪预测能力。

Comments Currently under review as conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16391 2025-12-19 cs.LG cs.AI cs.DC 62%

Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

Kascade:一种适用于长上下文LLM推理的实用稀疏注意力方法

Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra, Ramachandran Ramjee

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Kascade是一种无需训练的稀疏注意力方法,通过锚定层计算Top-k索引并重用,实现长上下文LLM推理中的高效注意力处理。

Comments 11 pages, 8 figures, 3 tables and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15793 2025-12-19 cs.CY cs.AI cs.CL 62%

Explainable Ethical Assessment on Human Behaviors by Generating Conflicting Social Norms

通过生成冲突的社会规范进行可解释的伦理评估

Yuxi Sun, Wei Gao, Hongzhan Lin, Jing Ma, Wenxuan Zhang

机构 * Department of Computer Science(计算机科学系) School of Computing and Information Systems(计算与信息学系) Information Systems Technology and Design(信息系统技术与设计)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClarityEthic方法,通过生成冲突的社会规范提升AI对人类行为效用的预测和解释能力。

Comments Acceppt by Asia-Pacific Chapter of the Association for Computational Linguistics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16656 2025-12-19 cs.AI cs.CY 57%

Comprehensive AI Literacy: The Case for Centering Human Agency

全面的AI素养:以人类能动性为中心的案例

Sri Yash Tadimalla, Justin Cary, Gordon Hull, Jordan Register, Daniel Maxwell, David Pugalee, Tina Heafner

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文主张以人类能动性为核心,推动全面AI素养教育,强调批判性思维和伦理考量,通过构建素养、熟练度和能力框架,促进教育者和学生在AI应用中的自主决策能力。

Comments 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16344 2025-12-19 cs.AI 57%

AI Needs Physics More Than Physics Needs AI

AI需要物理比物理需要AI更多

Peter Coveney, Roger Highfield

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了AI与物理之间的相互影响,指出物理对AI有更多贡献,并提出通过理论严谨性与机器学习灵活性结合来发展'大AI'的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15776 2025-12-19 cs.AI cs.MA cs.RO 57%

Emergence: Overcoming Privileged Information Bias in Asymmetric Embodied Agents via Active Querying

涌现:通过主动查询克服不对称具身智能体中的特权信息偏差

Shaun Baek, Sam Liu, Joseph Ukpong

机构 * Emory University(埃默里大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过主动查询机制解决不对称具身智能体中的特权信息偏差问题,揭示了沟通接地错误对协作成功率的影响。

Comments 12 pages, 9 pages of content, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15728 2025-12-19 q-fin.GN cs.AI 57%

FedSight AI: Multi-Agent System Architecture for Federal Funds Target Rate Prediction

FedSight AI:用于联邦基金目标利率预测的多智能体系统架构

Yuhan Hou, Tianji Rao, Jeremy Tan, Adler Viton, Xiyue Zhang, David Ye, Abhishek Kodi, Sanjana Dulam, Aditya Paul, Yikai Feng

机构 * Duke University(杜克大学) BNY AI Hub

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 FedSight AI通过多智能体框架和Chain-of-Draft扩展,利用大型语言模型预测联邦基金利率,实现高准确率和稳定性,优于现有基线模型。

Comments NeurIPS 2025 Generative AI in Finance Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09254 2025-12-19 cs.GT cs.MA 50%

The Illusion of Rationality: Tacit Bias and Strategic Dominance in Frontier LLM Negotiation Games

理性幻觉:前沿大语言模型谈判游戏中的隐性偏见与战略主导

Manuel S. Ríos, Ruben F. Manrique, Nicanor Quijano, Luis F. Giraldo

专题命中 其他推理 :reasoning(abstract)

AI总结 研究揭示前沿大语言模型在谈判游戏中存在隐性偏见和战略主导现象,挑战了其理性与无偏的假设。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏