arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-19 至 2025-12-19 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 15 篇

2512.08976 2025-12-19 cs.LG cs.AI 86%

Peek-a-Boo Reasoning: Contrastive Region Masking in MLLMs

peek-a-boo推理:多模态大语言模型中的对比区域遮挡

Isha Chaturvedi, Anjana Nair, Yushen Li, Adhitya Rajendra Kumar, Kevin Zhu, Sunishchal Dev, Ashwinee Panda, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究机构) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16795 2025-12-19 cs.CL cs.AI cs.CY cs.IR 81%

From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs

从事实到结论:在检索增强的大语言模型中整合演绎推理

Shubham Mishra, Samyek Jain, Gorang Mehrishi, Shiv Tiwari, Harsh Sharma, Pratik Narang, Dhruv Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16287 2025-12-19 cs.CL 79%

Evaluating OpenAI GPT Models for Translation of Endangered Uralic Languages: A Comparison of Reasoning and Non-Reasoning Architectures

评估OpenAI GPT模型用于濒危乌拉尔语系语言的翻译:推理与非推理架构的比较

Yehor Tereshchenko, Mika Hämäläinen, Svitlana Myroniuk

机构 * Metropolia University of Applied Sciences(应用科学大学) University of Helsinki(赫尔辛基大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究比较了OpenAI GPT模型在翻译濒危乌拉尔语系语言中的推理与非推理架构性能,发现推理模型在翻译任务中表现更优。

Comments IWCLUL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 79%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16553 2025-12-19 cs.AI cs.CL 62%

Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild

网络中的针:评估在真实世界中检索和推理网页的基准测试

Yumeng Wang, Tianyu Fan, Lingrui Xu, Chao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Needle in the Web 是一个评估现代搜索代理和LLM在模糊探索性查询中检索和推理真实网页能力的基准测试,揭示了当前搜索系统在处理模糊性和复杂性时的挑战。

Comments Data and code are available at https://github.com/Tango-Whiskyman/Needle_in_the_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16041 2025-12-19 cs.CL cs.AI 62%

Are We on the Right Way to Assessing LLM-as-a-Judge?

我们是否在正确地评估LLM作为裁判?

Yuanning Feng, Sinan Wang, Zhengxiang Cheng, Yao Wan, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Sage评估套件,通过局部和全局一致性指标评估LLM作为裁判的可靠性,发现当前先进模型在复杂情况下存在显著偏好不一致问题,并揭示情境偏好现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI 62%

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 57%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19509 2025-12-19 cs.CL eess.AS 57%

Which Evaluation for Which Model? A Taxonomy for Speech Model Assessment

哪种模型用哪种评估?语音模型评估的分类

Maureen de Seyssel, Eeshan Gunesh Dhekane

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出语音模型评估的分类体系,通过三个正交轴定义评估方面、模型能力及任务要求,帮助选择和优化评估方法。

Comments 57 pages (26 main, 25 appendix, 6 references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16030 2025-12-19 cs.AI 57%

Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets

大型语言模型知道它们不知道什么吗?Kalshibench:通过预测市场评估知识校准的新基准

Lukas Nel

机构 * Lotus AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现大型语言模型普遍存在过度自信问题,表明知识校准需要专门发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16022 2025-12-19 cs.AI 57%

Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting

对话式时间序列基础模型:迈向可解释且有效的预测

Defu Cao, Michael Gee, Jinbo Liu, Hengxuan Wang, Wei Yang, Rui Wang, Yan Liu

机构 * University of Southern California(南加州大学) Amazon AWS(亚马逊AWS)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种对话式时间序列基础模型,通过智能法官机制协调集成模型,提升预测的可解释性和效果。

Comments 31Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17361 2025-12-19 cs.LG cs.CR 57%

Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias

相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持

Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schonherr, Yisroel Mirsky

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。

Journal ref The Network and Distributed System Security Symposium (NDSS). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09670 2025-12-19 cs.AI 57%

MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement

MEML-GRPO:异构多专家互学习用于强化学习可验证奖励的进步

Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MEML-GRPO通过异构多专家互学习机制,提升RLVR在复杂任务中的推理能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15949 2025-12-19 cs.CV 50%

The Perceptual Observatory Characterizing Robustness and Grounding in MLLMs

感知观测站:多模态大语言模型的鲁棒性与基础性表征

Tejas Anvekar, Fenil Bardoliya, Pavan K. Turaga, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 感知观测站通过系统性扰动和真实数据集,评估多模态大语言模型在视觉基础性和关系结构上的鲁棒性,揭示其在扰动下的表现,为模型分析提供系统基础。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15251 2025-12-19 cs.SE 50%

Input Reduction Enhanced LLM-based Program Repair

输入减少增强的基于大语言模型的程序修复

Boyang Yang, Luyao Ren, Xin Yin, Jiadong Ren, Haoye Tian, Shunfu Jin

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出ReduceFix方法,通过减少故障诱导输入提升基于LLM的程序修复性能,实验表明其在多个基准上显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏