arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-03 至 2026-02-03 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 50 篇

2506.03194 2026-02-03 cs.CV cs.AI cs.LG 62%

HueManity: Probing Fine-Grained Visual Perception in MLLMs

HueManity: 探索 MLLMs 中的细粒度视觉感知

Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

机构 * Google(谷歌) Waymo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。

Journal ref ICML 2025 Workshop on Assessing World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00046 2026-02-03 cs.LG cs.CL 62%

Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy

将Beacon扩展到印地语:文化适应驱动跨语言趋炎附势

Sarthak Sattigeri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究通过文化适应提示评估语言模型在印地语中的趋炎附势现象,发现文化因素对跨语言对齐行为有显著影响。

Comments First Hindi sycophancy benchmark using a three-condition design separating language and cultural effects, with empirical evaluation across four instruction-tuned models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00016 2026-02-03 cs.CL cs.AI 62%

PTCBENCH: Benchmarking Contextual Stability of Personality Traits in LLM Systems

PTCBENCH: 对LLM系统中人格特质情境稳定性的基准测试

Jiongchi Yu, Yuhan Ma, Xiaoyu Zhang, Junjie Wang, Qiang Hu, Chao Shen, Xiaofei Xie

机构 * Singapore Management University(新加坡管理大学) Tianjin University(天津大学) Nanyang Technological University(南洋理工大学) Xi’an Jiaotong University(西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PTCBENCH通过评估LLM在不同情境下的人格一致性,揭示外部事件对LLM人格和推理能力的影响,为构建更稳健的心理学对齐AI系统提供新视角。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02360 2026-02-03 cs.CL 57%

Automated Multiple Mini Interview (MMI) Scoring

自动化多轮面试(MMI)评分

Ryan Huynh, Frank Guerin, Alison Callwood

机构 * University of Surrey(萨里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多智能体提示框架,通过转录优化和标准特定评分提升MMI评分的准确性和可靠性,优于传统微调方法。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02079 2026-02-03 cs.LG cs.SE 57%

AICD Bench: A Challenging Benchmark for AI-Generated Code Detection

AICD Bench: 一个用于AI生成代码检测的挑战性基准

Daniil Orel, Dilshod Azizov, Indraneil Paul, Yuxia Wang, Iryna Gurevych, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎伊德大学人工智能学院) Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science, TU Darmstadt(计算机科学系,图恩大学) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 AICD Bench提出一个全面的AI生成代码检测基准,包含200万例、77个模型及9种编程语言,通过三个现实任务评估检测性能,推动更鲁棒的检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07477 2026-02-03 cs.AI 57%

JudgeFlow: Agentic Workflow Optimization via Block Judge

JudgeFlow: 通过块判断实现代理工作流优化

Zihan Ma, Zhikai Zhao, Chuanbo Hua, Federico Berto, Jinkyoo Park

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 JudgeFlow通过引入可配置的逻辑块和专用判断模块,实现代理工作流的高效优化,提升样本效率和可解释性,并在数学推理和代码生成任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09556 2026-02-03 cs.CL 57%

WUGNECTIVES: Novel Entity Inferences of Language Models from Discourse Connectives

WUGNECTIVES: 语言模型中 discourse connectives 对 novel entities 的新颖实体推断

Daniel Brubaker, William Sheffield, Junyi Jessy Li, Kanishka Misra

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 WUGNECTIVES研究语言模型如何通过语篇连接词推断新颖实体,发现调优模型能提升多数连接词的性能,但让步意义连接词表现不佳。

Comments 19 pages total, 10 pages main; 8 figures total, 5 figures main; 10 tables total, 4 tables main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13811 2026-02-03 cs.LG 57%

Context-Free Synthetic Data Mitigates Forgetting

无上下文合成数据缓解遗忘

Parikshit Bansal, Sujay Sanghavi

机构 * Parikshit Bansal(独立研究者) Sujay Sanghavi(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 通过无上下文生成缓解语言模型微调中的遗忘问题,保持零样本和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09382 2026-02-03 cs.IR cs.AI 57%

Towards Next-Generation Recommender Systems: A Benchmark for Personalized Recommendation Assistant with LLMs

迈向下一代推荐系统:一种用于基于LLM的个性化推荐助手的基准测试

Jiani Huang, Shijie Wang, Liang-bo Ning, Wenqi Fan, Shuaiqiang Wang, Dawei Yin, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RecBench+数据集,用于评估LLM在复杂用户推荐任务中的能力,揭示LLM在处理条件查询时的优势及推理挑战。

Comments Accepted for publication at WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01276 2026-02-03 cs.AI 57%

LLM-Driven Ontology Construction for Enterprise Knowledge Graphs

基于大语言模型的企业知识图谱本体构建

Abdulsobur Oyewale, Tommaso Soru

机构 * Liber AI Research(Liber AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OntoEKG,利用大语言模型自动构建企业知识图谱的领域本体,通过提取和蕴含模块提升效率,但在范围定义和层次推理方面仍有挑战。

Comments 20th International Conference on Semantic Computing (ICSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01239 2026-02-03 cs.CL cs.IR 57%

Inferential Question Answering

推断性问答

Jamshid Mozafari, Hamed Zamani, Guido Zuccon, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出推断性QA任务,通过构建QUIT数据集,发现传统QA方法在推断任务中表现不佳,揭示当前QA流程难以处理基于推断的推理。

Comments Proceedings of the ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01193 2026-02-03 cs.CL cs.CV 57%

Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation

弥合词汇歧义与视觉:关于视觉词义消歧的简要综述

Shashini Nilukshi, Deshan Sumanathilaka

机构 * School of Computing Informatics(计算与信息学学院) Institute of Technology(技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。

Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 57%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01030 2026-02-03 cs.CL cs.SD eess.AS 57%

Bias in the Ear of the Listener: Assessing Sensitivity in Audio Language Models Across Linguistic, Demographic, and Positional Variations

倾听者之偏见:评估音频语言模型在语言、人口统计和位置变化中的敏感性

Sheng-Lun Wei, Yu-Ling Liao, Yen-Hua Chang, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国家台湾大学计算机科学与信息工程系) Institute of Information Science, Academia Sinica, Taiwan(台湾学术院信息科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国家台湾大学人工智能研究中心(AINTU))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过BiasInEar数据集评估音频语言模型在语言、人口统计和位置变化中的敏感性,揭示语音放大结构性偏见的机制,并提出统一的公平性与稳健性评估框架。

Comments Accepted as a long findings paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07450 2026-02-03 cs.CV cs.CL 57%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00376 2026-02-03 cs.LG 57%

MATRIX: A Multimodal Benchmark and Post-Training Framework for Materials Science

MATRIX: 一种用于材料科学的多模态基准和后训练框架

Delia McGrath, Curtis Chong, Rohil Kulkarni, Gerbrand Ceder, Adeesh Kolluru

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。

Comments 17 pages, 9 Figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00292 2026-02-03 cs.CV cs.AI 57%

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

LogicGaze:通过反事实验证基准测试视觉叙事中的因果一致性

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis

机构 * Boston University(波士顿大学) Suffolk University(索尔福德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LogicGaze通过反事实验证基准测试,评估视觉语言模型在视觉叙事中因果一致性验证的能力,揭示了现有模型在处理因果链和幻觉问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00026 2026-02-03 cs.CY cs.AI 57%

Strategies for Creating Uncertainty in the AI Era to Trigger Students Critical Thinking: Pedagogical Design, Assessment Rubric, and Exam System

人工智能时代创建不确定性的策略以激发学生批判性思维:教学设计、评估量规与考试系统

Ahmad Samer Wazan

机构 * Zayed University(泽耶德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过创建人工智能时代的不确定性情境,结合可控AI工具和批判性评估量规,激发学生批判性思维的教学方法与考试系统设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02457 2026-02-03 cs.CY 50%

MetaCLASS: Metacognitive Coaching for Learning with Adaptive Self-regulation Support

MetaCLASS:基于自适应自我调节支持的元认知辅导

Naiming Liu, Richard Baraniuk, Shashank Sonkar

专题命中 推理评测 :planning(abstract)

AI总结 MetaCLASS通过元认知辅导框架提升学习者自我调节能力,验证了传统教学模型在元认知任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01067 2026-02-03 cs.RO 50%

A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation

对大型行为模型在机器人操作中协同训练数据模态和策略的系统研究

Fanqi Lin, Kushal Arora, Jean Mercat, Haruki Nishimura, Paarth Shah, Chen Xu, Mengchao Zhang, Mark Zolotas, Maya Angeles, Owen Pfannenstiehl, Andrew Beaulieu, Jose Barreiros

机构 * Toyota Research Institute, Cambridge MA(丰田研究院) Tsinghua University, Beijing, China(清华大学)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文研究了机器人操作中协同训练不同数据模态和策略对行为模型性能的影响,发现视觉语言和跨身体数据显著提升泛化能力,而离散动作令牌无明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 50%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11708 2026-02-03 cs.SE 50%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07486 2026-02-03 cs.SE 50%

DISTINCT: A Description-Guided Branch-Consistency Analysis Framework for Non-Regressive Test Case Generation

DISTINCT: 一种基于描述的分支一致性分析框架用于非回归测试用例生成

Pengyu Xue, Yuxiang Zhang, Zhen Yang, Xiaoxue Ren, Xiang Li, Pengfei Hu, Linhao Wu, Kainan Li

专题命中 推理评测 :reasoning(abstract)

AI总结 DISTINCT通过基于描述的分支一致性分析框架,提升非回归测试生成的缺陷检测能力,实现更高的编译成功率和缺陷检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 30 篇

2506.16123 2026-02-03 cs.CL 89%

FinCoT: Grounding Chain-of-Thought in Expert Financial Reasoning

FinCoT:在专家金融推理中 grounding 思维链

Natapong Nitarach, Warit Sirichotedumrong, Panop Pitchayarthorn, Pittawat Taveekitworachai, Potsawee Manakul, Kunat Pipatanakul

机构 * SCB 10X, SCBX Group(SCB 10X集团)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 FinCoT通过整合专家金融推理蓝图,提升金融领域模型性能并减少推理成本,实现更可解释的推理过程。

Comments Accepted at FinNLP-2025, EMNLP (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00574 2026-02-03 cs.AI 89%

Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings

通过潜在嵌入学习模态混合的思考链推理

Yifei Shao, Kun Zhou, Ziming Xu, Mohammad Atif Quamar, Shibo Hao, Zhen Wang, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出模态混合CoT方法,通过潜在嵌入结合视觉与文本信息,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00173 2026-02-03 cs.LG cs.AI 84%

Learning Robust Reasoning through Guided Adversarial Self-Play

通过引导对抗自博弈学习鲁棒推理

Shuozhe Li, Vaishnav Tadiparthi, Kwonjoon Lee, Nakul Agarwal, Hossein Nourkhiz Mahjoub, Ehsan Moradi Pari, Lizhang Chen, Amy Zhang, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Honda Research Institute USA(本田美国研究院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 GASP通过引导对抗自博弈方法提升推理模型的鲁棒性,使其在面对误导和扰动上下文时保持稳定并提高准确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01523 2026-02-03 cs.LG cs.AI cs.CL 82%

A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning

一种用于大语言模型推理中可验证奖励的相对预算理论

Akifumi Wachi, Hirota Kinoshita, Shokichi Takakura, Rei Higuchi, Taiji Suzuki

机构 * LY Corporation(LY公司) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) University of Tokyo(东京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种相对预算理论,通过相对预算ξ=H/E[T]解释强化学习在大语言模型推理中的样本效率差异,并通过实验证明在ξ∈[1.5,2.0]时学习效率最高。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00085 2026-02-03 cs.LG cs.AI cs.CL 82%

CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models

CARE-RFT:基于置信度的强化微调用于大语言模型中的可靠推理

Shuozhe Li, Jincheng Cao, Bodun Hu, Aryan Mokhtari, Leqi Liu, Amy Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CARE-RFT通过引入置信度锚定的正则化方法,在保持大语言模型推理能力的同时提升其可信度和校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01795 2026-02-03 cs.CR cs.AI cs.LG 81%

RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse

RedVisor: 通过零拷贝KV缓存重用来实现推理感知的提示注入防御

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok-Yan Lam

机构 * Nanyang Technological University, Singapore(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RedVisor通过零拷贝KV缓存重用实现推理感知的提示注入防御,结合检测与预防策略,提升安全性和效率。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17587 2026-02-03 cs.CV cs.AI cs.LG 81%

HalluRNN: Mitigating Hallucinations via Recurrent Cross-Layer Reasoning in Large Vision-Language Models

HalluRNN: 通过大规模视觉-语言模型中的递归跨层推理缓解幻觉

Le Yu, Kaishen Wang, Jianlong Xiong, Yue Cao, Lei Zhang, Zhang Yi Tao He

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 HalluRNN通过递归跨层推理模块缓解大规模视觉-语言模型中的幻觉问题,提升模型稳定性和性能。

Comments 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏