arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2601.02075 2026-02-09 cs.CE cs.LG 57%

MDAgent2: Large Language Model for Code Generation and Knowledge Q&A in Molecular Dynamics

MDAgent2:用于分子动力学中代码生成和知识问答的大型语言模型

Zhuofan Shi, Hubao A, Yufei Shao, Dongliang Huang, Hongxu An, Chunxiao Xin, Haiyang Shen, Zhenyu Wang, Yunshan Na, Gang Huang, Xiang Jing

机构 * Peking University(北京大学) National Key Laboratory of Data Space Technology and System(国家数据空间技术与系统重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Liaoning Technical University(辽宁技术大学) Wenjing Future Lab (Beijing) Technology Co., Ltd(文景未来实验室(北京)科技有限公司)

专题命中 推理评测 :self-correction(abstract);分类 cs.LG

AI总结 MDAgent2是首个能同时进行分子动力学知识问答和代码生成的端到端框架,通过领域特定数据集和强化学习方法提升性能。

Comments 24 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16975 2026-02-09 cs.SE cs.CL 57%

SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development

SWE-Dev:评估和训练自主的基于特征驱动的软件开发

Yaxin Du, Yuzhu Cai, Yifan Zhou, Cheng Wang, Yu Qian, Xianghe Pang, Qian Liu, Yue Hu, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SWE-Dev是一个大规模数据集,用于评估和训练自主编码系统在特征驱动软件开发中的能力,通过提供可运行环境和单元测试提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21112 2026-02-09 cs.AI cs.SE 57%

How does information access affect LLM monitors' ability to detect sabotage?

信息访问如何影响大语言模型监视器检测破坏行为的能力?

Rauno Arike, Raja Mehta Moreno, Rohan Subramani, Shubhorup Biswas, Francis Rhys Ward

机构 * Aether Research(Aether研究机构) Vector Institute(Vector研究所) Trajectory Labs(Trajectory实验室) University of Toronto(多伦多大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了信息访问对大语言模型监视器检测破坏行为的影响,提出了一种新的分层监控方法EaE,通过提取和评估被监视代理的轨迹片段来提升检测效果。

Comments 54 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-02-09 cs.SE cs.LG 57%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Mononito Goswami, Jiajun Cao, Shihab Rashid, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05885 2026-02-09 cs.IR cs.AI 57%

An item is worth one token in Multimodal Large Language Models-based Sequential Recommendation

在基于多模态大语言模型的序列推荐中,一个项目相当于一个标记

Qiyong Zhong, Jiajie Su, Ming Yang, Yunshan Ma, Xiaolin Zheng, Chaochao Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡国立管理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Speeder通过多模态表示压缩、模态感知渐进优化和序列位置感知增强,提升多模态大语言模型在序列推荐中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05857 2026-02-06 cs.AI 57%

BABE: Biology Arena BEnchmark

BABE:生物学竞技场基准

Junting Zhou, Jin Chen, Linfeng Hao, Denghui Cao, Zheyu Wang, Qiguang Chen, Chaoyou Fu, Jiaze Chen, Yuchen Wu, Ge Zhang, Mingxuan Wang, Wenhao Huang, Tong Yang

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BABE基准通过评估生物AI系统的实验推理能力,解决现有生物学基准未能评估实验结果与上下文知识整合能力的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05249 2026-02-06 cs.AI 57%

Automatic Cognitive Task Generation for In-Situ Evaluation of Embodied Agents

为在场评估具身智能体而自动产生认知任务

Xinyi He, Ying Yang, Chuanjian Fu, Sihan Guo, Songchun Zhu, Lifeng Fan, Zhenliang Zhang, Yujia Peng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TEA系统,通过动态在场任务生成方法评估具身智能体在未见环境中的能力,揭示模型在基本感知和3D交互方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05110 2026-02-06 cs.AI 57%

Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment

理解大语言模型评估者行为:一种结构化多评估者框架用于商户风险评估

Liang Wang, Junpeng Wang, Chin-chia Michael Yeh, Yan Zheng, Jiarui Sun, Xiran Fan, Xin Dai, Yujie Fan, Yiwei Cai

机构 * Visa Research(Visa研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结构化多评估者框架,用于评估LLM在商户风险评估中的推理质量,揭示了不同模型的自我评估偏见差异,并通过真实数据验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04604 2026-02-05 cs.CL 57%

Beyond Holistic Scores: Automatic Trait-Based Quality Scoring of Argumentative Essays

超越整体评分:自动基于特质的质量评分论说作文

Lucile Favero, Juan Antonio Pérez-Ortiz, Tanja Käser, Nuria Oliver

机构 * ELLIS Alicante(埃利斯阿尔瓦雷斯) Universitat d'Alacant(阿尔瓦雷斯大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于特征的自动论说作文评分方法,通过两种建模范式提升评分准确性,并展示小型LLM在无需微调下的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 57%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03873 2026-02-05 cs.SD cs.AI eess.AS 57%

Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models

通过测试时间缩放解码模糊情绪在音频-语言模型中

Hong Jia, Weibin Li, Jingyao Wu, Xiaofeng Yu, Yan Gao, Jintao Cheng, Xiaoyu Tang, Feng Xia, Ting Dang

机构 * University of Melbourne(墨尔本大学) University of Auckland(奥克兰大学) South China Normal University(华南师范大学) MIT(麻省理工学院) University of Cambridge(剑桥大学) RMIT(皇家墨尔本理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个基于测试时间缩放的音频语言模型模糊情绪识别基准,系统比较了八种ALMs和五种TTS策略,揭示了模型容量与情感模糊性之间的交互挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21826 2026-02-05 cs.CL 57%

ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models

ResT: 重塑令牌级策略梯度以适应工具使用大型语言模型

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Guojun Yin, Wei Lin, Ran He

机构 * CRIPAC, Institute of Automation(CRIPAC,自动化研究所) Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ResT通过熵引导的令牌重新加权优化工具使用任务的策略梯度,提升训练稳定性与效率,实现优于现有方法的性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03709 2026-02-04 cs.CL 57%

No Shortcuts to Culture: Indonesian Multi-hop Question Answering for Complex Cultural Understanding

没有捷径的文化:印尼多跳问答用于复杂文化理解

Vynska Amalia Permadi, Xingwei Tan, Nafise Sadat Moosavi, Nikos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ID-MoCQA是一个基于印尼传统的多跳问答数据集,旨在评估大型语言模型的文化理解能力,揭示模型在文化推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03587 2026-02-04 cs.CL 57%

CL-bench: A Benchmark for Context Learning

CL-bench: 一个用于上下文学习的基准测试

Shihan Dou, Ming Zhang, Zhangyue Yin, Chenhao Huang, Yujiong Shen, Junzhe Wang, Jiayi Chen, Yuchen Ni, Junjie Ye, Cheng Zhang, Huaibing Xie, Jianglu Hu, Shaolei Wang, Weichao Wang, Yanling Xiao, Yiting Liu, Zenan Xu, Zhen Guo, Pluto Zhou, Tao Gui, Zuxuan Wu, Xipeng Qiu, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Di Wang, Shunyu Yao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CL-bench是一个用于评估上下文学习能力的基准测试,通过复杂任务和上下文设计,揭示当前语言模型在真实任务中的学习瓶颈。

Comments 78 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21551 2026-02-04 cs.LG 57%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03134 2026-02-04 cs.CV cs.AI 57%

SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass

SwiftVLM: 通过跨层令牌绕过实现高效的视觉-语言模型推理

Chen Qian, Xinran Yu, Danyang Li, Guoxuan Chi, Zheng Yang, Qiang Ma, Xin Miao

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SwiftVLM通过跨层令牌绕过方法,在视觉-语言模型中实现高效的推理,优于现有修剪策略,提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03128 2026-02-04 cs.AI 57%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02601 2026-02-04 cs.SI cs.AI 57%

CaST: Causal Discovery via Spatio-Temporal Graphs in Disaster Tweets

基于灾难推文的时空图因果发现:CaST

Hieu Duong, Eugene Levin, Todd Gary, Long Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CaST通过整合语义、时空信息,利用大规模语言模型构建事件图,实现灾难推文中更稳健和可解释的因果发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02537 2026-02-04 cs.CV cs.LG 57%

WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models

WorldVQA:评估多模态大语言模型的原子视觉世界知识

Runjie Zhou, Youbo Shao, Haoyu Lu, Bowei Xing, Tongtong Bai, Yujie Chen, Jie Zhao, Lin Sui, Haotian Yao, Zijia Zhao, Hao Yang, Haoning Wu, Zaida Zhou, Jinguo Zhu, Zhiqi Huang, Yiping Bao, Yangyang Liu, Y. Charles, Xinyu Zhou

机构 * Moonshot AI

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02196 2026-02-04 cs.AI 57%

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进

Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin

机构 * Xi’an Jiaotong University(西安交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。

Comments 29pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00748 2026-02-04 cs.DC cs.AI cs.AR 57%

HyperOffload: Graph-Driven Hierarchical Memory Management for Large Language Models on SuperNode Architectures

HyperOffload: 图驱动的分层内存管理用于超节点架构上的大型语言模型

Fangxin Liu, Qinghua Zhang, Hanjing Shen, Zhibo Liang, Li Jiang, Haibing Guan, Chong Bao, Xuefeng Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HyperOffload通过图驱动的编译器方法优化超节点架构上的LLM内存管理,减少峰值内存使用并提升计算效率。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11361 2026-02-04 cs.AI 57%

MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization

MAPGD:多智能体提示梯度下降用于协作提示优化

Yichen Han, Yuhang Han, Siteng Huang, Guanyu Liu, Zhengpeng Zhou, Bojun Liu, Yujia Zhang, Isaac N Shi, Lewei He, Tianyu Shi

机构 * South China Normal University(华南师范大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Macau(澳门大学) University of Sydney(悉尼大学) Silicon Sapiens LLC University of Alberta(阿尔伯塔大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MAPGD通过多智能体协作机制提升提示优化的鲁棒性和效率,结合梯度融合与动态加权实现高效且可解释的优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02360 2026-02-03 cs.CL 57%

Automated Multiple Mini Interview (MMI) Scoring

自动化多轮面试(MMI)评分

Ryan Huynh, Frank Guerin, Alison Callwood

机构 * University of Surrey(萨里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多智能体提示框架,通过转录优化和标准特定评分提升MMI评分的准确性和可靠性,优于传统微调方法。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02079 2026-02-03 cs.LG cs.SE 57%

AICD Bench: A Challenging Benchmark for AI-Generated Code Detection

AICD Bench: 一个用于AI生成代码检测的挑战性基准

Daniil Orel, Dilshod Azizov, Indraneil Paul, Yuxia Wang, Iryna Gurevych, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎伊德大学人工智能学院) Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science, TU Darmstadt(计算机科学系,图恩大学) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 AICD Bench提出一个全面的AI生成代码检测基准,包含200万例、77个模型及9种编程语言,通过三个现实任务评估检测性能,推动更鲁棒的检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07477 2026-02-03 cs.AI 57%

JudgeFlow: Agentic Workflow Optimization via Block Judge

JudgeFlow: 通过块判断实现代理工作流优化

Zihan Ma, Zhikai Zhao, Chuanbo Hua, Federico Berto, Jinkyoo Park

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 JudgeFlow通过引入可配置的逻辑块和专用判断模块,实现代理工作流的高效优化,提升样本效率和可解释性,并在数学推理和代码生成任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09556 2026-02-03 cs.CL 57%

WUGNECTIVES: Novel Entity Inferences of Language Models from Discourse Connectives

WUGNECTIVES: 语言模型中 discourse connectives 对 novel entities 的新颖实体推断

Daniel Brubaker, William Sheffield, Junyi Jessy Li, Kanishka Misra

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 WUGNECTIVES研究语言模型如何通过语篇连接词推断新颖实体,发现调优模型能提升多数连接词的性能,但让步意义连接词表现不佳。

Comments 19 pages total, 10 pages main; 8 figures total, 5 figures main; 10 tables total, 4 tables main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13811 2026-02-03 cs.LG 57%

Context-Free Synthetic Data Mitigates Forgetting

无上下文合成数据缓解遗忘

Parikshit Bansal, Sujay Sanghavi

机构 * Parikshit Bansal(独立研究者) Sujay Sanghavi(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 通过无上下文生成缓解语言模型微调中的遗忘问题,保持零样本和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09382 2026-02-03 cs.IR cs.AI 57%

Towards Next-Generation Recommender Systems: A Benchmark for Personalized Recommendation Assistant with LLMs

迈向下一代推荐系统:一种用于基于LLM的个性化推荐助手的基准测试

Jiani Huang, Shijie Wang, Liang-bo Ning, Wenqi Fan, Shuaiqiang Wang, Dawei Yin, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RecBench+数据集,用于评估LLM在复杂用户推荐任务中的能力,揭示LLM在处理条件查询时的优势及推理挑战。

Comments Accepted for publication at WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01276 2026-02-03 cs.AI 57%

LLM-Driven Ontology Construction for Enterprise Knowledge Graphs

基于大语言模型的企业知识图谱本体构建

Abdulsobur Oyewale, Tommaso Soru

机构 * Liber AI Research(Liber AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OntoEKG,利用大语言模型自动构建企业知识图谱的领域本体,通过提取和蕴含模块提升效率,但在范围定义和层次推理方面仍有挑战。

Comments 20th International Conference on Semantic Computing (ICSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01239 2026-02-03 cs.CL cs.IR 57%

Inferential Question Answering

推断性问答

Jamshid Mozafari, Hamed Zamani, Guido Zuccon, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出推断性QA任务,通过构建QUIT数据集,发现传统QA方法在推断任务中表现不佳,揭示当前QA流程难以处理基于推断的推理。

Comments Proceedings of the ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏