arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-09 至 2026-02-09 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 19 篇

2505.18759 2026-02-09 cs.AI cs.LG 90%

The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation

高效推理的追寻:一个数据导向的基准以评估CoT蒸馏

Ruichen Zhang, Rana Muhammad Shahroz Khan, Zhen Tan, Dawei Li, Song Wang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DC-CoT基准,通过数据导向方法评估CoT蒸馏中的数据操作,以优化推理模型的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06319 2026-02-09 cs.AI 79%

Exposing Weaknesses of Large Reasoning Models through Graph Algorithm Problems

通过图算法问题揭示大推理模型的弱点

Qifan Zhang, Jianhao Ruan, Aochuan Chen, Kang Zeng, Nuo Chen, Jing Tang, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GrAlgoBench通过图算法问题揭示大推理模型在长上下文推理和过度思考方面的不足,为改进推理研究提供严格测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06751 2026-02-09 cs.CR cs.SE 78%

Beyond Function-Level Analysis: Context-Aware Reasoning for Inter-Procedural Vulnerability Detection

超越函数级分析:面向跨过程的漏洞检测上下文感知推理

Yikun Li, Ting Zhang, Jieke Shi, Chengran Yang, Junda He, Xin Zhou, Jinfeng Jiang, Huihui Huang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CPRVul通过结合上下文剖析与结构化推理,提升跨过程漏洞检测的准确性,其在多个数据集上均优于传统函数级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06446 2026-02-09 cs.CL cs.AI cs.LG 67%

CORE: Comprehensive Ontological Relation Evaluation for Large Language Models

CORE:面向大语言模型的全面本体关系评估

Satyam Dwivedi, Sanjukta Ghosh, Shivam Dwivedi, Nishi Kumari, Anil Thakur, Anurag Purushottam, Deepak Alok, Praveen Gatla, Manjuprasad B, Bipasha Patgiri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12014 2026-02-09 cs.CL cs.AI cs.LG cs.SE 67%

code_transformed: The Influence of Large Language Models on Code

code_transformed: 大型语言模型对代码的影响

Yuliang Xu, Siming Huang, Mingmeng Geng, Yao Wan, Xuanhua Shi, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) École normale supérieure - Université PSL(巴黎高等师范学院-巴黎大学) Laboratoire LATTICE(LATTICE实验室) International School for Advanced Studies (SISSA)(国际先进研究学院(SISSA))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型对代码风格的影响,通过分析GitHub仓库中的代码,发现命名规范、复杂性等指标的变化,揭示LLMs对现实编程实践的深远影响。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13707 2026-02-09 cs.AI cs.CL 62%

OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation

OpenDeception: 通过多智能体模拟学习人类-人工智能交互中的欺骗与信任

Yichen Wu, Qianqian Gao, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OpenDeception通过多智能体模拟评估人类-人工智能交互中的欺骗与信任风险,利用场景基准、意图网络和信任网络,识别高风险对话并提前预警。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08010 2026-02-09 cs.CL cs.AI 62%

ExpressivityBench: Can LLMs Communicate Implicitly?

ExpressivityBench: LLMs能否隐式沟通?

Joshua Tint, Som Sagar, Aditya Taparia, Kelly Raines, Bimsara Pathiraja, Caleb Liu, Ransalu Senanayake

机构 * Amazon(亚马逊公司) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ExpressivityBench通过信息理论模型评估LLM隐式沟通能力,发现其在情感表达上表现良好,但在社会语言学信号上不如人类。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06443 2026-02-09 cs.CR cs.AI 57%

TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents

TrajAD:用于可信大语言模型代理的轨迹异常检测

Yibing Liu, Chong Zhang, Zhongyi Han, Hansong Liu, Yong Wang, Yang Yu, Xiaoyan Wang, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Sonli Holding Group Co., Ltd.(山东利集团有限公司) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司) Information Technology Service Center of People’s Court(人民法院信息技术服务中心)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 TrajAD通过细粒度过程监督训练的专用验证器,解决大语言模型代理轨迹异常检测问题,提升过程可靠性。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06370 2026-02-09 cs.CL 57%

Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production

面向成本的模型选择用于文本分类:在生产环境中细调编码器与LLM提示之间的多目标权衡

Alberto Andres Valdes Gonzalez

机构 * Pontifical Catholic University of Chile(天主教智利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在生产环境中细调编码器与LLM提示之间的多目标权衡,发现微调编码器在成本和性能上优于LLM提示。

Comments 26 pages, 12 figures. Empirical benchmark comparing fine-tuned encoders and LLM prompting for text classification under cost and latency constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05512 2026-02-09 cs.CL cs.IR 57%

A Human-in-the-Loop, LLM-Centered Architecture for Knowledge-Graph Question Answering

面向知识图谱问答的人机协同、大语言模型中心架构

Larissa Pusch, Alexandre Courtiol, Tim Conrad

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种人机协同的大语言模型中心架构,用于知识图谱问答,通过生成Cypher查询并让用户逐步优化,提升复杂数据集的可访问性并保持事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05424 2026-02-09 cs.AI 57%

THOR: Inductive Link Prediction over Hyper-Relational Knowledge Graphs

THOR:基于超关系知识图谱的归纳链接预测

Weijian Yu, Yuhuan Lu, Dingqi Yang

机构 * University of Macau(澳门大学) Khalifa University(哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 THOR提出了一种针对超关系知识图谱的归纳链接预测方法,通过基础图建模和Transformer解码器提升预测性能,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05386 2026-02-09 cs.CR cs.AI 57%

Spider-Sense: Intrinsic Risk Sensing for Efficient Agent Defense with Hierarchical Adaptive Screening

Spider-Sense: 基于内在风险感知的高效代理防御方法与分层自适应筛查

Zhenxiong Yu, Zhi Yang, Zhiheng Jin, Shuhe Wang, Heng Zhang, Yanlin Fei, Lingfeng Zeng, Fangqi Lou, Shuo Zhang, Tu Hu, Jingping Liu, Rongze Chen, Xingyu Zhu, Kunyi Wang, Chaofa Yuan, Xin Guo, Zhaowei Liu, Feipeng Zhang, Jie Huang, Huacan Wang, Ronghao Chen, Liwen Zhang

机构 * SUFE(上海财经大学) NUS(新加坡国立大学) QuantaAlpha(量子阿尔法) CMU(卡内基梅隆大学) SYSU(南方科技大学) USTC(中国科学技术大学) XJTU(西安交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Spider-Sense通过内在风险感知实现高效代理防御,结合分层自适应筛查机制,有效降低攻击成功率和误报率,仅引入微小延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02075 2026-02-09 cs.CE cs.LG 57%

MDAgent2: Large Language Model for Code Generation and Knowledge Q&A in Molecular Dynamics

MDAgent2:用于分子动力学中代码生成和知识问答的大型语言模型

Zhuofan Shi, Hubao A, Yufei Shao, Dongliang Huang, Hongxu An, Chunxiao Xin, Haiyang Shen, Zhenyu Wang, Yunshan Na, Gang Huang, Xiang Jing

机构 * Peking University(北京大学) National Key Laboratory of Data Space Technology and System(国家数据空间技术与系统重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Liaoning Technical University(辽宁技术大学) Wenjing Future Lab (Beijing) Technology Co., Ltd(文景未来实验室(北京)科技有限公司)

专题命中 推理评测 :self-correction(abstract);分类 cs.LG

AI总结 MDAgent2是首个能同时进行分子动力学知识问答和代码生成的端到端框架,通过领域特定数据集和强化学习方法提升性能。

Comments 24 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16975 2026-02-09 cs.SE cs.CL 57%

SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development

SWE-Dev:评估和训练自主的基于特征驱动的软件开发

Yaxin Du, Yuzhu Cai, Yifan Zhou, Cheng Wang, Yu Qian, Xianghe Pang, Qian Liu, Yue Hu, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 SWE-Dev是一个大规模数据集,用于评估和训练自主编码系统在特征驱动软件开发中的能力,通过提供可运行环境和单元测试提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21112 2026-02-09 cs.AI cs.SE 57%

How does information access affect LLM monitors' ability to detect sabotage?

信息访问如何影响大语言模型监视器检测破坏行为的能力?

Rauno Arike, Raja Mehta Moreno, Rohan Subramani, Shubhorup Biswas, Francis Rhys Ward

机构 * Aether Research(Aether研究机构) Vector Institute(Vector研究所) Trajectory Labs(Trajectory实验室) University of Toronto(多伦多大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了信息访问对大语言模型监视器检测破坏行为的影响,提出了一种新的分层监控方法EaE,通过提取和评估被监视代理的轨迹片段来提升检测效果。

Comments 54 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-02-09 cs.SE cs.LG 57%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Mononito Goswami, Jiajun Cao, Shihab Rashid, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05885 2026-02-09 cs.IR cs.AI 57%

An item is worth one token in Multimodal Large Language Models-based Sequential Recommendation

在基于多模态大语言模型的序列推荐中,一个项目相当于一个标记

Qiyong Zhong, Jiajie Su, Ming Yang, Yunshan Ma, Xiaolin Zheng, Chaochao Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡国立管理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Speeder通过多模态表示压缩、模态感知渐进优化和序列位置感知增强,提升多模态大语言模型在序列推荐中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06914 2026-02-09 cs.CV 50%

Seeing Beyond Redundancy: Task Complexity's Role in Vision Token Specialization in VLLMs

超越冗余:任务复杂性在视觉令牌专业化中的作用

Darryl Hannan, John Cooper, Dylan White, Yijing Watkins

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探讨了任务复杂性对VLLMs视觉令牌专业化的影响,发现高复杂度视觉数据对提升模型在复杂视觉任务上的性能至关重要。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06714 2026-02-09 cs.HC 50%

PrefIx: Understand and Adapt to User Preference in Human-Agent Interaction

PrefIx: 在人机交互中理解并适应用户偏好

Jialin Li, Zhenhao Chen, Hanjun Luo, Hanan Salam

专题命中 推理评测 :reasoning(abstract)

AI总结 PrefIx通过交互作为工具范式,评估智能体在人机交互中的偏好适应能力,提升用户体验和偏好对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏