arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-05 至 2026-02-05 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2602.04112 2026-02-05 cs.CL 79%

DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling

DELTA: 基于强化学习的多智能体推理用于多模态心理辅导

Jiangnan Yang, Junjie Chen, Fei Wang, Yiqi Nie, Yuxin Liu, Zhangling Duan, Jie Chen

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DELTA 通过强化学习和多智能体推理提升多模态心理辅导的质量与情感契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04033 2026-02-05 cs.CL cs.AI cs.CY 73%

On the Credibility of Evaluating LLMs using Survey Questions

关于通过调查问题评估LLM可信度的研究

Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。

Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 70%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20645 2026-02-05 cs.CL cs.AI cs.LG 67%

Anticipatory Evaluation of Language Models

语言模型的前瞻性评估

Jungsoo Park, Ethan Mendes, Gabriel Stanovsky, Alan Ritter

机构 * Georgia Institute of Technology, Atlanta, Georgia(佐治亚理工学院) The Hebrew University of Jerusalem, Jerusalem, Israel(耶路撒冷希伯来大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过任务描述和实验配置预测语言模型性能,构建PRECOG语料库并展示推理模型在高置信度阈值下的预测能力。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 62%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11655 2026-02-05 cs.CL cs.AI 62%

Explainable Sentiment Analysis with DeepSeek-R1: Performance, Efficiency, and Few-Shot Learning

基于DeepSeek-R1的可解释情感分析:性能、效率与少样本学习

Donghao Huang, Zhaoxia Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于DeepSeek-R1的可解释情感分析方法,展示了其在性能、效率和少样本学习方面的优势,证明其在情感分析任务中的高效与可解释性。

Comments 10 pages, with 2 figures and 6 tables, accepted for publication in an IEEE Intelligent Systems journal

Journal ref IEEE Intelligent Systems, vol. 40, no. 6, pp. 52-63, Nov.-Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04604 2026-02-05 cs.CL 57%

Beyond Holistic Scores: Automatic Trait-Based Quality Scoring of Argumentative Essays

超越整体评分:自动基于特质的质量评分论说作文

Lucile Favero, Juan Antonio Pérez-Ortiz, Tanja Käser, Nuria Oliver

机构 * ELLIS Alicante(埃利斯阿尔瓦雷斯) Universitat d'Alacant(阿尔瓦雷斯大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于特征的自动论说作文评分方法,通过两种建模范式提升评分准确性,并展示小型LLM在无需微调下的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 57%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03873 2026-02-05 cs.SD cs.AI eess.AS 57%

Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models

通过测试时间缩放解码模糊情绪在音频-语言模型中

Hong Jia, Weibin Li, Jingyao Wu, Xiaofeng Yu, Yan Gao, Jintao Cheng, Xiaoyu Tang, Feng Xia, Ting Dang

机构 * University of Melbourne(墨尔本大学) University of Auckland(奥克兰大学) South China Normal University(华南师范大学) MIT(麻省理工学院) University of Cambridge(剑桥大学) RMIT(皇家墨尔本理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个基于测试时间缩放的音频语言模型模糊情绪识别基准,系统比较了八种ALMs和五种TTS策略,揭示了模型容量与情感模糊性之间的交互挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21826 2026-02-05 cs.CL 57%

ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models

ResT: 重塑令牌级策略梯度以适应工具使用大型语言模型

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Guojun Yin, Wei Lin, Ran He

机构 * CRIPAC, Institute of Automation(CRIPAC,自动化研究所) Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ResT通过熵引导的令牌重新加权优化工具使用任务的策略梯度,提升训练稳定性与效率,实现优于现有方法的性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 50%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04535 2026-02-05 cs.SD 50%

HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing

HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型

Xuenan Xu, Yiming Ren, Liwei Liu, Wen Wu, Baoxiang Li, Chaochao Lu, Shuai Wang, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04278 2026-02-05 cs.IR 50%

MiniRec: Data-Efficient Reinforcement Learning for LLM-based Recommendation

MiniRec: 用于基于大语言模型推荐系统的高效强化学习

Lin Wang, Yang Zhang, Jingfan Chen, Xiaoyan Zhao, Fengbin Zhu, Qing Li, Tat-Seng Chua

专题命中 推理评测 :reasoning(abstract)

AI总结 MiniRec通过奖励对齐和轨迹导向的数据选择方法,有效降低基于LLM的推荐系统训练成本,同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 16 篇

2506.15732 2026-02-05 cs.AI cs.LG 81%

Can LLMs Reconcile Knowledge Conflicts in Counterfactual Reasoning

大语言模型能否在反事实推理中调和知识冲突

Khurram Yamin, Gaurav Ghosal, Bryan Wilder

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了大语言模型在反事实推理中整合参数知识的能力,发现其普遍挣扎并存在知识退化问题。

Comments ICML 2025 Workshop on Scaling up Intervention Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04640 2026-02-05 cs.SE cs.AI 79%

Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents

面向结构化、状态感知和执行导向的软件工程代理推理

Tse-Hsun, Chen

机构 * Concordia University(康科德大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出通过结构化、状态感知和执行导向的推理方法,提升软件工程代理在长周期任务中的推理能力和可靠性。

Comments Position paper accepted in BoatSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17923 2026-02-05 cs.CL 79%

Language models can learn implicit multi-hop reasoning, but only if they have lots of training data

语言模型可以学习隐式多跳推理,但只有在有大量训练数据的情况下

Yuekun Yao, Yupei Du, Dawei Zhu, Michael Hahn, Alexander Koller

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了语言模型通过大量训练数据学习隐式多跳推理的能力,并发现训练数据量随推理跳数呈指数增长,但通过课程学习可部分缓解这一需求。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04690 2026-02-05 cs.IR 78%

Multi-Source Retrieval and Reasoning for Legal Sentencing Prediction

多源检索与推理用于法律判决预测

Junjie Chen, Haitao Li, Qilei Zhang, Zhenghua Li, Ya Zhang, Quan Zhou, Cheng Luo, Yiqun Liu, Dongsheng Guo, Qingyao Ai

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出MSR²框架,通过多源检索与强化学习提升法律判决预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09100 2026-02-05 cs.LG cs.AI 62%

Towards Universal Neural Likelihood Inference

面向通用神经似然推断

Shreyas Bhat Brahmavar, Yang Li, Qiyang Liu, Shashank Srivastava, Junier Oliva

机构 * Department of Computer Science, University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(计算机科学系,北卡罗来纳大学教堂山分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通用神经似然推断框架ASPIRE,通过异构表格数据推理引擎实现跨领域零样本学习,提升预测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13697 2026-02-05 cs.LG cs.AI 62%

RL in Name Only? Analyzing the Structural Assumptions in RL post-training for LLMs

仅名义上的强化学习?分析在LLM中post-training强化学习的结构假设

Soumya Rani Samineni, Durgesh Kalwar, Karthik Valmeekam, Kaya Stechly, Subbarao Kambhampati

机构 * SCAI, Arizona State University(SCAI,亚利桑那州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了LLM post-training强化学习的结构假设,发现其退化为过滤迭代SFT,且激励生成更长的中间token序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04540 2026-02-05 cs.HC cs.CL 57%

PersoPilot: An Adaptive AI-Copilot for Transparent Contextualized Persona Classification and Personalized Response Generation

PersoPilot: 一种适应性AI助手用于透明的上下文化人格分类和个性化响应生成

Saleh Afzoon, Amin Beheshti, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 PersoPilot是一种集成人格理解和上下文分析的AI助手,通过透明可解释的界面实现个性化服务推荐和适应性个性化。

Comments Accepted for the Demo Track at the IEEE International Conference on Data Mining (ICDM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04118 2026-02-05 cs.LG 57%

Learning to Reason in 13 Parameters

在13个参数中学习推理

John X. Morris, Niloofar Mireshghallah, Mark Ibrahim, Saeed Mahloujifar

机构 * FAIR at Meta(Meta 的 FAIR) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 TinyLoRA通过仅训练13个参数实现高效推理学习,显著提升模型性能并降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03708 2026-02-05 cs.CL cs.PF 57%

Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States

超越标记:基于语义的推测解码用于通过探测内部状态实现高效的推理

Ximing Dong, Shaowei Wang, Dayi Lin, Boyuan Chen, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei, Canada(华为加拿大软件 excellence 中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 SemanticSpec通过探测模型内部状态,实现基于语义的高效推测解码,提升大型推理模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02164 2026-02-05 cs.LG cs.CR 57%

Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents

Co-RedTeam: 基于LLM代理的协同安全发现与利用

Pengfei He, Ash Fox, Lesly Miculicich, Stefan Friedli, Daniel Fabian, Burak Gokturk, Jiliang Tang, Chen-Yu Lee, Tomas Pfister, Long T. Le

机构 * Google(谷歌) Google Cloud AI Research(谷歌云人工智能研究) Michigan State University(密歇根州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 Co-RedTeam通过整合安全知识、代码分析和执行反馈,提升漏洞发现与利用的自动化水平,实现超过60%的漏洞利用成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07464 2026-02-05 cs.CV cs.AI 57%

DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO

DeepVideo-R1: 通过难度感知的回归GRPO实现视频强化微调

Jinyoung Park, Jeehye Na, Jinyoung Kim, Hyunwoo J. Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Korea University(韩国大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepVideo-R1通过回归GRPO和难度感知数据增强,提升视频大语言模型的推理能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04877 2026-02-05 cs.CV 50%

CoWTracker: Tracking by Warping instead of Correlation

CoWTracker: 通过形变而非相关性进行跟踪

Zihang Lai, Eldar Insafutdinov, Edgar Sucar, Andrea Vedaldi

专题命中 其他推理 :reasoning(abstract)

AI总结 CoWTracker通过形变替代相关性进行密集点跟踪,结合Transformer架构实现高效且高精度的跟踪与光流估计。

Comments Project website: cowtracker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04598 2026-02-05 cs.HC 50%

AI in Education Beyond Learning Outcomes: Cognition, Agency, Emotion, and Ethics

人工智能在教育中的应用超越学习成果:认知、自主性、情感与伦理

Lucile Favero, Juan Antonio Pérez-Ortiz, Tanja Käser, Nuria Oliver

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨了AI在教育中的社会影响,强调通过整合认知、自主性、情感和伦理维度,提出负责任的AI设计以支持学习并维护教育的社会目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04225 2026-02-05 cs.IR 50%

Following the TRAIL: Predicting and Explaining Tomorrow's Hits with a Fine-Tuned LLM

跟随TRAIL:利用微调LLM预测和解释明天的爆款

Yinan Zhang, Zhixi Chen, Jiazheng Jing, Zhiqi Shen

专题命中 其他推理 :reasoning(abstract)

AI总结 TRAIL通过微调LLM联合预测短期物品流行度并生成自然语言解释,提升推荐系统的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04072 2026-02-05 quant-ph 50%

Data Verification is the Future of Quantum Computing Copilots

数据验证是量子计算copilot的未来

Junhao Song, Ziqian Bi, Xinliang Chia, William Knottenbelt, Yudong Cao

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出数据验证在量子计算copilot和AI自动化中的重要性,强调验证作为架构基础的必要性,通过实验表明未验证的LLMs在电路优化中准确率仅为79%。

Comments 13 Pages, 20 Figures. Accepted to AAAI 2026 Workshop on AI4Research. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20276 2026-02-05 eess.SY cs.SY 50%

LLM-Driven Transient Stability Assessment: From Automated Simulation to Neural Architecture Design

基于大语言模型的暂态稳定评估:从自动化仿真到神经网络架构设计

Lianzhe Hu, Yu Wang, Bikash Pal

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出利用大语言模型驱动的神经网络设计流程,实现电力系统暂态稳定评估的自动化和智能化,提升准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏