arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-05 至 2026-02-05 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2602.03979 2026-02-05 cs.CL 87%

Likelihood-Based Reward Designs for General LLM Reasoning

基于似然的奖励设计用于通用大语言模型推理

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

机构 * Meta FAIR University of Amsterdam(阿姆斯特丹大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出基于对数概率的奖励设计,用于提升大语言模型在推理任务中的表现,尤其在可验证和不可验证场景中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03978 2026-02-05 cs.AI cs.LG 86%

Monitorability as a Free Gift: How RLVR Spontaneously Aligns Reasoning

监控性作为免费礼物:RLVR如何自发地对齐推理

Zidi Xiong, Shan Chen, Himabindu Lakkaraju

机构 * Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 RLVR通过增强响应分布和提示关注度自发提升推理透明性,但这种提升依赖于数据多样性与训练难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03516 2026-02-05 cs.LG cs.AI 84%

Not All Negative Samples Are Equal: LLMs Learn Better from Plausible Reasoning

并非所有负样本都平等:LLM通过合理推理学习更好

Zixiang Di, Jinyi Han, Shuo Zhang, Ying Liao, Zhi Li, Xiaofeng Ji, Yongqi Wang, Zheming Yang, Ming Gao, Bingdong Li, Jie Wang

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PNS方法,通过合成高质量负样本提升LLM推理能力,实验显示其在多个基准测试中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04649 2026-02-05 cs.CL 79%

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

结果准确性不够:对奖励模型推理过程的对齐

Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04112 2026-02-05 cs.CL 79%

DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling

DELTA: 基于强化学习的多智能体推理用于多模态心理辅导

Jiangnan Yang, Junjie Chen, Fei Wang, Yiqi Nie, Yuxin Liu, Zhangling Duan, Jie Chen

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DELTA 通过强化学习和多智能体推理提升多模态心理辅导的质量与情感契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04033 2026-02-05 cs.CL cs.AI cs.CY 73%

On the Credibility of Evaluating LLMs using Survey Questions

关于通过调查问题评估LLM可信度的研究

Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。

Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 70%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20645 2026-02-05 cs.CL cs.AI cs.LG 67%

Anticipatory Evaluation of Language Models

语言模型的前瞻性评估

Jungsoo Park, Ethan Mendes, Gabriel Stanovsky, Alan Ritter

机构 * Georgia Institute of Technology, Atlanta, Georgia(佐治亚理工学院) The Hebrew University of Jerusalem, Jerusalem, Israel(耶路撒冷希伯来大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过任务描述和实验配置预测语言模型性能,构建PRECOG语料库并展示推理模型在高置信度阈值下的预测能力。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 62%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11655 2026-02-05 cs.CL cs.AI 62%

Explainable Sentiment Analysis with DeepSeek-R1: Performance, Efficiency, and Few-Shot Learning

基于DeepSeek-R1的可解释情感分析:性能、效率与少样本学习

Donghao Huang, Zhaoxia Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于DeepSeek-R1的可解释情感分析方法,展示了其在性能、效率和少样本学习方面的优势,证明其在情感分析任务中的高效与可解释性。

Comments 10 pages, with 2 figures and 6 tables, accepted for publication in an IEEE Intelligent Systems journal

Journal ref IEEE Intelligent Systems, vol. 40, no. 6, pp. 52-63, Nov.-Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04604 2026-02-05 cs.CL 57%

Beyond Holistic Scores: Automatic Trait-Based Quality Scoring of Argumentative Essays

超越整体评分:自动基于特质的质量评分论说作文

Lucile Favero, Juan Antonio Pérez-Ortiz, Tanja Käser, Nuria Oliver

机构 * ELLIS Alicante(埃利斯阿尔瓦雷斯) Universitat d'Alacant(阿尔瓦雷斯大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于特征的自动论说作文评分方法,通过两种建模范式提升评分准确性,并展示小型LLM在无需微调下的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17729 2026-02-05 cs.AI 57%

M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark

M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准

Yang Zhou, Mingyu Zhao, Zhenting Wang, Difei Gu, Bangwei Guo, Ruosong Ye, Ligong Han, Can Jin, Dimitris N. Metaxas

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03873 2026-02-05 cs.SD cs.AI eess.AS 57%

Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models

通过测试时间缩放解码模糊情绪在音频-语言模型中

Hong Jia, Weibin Li, Jingyao Wu, Xiaofeng Yu, Yan Gao, Jintao Cheng, Xiaoyu Tang, Feng Xia, Ting Dang

机构 * University of Melbourne(墨尔本大学) University of Auckland(奥克兰大学) South China Normal University(华南师范大学) MIT(麻省理工学院) University of Cambridge(剑桥大学) RMIT(皇家墨尔本理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个基于测试时间缩放的音频语言模型模糊情绪识别基准,系统比较了八种ALMs和五种TTS策略,揭示了模型容量与情感模糊性之间的交互挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21826 2026-02-05 cs.CL 57%

ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models

ResT: 重塑令牌级策略梯度以适应工具使用大型语言模型

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Guojun Yin, Wei Lin, Ran He

机构 * CRIPAC, Institute of Automation(CRIPAC,自动化研究所) Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ResT通过熵引导的令牌重新加权优化工具使用任务的策略梯度,提升训练稳定性与效率,实现优于现有方法的性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 50%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04535 2026-02-05 cs.SD 50%

HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing

HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型

Xuenan Xu, Yiming Ren, Liwei Liu, Wen Wu, Baoxiang Li, Chaochao Lu, Shuai Wang, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04278 2026-02-05 cs.IR 50%

MiniRec: Data-Efficient Reinforcement Learning for LLM-based Recommendation

MiniRec: 用于基于大语言模型推荐系统的高效强化学习

Lin Wang, Yang Zhang, Jingfan Chen, Xiaoyan Zhao, Fengbin Zhu, Qing Li, Tat-Seng Chua

专题命中 推理评测 :reasoning(abstract)

AI总结 MiniRec通过奖励对齐和轨迹导向的数据选择方法,有效降低基于LLM的推荐系统训练成本,同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏