arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-28 至 2026-01-28 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 20 篇

2510.11027 2026-01-28 cs.CV 82%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18984 2026-01-28 cs.LG cs.CL 81%

Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning

保存好的前缀:通过过程监督强化学习实现精确误差惩罚以增强大语言模型推理

Haolin Liu, Dian Yu, Sidi Lu, Yujun Zhou, Rui Liu, Zhenwen Liang, Haitao Mi, Chen-Yu Wei, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Virginia(弗吉尼亚大学) University of Notre Dame(圣母大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过过程监督强化学习实现精确误差惩罚,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15600 2026-01-28 cs.AI cs.CL 81%

Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism

通过结构化组件奖励机制解锁生物实验协议生成中的科学推理

Haoran Sun, Yankai Jiang, Zhenyu Tang, Yaning Pan, Shuang Gu, Zekai Lin, Lilong Wang, Wenjie Lou, Lei Liu, Lei Bai, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过结构化组件奖励机制,Thoth在多个基准测试中超越了现有LLMs,实现了更准确的生物实验协议生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19773 2026-01-28 cs.CL 79%

Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive Diagnosis

强推理并不足够:评估交互诊断中的证据获取

Zhuohan Long, Zhijie Bao, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出REFINE策略,通过诊断验证引导代理主动解决不确定性,提升交互诊断中证据获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19673 2026-01-28 cs.SD cs.AI 79%

A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models

多模态大语言模型音频推理能力的基准测试

Iwona Christop, Mateusz Czyżnikiewicz, Paweł Skórzewski, Łukasz Bondaruk, Jakub Kubiak, Marcin Lewandowski, Marek Kubis

机构 * Adam Mickiewicz University(亚当·密克维茨大学) Samsung R&D Institute Poland(三星波兰研发中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Audio Reasoning Tasks基准测试,用于评估多模态模型在结合不同音频任务进行推理方面的能力。

Comments 31 pages, 2 figures, accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02091 2026-01-28 cs.AI 79%

Demystifying the Roles of LLM Layers in Retrieval, Knowledge, and Reasoning

解析大语言模型中层的作用:检索、知识与推理

Xinyuan Song, Keyu Wang, PengXiang Li, Lu Yin, Shiwei Liu

机构 * Emory University(埃默里大学) University of Tuebingen(图宾根大学) University of Surrey(萨里大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究解析了大语言模型中不同深度层在检索、知识和推理中的作用,发现浅层主导知识和检索,深层影响推理,且不同评估方法下深度利用存在显著差异。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19540 2026-01-28 cs.HC 78%

"Do I Trust the AI?" Towards Trustworthy AI-Assisted Diagnosis: Understanding User Perception in LLM-Supported Reasoning

我是否信任AI?:迈向可信的AI辅助诊断:理解用户在LLM支持推理中的感知

Yuansong Xu, Yichao Zhu, Haokai Wang, Yuchen Wu, Yang Ouyang, Hanlu Li, Wenzhe Zhou, Xinyu Liu, Chang Jiang, Quan Li

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文研究医生对LLM临床推理能力的感知,通过实验揭示医生对LLM诊断能力的评估,并探讨提升医生与LLM协作可信度的方法。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI'26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19306 2026-01-28 cs.AI 70%

Curiosity Driven Knowledge Retrieval for Mobile Agents

基于好奇心的知识检索用于移动代理

Sijia Li, Xiaoyu Tan, Shahir Ali, Niels Schmidt, Gengchen Ma, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出一种基于好奇心的知识检索框架,通过结构化AppCards提升移动代理在复杂任务中的规划可靠性与执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19514 2026-01-28 cs.CL cs.AI cs.LG 67%

SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback

SIPDO:通过合成数据反馈实现闭环提示优化

Yaoning Yu, Ye Yu, Peiyan Zhang, Kai Wei, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) University of South Florida(佛罗里达州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SIPDO通过合成数据反馈闭环优化提示,提升提示性能并优于传统提示微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17912 2026-01-28 cs.LG cs.AI 62%

Causal Pre-training Under the Fairness Lens: An Empirical Study of TabPFN

从公平性视角看因果预训练:对TabPFN的实证研究

Qinyi Liu, Mohammad Khalil, Naman Goel

机构 * University of Bergen Centre for the Science of Learning \& Technology (SLATE) Bergen Norway Department of Computer Science University of Oxford Alan Turing Institute Oxford United Kingdom University of Bergen University of Oxford Alan Turing Institute

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究从公平性角度评估了TabPFN的因果预训练效果,发现其在预测准确性上表现优异,但在公平性改进方面存在局限,特别是在面对缺失-不在随机协变量偏移时。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09342 2026-01-28 cs.CL cs.AI 62%

Improving Implicit Hate Speech Detection via a Community-Driven Multi-Agent Framework

通过社区驱动的多智能体框架改进隐式仇恨言论检测

Ewelina Gajewska, Katarzyna Budzynska, Jarosław A Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种社区驱动的多智能体框架,通过整合社会文化背景提升隐式仇恨言论检测的准确性和公平性。

Comments This paper has been accepted for the upcoming 18th International Conference on Agents and Artificial Intelligence (ICAART-2026), Marbella, Spain. The final published version will appear in the official conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-01-28 cs.CL cs.AI cs.IR 62%

LLM-Specific Utility: A New Perspective for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 57%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 57%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10246 2026-01-28 cs.CL 57%

coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts

coTherapist:一种行为对齐的小语言模型,用于支持心理健康专家

Prottay Kumar Adhikary, Reena Rawat, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 coTherapist通过小语言模型和领域微调等技术,为心理健康专家提供支持,展现出高同理心和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01509 2026-01-28 cs.CL 57%

PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation

PROPHET:一个基于因果干预似然估计的可推断未来预测基准

Zhengwei Tao, Pu Wu, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Chengfeng Dou, Xiancai Chen, Jia Li, Linyu Li, Chongyang Tao, Wentao Zhang

机构 * Peking University(北京大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18771 2026-01-28 cs.LG cs.SI 57%

Exploring Graph Learning Tasks with Pure LLMs: A Comprehensive Benchmark and Investigation

探索纯大语言模型在图学习任务中的应用:全面的基准测试与调查

Yuxiang Wang, Xinnan Dai, Wenqi Fan, Yao Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Michigan State University(密歇根州立大学) The Hong Kong Polytechnic University(香港理工大学) Rensselaer Polytechnic Institute(纽约理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究探讨纯大语言模型在图学习任务中的应用,通过全面的基准测试与分析,发现指令微调的LLMs在少样本设置中表现优异,具备强大的领域迁移能力和良好的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19239 2026-01-28 cs.SE 50%

LLM-based Vulnerability Detection at Project Scale: An Empirical Study

基于大语言模型的项目级漏洞检测:一项实证研究

Fengjie Li, Jiajun Jiang, Dongchi Chen, Yingfei Xiong

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了基于LLM的项目级漏洞检测方法,发现其在召回率低的情况下仍能发现更多漏洞,但存在高误报率和计算成本问题。

Comments 19 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19134 2026-01-28 cs.CR cs.SE 50%

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

在亚马逊前沿模型安全框架下评估Nova 2.0 Lite模型

Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

专题命中 推理评测 :reasoning(abstract)

AI总结 本文在亚马逊前沿模型安全框架下评估了Nova 2.0 Lite模型,分析其在高风险领域的安全性和性能表现。

Comments Arxiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏