arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-26 至 2026-01-26 共收录 51 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 12 篇

2601.16447 2026-01-26 cs.CL 77%

Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go

融合专家知识:将人类思维带回围棋游戏

Yichuan Ma, Linyang Li, Yongkang Chen, Peiji Li, Jiasheng Ye, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 LoGos通过融合围棋专家知识与通用推理能力,实现了在围棋领域的专业水平表现,展示了自然语言推理和战略决策能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16478 2026-01-26 cs.CL cs.AI 62%

DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering

DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理

Haotian Chen, Qingqing Long, Siyu Pu, Xiao Luo, Wei Ju, Meng Xiao, Yuanchun Zhou, Jianghua Zhao, Xuezhi Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16621 2026-01-26 cs.CL 57%

How Does Personalized Memory Shape LLM Behavior? Benchmarking Rational Preference Utilization in Personalized Assistants

个性化记忆如何塑造大语言模型行为?个性化助手中的理性偏好利用基准测试

Xueyang Feng, Weinan Gan, Xu Chen, Quanyu Dai, Yong Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出RPEval基准,通过分析个性化记忆对LLM行为的影响,引入RP-Reasoner方法,有效缓解非理性个性化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16466 2026-01-26 cs.CL 57%

Persona Jailbreaking in Large Language Models

大型语言模型中的身份劫持

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PHISH通过隐含引导历史的身份劫持框架,揭示LLM身份操控的新漏洞,实现对身份的可控操控。

Comments Accepted at EACL26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11003 2026-01-26 cs.SE cs.AI 57%

EmbedAgent: Benchmarking Large Language Models in Embedded System Development

EmbedAgent: 在嵌入式系统开发中评估大型语言模型

Ruiyang Xu, Jialun Cao, Mingyuan Wu, Wenliang Zhong, Yaojie Lu, Ben He, Xianpei Han, Shing-Chi Cheung, Le Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Peng Cheng Laboratory(鹏城实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EmbedAgent和Embedbench,用于评估LLMs在嵌入式系统开发中的能力,发现通用LLMs在特定任务中表现不佳,提出检索增强生成和编译器反馈策略以提升性能。

Comments 12 pages, accepted by International Conference on Software Engineering (ICSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09849 2026-01-26 cs.LG cs.HC 57%

A Survey on Human-Centered Evaluation of Explainable AI Methods in Clinical Decision Support Systems

可解释人工智能在临床决策支持系统中的人本评估综述

Alessandro Gambetti, Qiwei Han, Hong Shen, Claudia Soares

机构 * Nova School of Science and Technology, Universidade NOVA de Lisboa(诺瓦科学与技术学院,诺瓦里斯本大学) Nova School of Business and Economics, Universidade NOVA de Lisboa(诺瓦商学院与经济学院,诺瓦里斯本大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文综述了XAI在临床决策支持系统中的人本评估,指出多数研究采用事后方法,提出以利益相关者为中心的评估框架以提升XAI的临床可信度。

Comments 19 pages, 2 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16930 2026-01-26 cs.CY 50%

In Quest of an Extensible Multi-Level Harm Taxonomy for Adversarial AI: Heart of Security, Ethical Risk Scoring and Resilience Analytics

寻求可扩展的多级危害分类法以应对对抗性AI:安全的核心、道德风险评分与韧性分析

Javed I. Khan, Sharmila Rahman Prithula

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种可扩展的多级危害分类法,结合伦理理论,系统化地定义危害类型,以提升对抗性AI的安全性和伦理分析能力。

Comments Manuscript accepted for presentation at the 12th International Conference on Computational Science and Computational Intelligence (CSCI 2025), Las Vegas, NV, USA, December 2025. Proceedings to be published by Springer Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16699 2026-01-26 cs.SE 50%

Supporting Stakeholder Requirements Expression with LLM Revisions: An Empirical Evaluation

通过LLM修订支持利益相关者需求表达:一项实证评估

Michael Mircea, Emre Gevrek, Elisa Schmid, Kurt Schneider

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过实证研究展示LLM在辅助利益相关者表达需求方面的有效性,证明其能提升需求表达的完整性、清晰度和一致性。

Comments This paper has been accepted at the research track of the 32nd International Working Conference on Requirements Engineering: Foundation for Software Quality (REFSQ 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 50%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract)

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 12 篇

2601.16853 2026-01-26 cs.AI cs.CL 81%

Reasoning Promotes Robustness in Theory of Mind Tasks

推理促进理论思维任务的鲁棒性

Ian B. de Haan, Peter van der Putten, Max van Duijn

机构 * LIACS, Leiden University(莱顿大学人工智能与计算科学研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理导向的LLMs在理论思维任务中的鲁棒性,发现其在提示变化和任务扰动中表现更稳定,认为鲁棒性提升源于解决正确问题的能力增强而非新的推理形式。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16547 2026-01-26 cs.SD cs.AI eess.AS 79%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18261 2026-01-26 cs.IR cs.AI 79%

LLM Reasoning for Cold-Start Item Recommendation

基于大语言模型的冷启动物品推荐

Shijun Li, Yu Wang, Jin Wang, Ying Li, Joydeep Ghosh, Anne Cocos

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的推理能力,改进冷启动物品推荐,通过多种微调方法提升推荐性能,在Netflix数据上取得8%的提升。

Comments Published on Proceedings of the ACM on Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16458 2026-01-26 cs.SE cs.CR 78%

Bridging Expert Reasoning and LLM Detection: A Knowledge-Driven Framework for Malicious Packages

弥合专家推理与大语言模型检测:一种基于知识的恶意包检测框架

Wenbo Guo, Shiwen Song, Jiaxun Guo, Zhengzi Xu, Chengwei Liu, Haoran Ou, Mengmeng Ge, Yang Liu

专题命中 其他推理 :reasoning(title,abstract)

AI总结 IntelGuard通过整合专家推理与大语言模型,实现高准确率的恶意包检测,发现54个未报告恶意包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16506 2026-01-26 cs.CR cs.AI 74%

SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment

SafeThinker: 通过风险推理深化安全对齐

Xianya Fang, Xianying Luo, Yadong Wang, Xiang Chen, Yu Tian, Zequn Sun, Rui Liu, Jun Fang, Naiqiang Tan, Yuanning Cui, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Didi International Business Group(滴滴国际商务集团) Institute for AI, Tsinghua University(清华大学人工智能研究院) Nanjing University of Information Science & Technology(南京信息科学技术大学)

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 SafeThinker通过动态分配防御资源,有效提升模型对伪装攻击的防御能力,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09631 2026-01-26 cs.CL 70%

LLMs Got Rhythm? Hybrid Phonological Filtering for Greek Poetry Rhyme Detection and Generation

LLMs Got Rhythm? 希腊诗歌押韵检测与生成的混合语音过滤

Stergios Chatzikyriakidis, Anastasia Natsina

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出混合语音学算法与LLMs结合,解决希腊诗歌押韵检测与生成问题,通过验证循环提升性能至73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10004 2026-01-26 cs.AI cs.CL 62%

Exploring LLMs for Scientific Information Extraction Using The SciEx Framework

探索使用SciEx框架利用大语言模型进行科学信息提取

Sha Li, Ayush Sadekar, Nathan Self, Yiqi Su, Lars Andersland, Mira Chaplin, Annabel Zhang, Hyoju Yang, James B Henderson, Krista Wigginton, Linsey Marr, T. M. Murali, Naren Ramakrishnan

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciEx框架,通过解耦关键组件提升科学信息提取的准确性和一致性,评估结果显示其在多科学领域中的有效性。

Comments Accepted to the KGML Bridge at AAAI 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15892 2026-01-26 cs.CL 57%

Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model

Stable-DiffCoder:推动代码扩散大语言模型的前沿

Chenghao Fan, Wen Heng, Bo Li, Sichen Liu, Yuxuan Song, Jing Su, Xiaoye Qu, Kai Shen, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Stable-DiffCoder通过基于扩散的训练方法,在代码生成任务中超越了传统自回归模型,提升了代码建模的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12771 2026-01-26 cs.CL 57%

Who Does This Name Remind You of ? Nationality Prediction via Large Language Model Associative Memory

这个名字让你想起谁?通过大语言模型关联记忆进行国籍预测

Keito Inoshita

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LAMA通过利用大语言模型的关联记忆能力,有效提升国籍预测任务的准确性,其双代理架构在处理不同知识领域时表现出互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00364 2026-01-26 cs.CL 57%

The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining

混合语言文档在多语言大语言模型预训练中的作用

Jiandong Shao, Raphael Tang, Crystina Zhang, Karin Sevegnani, Pontus Stenetorp, Jianfei Yang, Yao Lu

机构 * University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) NVIDIA(英伟达) National Institute of Informatics(信息研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究发现平行数据对翻译性能至关重要,而语码转换数据对跨语言理解和推理影响较小。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18441 2026-01-26 cs.LO 50%

Expectation-based Analysis of Higher-Order Quantum Programs

基于期望的高阶量子程序分析

Martin Avanzini, Alejandro Díaz-Caro, Emmanuel Hainry, Romain Péchoux

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出了一种基于期望转换器的量子高阶程序分析方法,通过转换为非量子语言来研究量子程序的期望属性,如平均成本和事件概率,并展示了其在上界推理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏