arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-26 至 2026-01-26 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 12 篇

2601.16853 2026-01-26 cs.AI cs.CL 81%

Reasoning Promotes Robustness in Theory of Mind Tasks

推理促进理论思维任务的鲁棒性

Ian B. de Haan, Peter van der Putten, Max van Duijn

机构 * LIACS, Leiden University(莱顿大学人工智能与计算科学研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理导向的LLMs在理论思维任务中的鲁棒性,发现其在提示变化和任务扰动中表现更稳定,认为鲁棒性提升源于解决正确问题的能力增强而非新的推理形式。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16547 2026-01-26 cs.SD cs.AI eess.AS 79%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18261 2026-01-26 cs.IR cs.AI 79%

LLM Reasoning for Cold-Start Item Recommendation

基于大语言模型的冷启动物品推荐

Shijun Li, Yu Wang, Jin Wang, Ying Li, Joydeep Ghosh, Anne Cocos

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的推理能力,改进冷启动物品推荐,通过多种微调方法提升推荐性能,在Netflix数据上取得8%的提升。

Comments Published on Proceedings of the ACM on Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16458 2026-01-26 cs.SE cs.CR 78%

Bridging Expert Reasoning and LLM Detection: A Knowledge-Driven Framework for Malicious Packages

弥合专家推理与大语言模型检测:一种基于知识的恶意包检测框架

Wenbo Guo, Shiwen Song, Jiaxun Guo, Zhengzi Xu, Chengwei Liu, Haoran Ou, Mengmeng Ge, Yang Liu

专题命中 其他推理 :reasoning(title,abstract)

AI总结 IntelGuard通过整合专家推理与大语言模型,实现高准确率的恶意包检测,发现54个未报告恶意包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16506 2026-01-26 cs.CR cs.AI 74%

SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment

SafeThinker: 通过风险推理深化安全对齐

Xianya Fang, Xianying Luo, Yadong Wang, Xiang Chen, Yu Tian, Zequn Sun, Rui Liu, Jun Fang, Naiqiang Tan, Yuanning Cui, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Didi International Business Group(滴滴国际商务集团) Institute for AI, Tsinghua University(清华大学人工智能研究院) Nanjing University of Information Science & Technology(南京信息科学技术大学)

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 SafeThinker通过动态分配防御资源,有效提升模型对伪装攻击的防御能力,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09631 2026-01-26 cs.CL 70%

LLMs Got Rhythm? Hybrid Phonological Filtering for Greek Poetry Rhyme Detection and Generation

LLMs Got Rhythm? 希腊诗歌押韵检测与生成的混合语音过滤

Stergios Chatzikyriakidis, Anastasia Natsina

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出混合语音学算法与LLMs结合,解决希腊诗歌押韵检测与生成问题,通过验证循环提升性能至73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10004 2026-01-26 cs.AI cs.CL 62%

Exploring LLMs for Scientific Information Extraction Using The SciEx Framework

探索使用SciEx框架利用大语言模型进行科学信息提取

Sha Li, Ayush Sadekar, Nathan Self, Yiqi Su, Lars Andersland, Mira Chaplin, Annabel Zhang, Hyoju Yang, James B Henderson, Krista Wigginton, Linsey Marr, T. M. Murali, Naren Ramakrishnan

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciEx框架,通过解耦关键组件提升科学信息提取的准确性和一致性,评估结果显示其在多科学领域中的有效性。

Comments Accepted to the KGML Bridge at AAAI 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15892 2026-01-26 cs.CL 57%

Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model

Stable-DiffCoder:推动代码扩散大语言模型的前沿

Chenghao Fan, Wen Heng, Bo Li, Sichen Liu, Yuxuan Song, Jing Su, Xiaoye Qu, Kai Shen, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Stable-DiffCoder通过基于扩散的训练方法,在代码生成任务中超越了传统自回归模型,提升了代码建模的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12771 2026-01-26 cs.CL 57%

Who Does This Name Remind You of ? Nationality Prediction via Large Language Model Associative Memory

这个名字让你想起谁?通过大语言模型关联记忆进行国籍预测

Keito Inoshita

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 LAMA通过利用大语言模型的关联记忆能力,有效提升国籍预测任务的准确性,其双代理架构在处理不同知识领域时表现出互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00364 2026-01-26 cs.CL 57%

The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining

混合语言文档在多语言大语言模型预训练中的作用

Jiandong Shao, Raphael Tang, Crystina Zhang, Karin Sevegnani, Pontus Stenetorp, Jianfei Yang, Yao Lu

机构 * University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) NVIDIA(英伟达) National Institute of Informatics(信息研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究发现平行数据对翻译性能至关重要,而语码转换数据对跨语言理解和推理影响较小。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18441 2026-01-26 cs.LO 50%

Expectation-based Analysis of Higher-Order Quantum Programs

基于期望的高阶量子程序分析

Martin Avanzini, Alejandro Díaz-Caro, Emmanuel Hainry, Romain Péchoux

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出了一种基于期望转换器的量子高阶程序分析方法,通过转换为非量子语言来研究量子程序的期望属性,如平均成本和事件概率,并展示了其在上界推理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏