arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-15 至 2026-01-15 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 24 篇

2601.08844 2026-01-15 cs.CL cs.AI cs.CY cs.LG 90%

Emissions and Performance Trade-off Between Small and Large Language Models

小型与大型语言模型之间排放与性能的权衡

Anandita Garg, Uma Gaba, Deepan Muthirayan, Anish Roy Chowdhury

机构 * School of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Plaksha University(普拉克斯大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过比较LLMs与微调SLMs在自然语言处理、推理和编程任务中的性能与排放权衡,证明小型模型在减少碳排放的同时能保持相近的性能表现。

Comments 6 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17200 2026-01-15 cs.AI 89%

Large Language Model-Based Automatic Formulation for Stochastic Optimization Models

基于大语言模型的随机优化模型自动建模

Amirreza Talebi

机构 * Department of Integrated Systems Engineering(集成系统工程系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型通过结构化提示自动建模随机优化问题,引入软评分度量提升模型质量,展示LLMs在SO建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09260 2026-01-15 cs.AI 88%

Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models

高效路径与密集奖励:用于大语言模型的概率流推理

Yan Liu, Feng Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Han Liu, Yangdong Deng

机构 * Meituan(美团) Tsinghua University(清华大学) Peking University(北京大学) Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 CoT-Flow通过概率流框架提升大语言模型的推理效率与性能,采用流引导解码和流强化学习方法实现信息高效推理路径和密集奖励函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08846 2026-01-15 cs.CL cs.AI cs.LG 87%

Directional Attractors in LLM Reasoning: How Similarity Retrieval Steers Iterative Summarization Based Reasoning

方向性吸引子在LLM推理中的作用:相似性检索如何引导迭代摘要推理

Cagatay Tekin, Charbel Barakat, Luis Joseph Luna Limgenco

机构 * McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InftyThink与跨链记忆,通过语义引理检索提升LLM在结构化领域推理准确性,同时揭示异构领域中的失败模式及方向性偏见影响。

Comments 6 pages, 2 figures. Code available at: github.com/cagopat/InftyThink-with-Cross-Chain-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09259 2026-01-15 cs.AI 85%

MAXS: Meta-Adaptive Exploration with LLM Agents

MAXS: 基于LLM代理的元适应性探索

Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo, li yuan, Lingling Zhang, Rui Mao, Qika Lin, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) South China University of Technology(华南理工大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MAXS通过元适应性探索框架提升LLM代理在多工具推理中的全局有效性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 85%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08848 2026-01-15 cs.CL cs.AI 84%

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

PediaMind-R1: 一种基于气质的个性化婴幼儿护理推理语言模型:通过认知建模与偏好对齐

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng

机构 * School of Future Information and Innovation, Fudan University(未来信息与创新学院,复旦大学) Corporate Research, Bosch (China) Investment Ltd.(博世(中国)投资有限公司研发部)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 PediaMind-R1通过整合认知建模与偏好对齐,实现基于婴幼儿气质的个性化护理推理。

Comments Accepted at EMNLP 2025 PALS Workshop (PALS: EXPLORING ACTIVE AND PASSIVE LLM PERSONALIZATION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09446 2026-01-15 cs.CL cs.AI 84%

Improving Symbolic Translation of Language Models for Logical Reasoning

提升语言模型的符号翻译以增强逻辑推理

Ramya Keerthy Thatikonda, Jiuzhou Han, Wray Buntine, Ehsan Shareghi

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调和增量推理框架,提升小型语言模型在逻辑推理中的符号翻译能力,减少错误率并提高推理性能。

Comments The Third workshop of NeusymBridge @AAAI 2026 (Bridging Neurons and Symbols for NLP and Knowledge Graph Reasoning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09215 2026-01-15 cs.CL 83%

UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning

UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用

Feng Zhang, Shijia Li, Chunmao Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu, Han Liu

机构 * Meituan(美团) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 UserLM-R1通过多奖励强化学习和动态目标驱动策略,提升用户语言模型在跨领域和对抗性场景中的推理与策略能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09706 2026-01-15 cs.CL cs.AI cs.LG 82%

Value-Aware Numerical Representations for Transformer Language Models

具有价值意识的数值表示用于Transformer语言模型

Andreea Dutulescu, Stefan Ruseti, Mihai Dascalu

机构 * National University of Science and Technology(科学技术大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种价值意识的数值表示方法,通过在Transformer语言模型输入中加入前缀标记以显式编码数值,从而提升模型在算术任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09151 2026-01-15 cs.LG 81%

Interpretable Probability Estimation with LLMs via Shapley Reconstruction

通过Shapley重构实现LLM的可解释概率估计

Yang Nan, Qihao Wen, Jiahao Wang, Pengfei He, Ravi Tandon, Yong Ge, Han Xu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PRISM通过Shapley值重构提升LLM概率估计的透明性和准确性,适用于金融、医疗等多个领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08839 2026-01-15 cs.CL 81%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL;large language model(comments);language model(comments)

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL 81%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09459 2026-01-15 cs.IR cs.CL 80%

Dissecting Judicial Reasoning in U.S. Copyright Damage Awards

解析美国版权损害赔偿判决中的司法推理

Pei-Chi Lo, Thomas Y. Lu

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL

AI总结 本研究提出基于修辞结构理论的LLM方法,用于解析版权损害赔偿判决中的司法推理,揭示各巡回法院因素权重差异,为法律分析提供新方法和实证洞察。

Comments Presented in SIGKDD'25 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05755 2026-01-15 cs.CR cs.AI 79%

VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit

VIGIL: 通过验证后再提交协议保护LLM代理免受工具流注入攻击

Junda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) North Automatic Control Technology Research Institute(北自动控制技术研究所)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 VIGIL通过验证后再提交协议保护LLM代理免受工具流注入攻击,有效提升安全性和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22979 2026-01-15 cs.LG 77%

OptiMind: Teaching LLMs to Think Like Optimization Experts

OptiMind: 教授大语言模型像优化专家一样思考

Xinzhi Zhang, Zeyi Chen, Humishka Zope, Hugo Barbalho, Konstantina Mellou, Marco Molinaro, Janardhan Kulkarni, Ishai Menache, Sirui Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 OptiMind通过整合优化专业知识,提升大语言模型在混合整数线性规划中的公式准确性,实现20.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09032 2026-01-15 cs.AI 77%

The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments

代理能力的层级:在现实强化学习环境中评估前沿模型

Logan Ritchie, Sushant Mehta, Nick Heiner, Mason Yu, Edwin Chen

机构 * Surge AI

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了前沿AI模型在现实强化学习环境中的代理能力层级,揭示了模型在工具使用、规划、适应性等任务上的能力差异及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20977 2026-01-15 cs.SE cs.CR cs.LG 77%

Repairing vulnerabilities without invisible hands. A differentiated replication study on LLMs

修补漏洞而无需隐形之手。对LLMs的差异化复制研究

Maria Camporese, Fabio Massacci

机构 * University of Trento(特伦托大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过受控实验研究LLM在漏洞修复中的表现,发现其修复能力可能受隐藏因素影响,通过偏移故障位置验证模型是否能复现记忆中的修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09609 2026-01-15 cs.CL cs.AI 73%

DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing

DPWriter: 基于多样化规划分支的强化学习用于创造性写作

Qian Cao, Yahui Liu, Wei Bi, Yi Zhao, Ruihua Song, Xiting Wang, Ruiming Tang, Guorui Zhou, Han Li

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DPWriter通过多样化规划分支方法提升创造性写作的输出多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09049 2026-01-15 cs.CL cs.AI 73%

Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers

Grokking是否值得?Transformer中泛化电路的功能分析与可迁移性

Kaiyu He, Zhang Mian, Peilin Wu, Xinya Du, Zhiyu Chen

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系 德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了Transformer中泛化电路的功能与可迁移性,发现grokking过程是整合记忆事实到自然推理路径,而非突然获得新范式,且其在迁移新知识时存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09281 2026-01-15 cs.AI 70%

STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models

STaR:用于大推理模型中去学习的敏感轨迹调节

Jingjing Zhou, Gaoxiang Cong, Li Su, Liang Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 STaR通过敏感轨迹调节方法,实现了大推理模型中高效且稳定的隐私保护去学习,减少隐私泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09430 2026-01-15 cs.CV 67%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09088 2026-01-15 cs.LG cs.CL 62%

Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning

面向优越长链推理的分布对齐序列蒸馏

Shaotian Yan, Kaiyuan Liu, Chen Shen, Bing Wang, Sinan Fan, Jun Zhang, Yue Wu, Zheng Wang, Jieping Ye

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DASD-4B-Thinking模型,通过改进序列蒸馏方法,实现高效推理性能,仅用448K样本达到SOTA效果。

Comments Project Page: https://github.com/D2I-ai/dasd-thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08834 2026-01-15 cs.CV cs.AI cs.CL 62%

Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR

阅读还是推理?面向文档OCR的格式解耦强化学习

Yufeng Zhong, Lei Chen, Zhixiong Zeng, Xuanle Zhao, Deyang Jiang, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Siqi Yang, Lin Ma

机构 * Meituan(美团)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出格式解耦强化学习方法,通过高熵模式优化提升文档OCR性能,在OmniDocBench上取得新记录。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏