arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-19 至 2026-01-19 共收录 156 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2601.11379 2026-01-19 cs.CL cs.AI cs.CY cs.SI 86%

Evaluating LLM Behavior in Hiring: Implicit Weights, Fairness Across Groups, and Alignment with Human Preferences

评估LLM在招聘中的行为:隐含权重、群体公平性及与人类偏好的一致性

Morgane Hoffmann, Emma Jouffroy, Warren Jouanneau, Marc Palyart, Charles Pebereau

机构 * Malt

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估LLM招聘决策的框架,发现模型重视核心生产力信号,但对某些特征的解释超出显性匹配价值,且不同群体间权重存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11147 2026-01-19 cs.AI 70%

Do We Always Need Query-Level Workflows? Rethinking Agentic Workflow Generation for Multi-Agent Systems

我们是否总是需要查询级工作流?重新思考多智能体系统中的代理工作流生成

Zixu Wang, Bingbing Xu, Yige Yuan, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCALE框架,通过低成本任务级生成替代查询级生成,减少令牌消耗并保持性能。

Comments 17 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10131 2026-01-19 cs.AI cs.MA 70%

M^4olGen: Multi-Agent, Multi-Stage Molecular Generation under Precise Multi-Property Constraints

M^4olGen: 多智能体、多阶段分子生成在精确多属性约束下

Yizhan Li, Florence Cloutier, Sifan Wu, Ali Parviz, Boris Knyazev, Yan Zhang, Glen Berseth, Bang Liu

机构 * DIRO & Université de Montréal(DIRO与蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) Institut Courtois(Courtois研究所) Samsung AI Lab, Montreal(三星AI实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M^4olGen通过多智能体和强化学习框架,在多属性约束下实现精确分子生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 2 篇

2508.01166 2026-01-19 cs.SD 85%

Hearing More with Less: Multi-Modal Retrieval-and-Selection Augmented Conversational LLM-Based ASR

听更清晰,用更少:多模态检索与选择增强的对话式LLM基于ASR

Bingshen Mu, Hexin Liu, Hongfei Xue, Kun Wei, Lei Xie

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出MARS方法,通过多模态检索与选择提升对话式LLM-ASR的准确性,仅用1.5K小时数据即可超越训练于179K小时数据的顶级系统。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11485 2026-01-19 cs.CL 77%

Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation

错误笔记本学习:用于无训练代理适应的批量聚类失败

Xuanbo Su, Yingfang Zhang, Hao Luo, Xiaoteng Liu, Leo Huang

机构 * Bairong Inc.(柏龙公司) School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Software, Jilin University(吉林大学软件学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MNL通过批量聚类失败提炼结构化错误笔记,提升代理适应性和鲁棒性,无需参数更新。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 28 篇

2403.18344 2026-01-19 cs.AI 92%

LC-LLM: Explainable Lane-Change Intention and Trajectory Predictions with Large Language Models

LC-LLM: 基于大语言模型的可解释车道变更意图与轨迹预测

Mingxing Peng, Xusen Guo, Xianda Chen, Meixin Zhu, Kehua Chen

机构 * Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)系统中心) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科学与技术大学跨学科研究院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出LC-LLM模型,利用大语言模型的推理能力,实现车道变更意图和轨迹的可解释预测。

Comments 12 pages, 9 figures

Journal ref Communications in Transportation Research 5 (2025): 100170

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10983 2026-01-19 cs.CY 91%

Evaluating 21st-Century Competencies in Postsecondary Curricula with Large Language Models: Performance Benchmarking and Reasoning-Based Prompting Strategies

利用大语言模型评估21世纪能力在高等教育课程中的表现:性能基准测试与基于推理的提示策略

Zhen Xu, Xin Guan, Chenxi Shi, Qinhao Chen, Renzhe Yu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 本研究利用大语言模型评估21世纪能力在高等教育课程中的表现,提出基于推理的提示策略提升课程分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10110 2026-01-19 cs.CL cs.HC 91%

Generate-Then-Validate: A Novel Question Generation Approach Using Small Language Models

生成后再验证:一种利用小语言模型的新型问题生成方法

Yumou Wei, John Stamper, Paulo F. Carvalho

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出了一种利用小语言模型的新型问题生成方法,通过生成后再验证策略生成高质量问题,验证了其在学习分析中的有效性。

Comments Accepted as a full research paper for the 16th International Conference on Learning Analytics and Knowledge (LAK'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10963 2026-01-19 eess.SP 87%

Large Wireless Foundation Models: Stronger over Bigger

大规模无线基础模型:更强且更大

Xiang Cheng, Boxun Liu, Xuanyu Liu, Xuesong Cai

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出大规模无线基础模型(LWFMs),通过无线约束下的新框架赋能物理层,结合现有通用模型和新模型构建,提升无线通信的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11881 2026-01-19 cs.LG cs.AI cs.CL 87%

Better LLM Reasoning via Dual-Play

通过双对抗提升大语言模型推理能力

Zhengxin Zhang, Chengyu Huang, Aochong Oliver Li, Claire Cardie

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PasoDoble通过双对抗训练框架提升大语言模型推理能力,无需外部监督,通过Proposer生成挑战性问题和Solver解决问题,共同训练以增强稳定性与性能。

Comments 33 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04359 2026-01-19 cs.AI 85%

Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning

基于语义和token熵的高效强化学习用于LLM推理

Hongye Cao, Zhixin Bai, Ziyue Peng, Boyan Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) Institute of Artificial Intelligence, NineVerse, Beijing(九章人工智能研究院,北京)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于语义和token熵的高效强化学习框架,通过优化数据组织和算法设计缓解熵崩溃,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11468 2026-01-19 cs.AI cs.IT math.IT 83%

Exploring LLM Features in Predictive Process Monitoring for Small-Scale Event-Logs

探索LLM特性在小规模事件日志预测过程监控中的应用

Alessandro Padella, Massimiliano de Leoni, Marlon Dumas

机构 * University of Tartu(塔尔图大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出基于LLM的预测过程监控方法,通过扩展框架评估其通用性、语义利用和推理能力,在小规模事件日志中实现了优于传统方法的预测性能。

Comments 19 pages, 4 figure, TMIS journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11354 2026-01-19 cs.AI cs.CL 79%

AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems

AstroReason-Bench: 评估跨异构空间规划问题的统一代理规划

Weiyi Wang, Xinchi Chen, Jingjing Gong, Xuanjing Huang, Xipeng Qiu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AstroReason-Bench通过评估代理在复杂空间规划问题中的表现,揭示了通用规划在现实约束下的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11000 2026-01-19 cs.CL cs.AI 79%

When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs

当个性化误导:理解并缓解个性化大语言模型中的幻觉现象

Zhongxiang Sun, Yi Zhan, Chenglei Shen, Weijie Yu, Xiao Zhang, Ming He, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AI Lab at Lenovo Research(联想研究院人工智能实验室) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际商务与经济大学人工智能与数据科学学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FPPS方法,通过轻量级推理时间策略缓解个性化大语言模型中的事实性幻觉问题,并引入PFQABench基准评估事实性和个性化问答性能。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25063 2026-01-19 cs.LG cs.CL 79%

Many Minds from One Model: Bayesian-Inspired Transformers for Population Diversity

一模多样:基于贝叶斯思想的变压器用于群体多样性

Diji Yang, Yi Zhang

机构 * University of California Santa Cruz(加州大学圣克ruz分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 B-Trans通过在归一化层中引入随机性,实现从单一预训练模型中采样出多样且连贯的变压器实例,提升响应多样性与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11322 2026-01-19 cs.CV cs.LO 78%

Enhancing Vision Language Models with Logic Reasoning for Situational Awareness

通过逻辑推理增强视觉语言模型以提升情境感知能力

Pavana Pradeep, Krishna Kant, Suya Yu

机构 * CIS Department, Temple University(Temple大学计算机与信息科学系) ARL(美国陆军研究实验室)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文通过整合逻辑推理与传统计算机视觉方法,提升视觉语言模型在情境感知中的准确性与细粒度事件识别能力。

Comments Accepted for publication in IEEE Transactions on AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11332 2026-01-19 cs.CL 77%

Idea First, Code Later: Disentangling Problem Solving from Code Generation in Evaluating LLMs for Competitive Programming

先有想法,后写代码:在评估LLM用于竞技编程时,将问题解决与代码生成解耦

Sama Hadhoud, Alaa Elsetohy, Frederikus Hudi, Jan Christian Blaise Cruz, Steven Halim, Alham Fikri Aji

机构 * MBZUAI NAIST National University of Singapore(国立新加坡大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过编辑稿而非代码来评估LLM在竞技编程中的问题解决能力,并引入数据集和评估方法,强调区分问题解决与实现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01439 2026-01-19 cs.AI cs.RO 77%

Probabilistic Mission Design for Neuro-Symbolic Unmanned Aircraft Systems

基于概率的方法用于神经符号无人机系统任务设计

Simon Kohaut, Benedict Flade, Daniel Ochs, Devendra Singh Dhami, Julian Eggert, Kristian Kersting

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出概率任务设计(ProMis)方法,结合神经符号技术,用于在法律框架内导航无人驾驶航空器,通过混合概率逻辑程序和机器学习模型提升任务规划的可靠性和适应性。

Comments arXiv admin note: text overlap with arXiv:2406.03454

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10865 2026-01-19 cs.CR cs.SE 75%

Multi-Agent Taint Specification Extraction for Vulnerability Detection

多代理污点规范提取用于漏洞检测

Jonah Ghebremichael, Saastha Vasan, Saad Ullah, Greg Tystahl, David Adei, Christopher Kruegel, Giovanni Vigna, William Enck, Alexandros Kapravelos

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SemTaint通过结合LLM语义理解和传统静态分析,提取定制化的污点规范以提升漏洞检测效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01298 2026-01-19 cs.IR 75%

Augmented Knowledge Graph Querying leveraging LLMs

增强知识图谱查询利用大语言模型

Marco Arazzi, Davide Ligari, Serena Nicolazzo, Antonino Nocera

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SparqLLM通过结合RAG和LLM技术,实现高效的知识图谱查询与可视化,提升非专家用户的数据交互能力。

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07128 2026-01-19 cs.CL 74%

DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning

DeepSeek-R1 思维学:让我们思考LLM推理

Sara Vera Marjanović, Arkil Patel, Vaibhav Adlakha, Milad Aghajohari, Parishad BehnamGhader, Mehar Bhatia, Aditi Khandelwal, Austin Kraft, Benno Krojer, Xing Han Lù, Nicholas Meade, Dongchan Shin, Amirhossein Kazemnejad, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Siva Reddy

专题命中 推理与问题求解 :LLM(title);分类 cs.CL

AI总结 DeepSeek-R1通过多步骤推理链实现复杂问题解决,研究揭示其推理性能的'甜点'及潜在安全漏洞。

Comments 135 pages, Published to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11255 2026-01-19 cs.CL cs.LG 73%

Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering

树状推理:改进多跳问题回答的检索增强生成

Yuling Shi, Maolin Sun, Zijun Liu, Mo Yang, Yixiong Fang, Tianran Sun, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RT-RAG通过构建推理树来提升多跳问题回答的准确性和一致性,实验结果显示其在F1和EM指标上均优于现有方法。

Comments Accepted to GLOW@WWW2026. Code available at https://github.com/sakura20221/RT-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10825 2026-01-19 cs.CL cs.CY cs.LG 73%

Reasoning Models Generate Societies of Thought

推理模型生成思想社会

Junsol Kim, Shiyang Lai, Nino Scherrer, Blaise Agüera y Arcas, James Evans

机构 * Google, Paradigms of Intelligence Team(谷歌,智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣达菲研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 推理模型通过模拟多代理互动生成思想社会,提升推理准确性与多样性,揭示了社会结构对问题解决的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10810 2026-01-19 cs.LG cs.AI 73%

Digital Metabolism: Decoupling Logic from Facts via Regenerative Unlearning -- Towards a Pure Neural Logic Core

数字代谢:通过再生反学习解耦逻辑与事实 -- 向纯神经逻辑核心迈进

Mengmeng Peng, Zhenyu Fang, He Sun

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出'数字代谢'假说,通过再生反学习解耦逻辑与事实,实现纯神经逻辑核心,提升模型推理能力并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11093 2026-01-19 cs.CL 70%

Integrity Shield A System for Ethical AI Use & Authorship Transparency in Assessments

完整性防护:一个用于伦理AI使用和评估中的作者透明度的系统

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Integrity Shield通过在文档层嵌入水印,防止大型语言模型回答受保护的考试,同时保持外观不变,并在多个考试中实现了高阻止率和检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08274 2026-01-19 cs.CL 70%

Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees

发现与强化工具集成推理链 via 滚出树

Kun Li, Zenan Xu, Junan Li, Zengrui Jin, Jinghao Deng, Zexuan Qiu, Bo Zhou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DART通过强化学习框架在长链推理中自发使用工具,无需人工标注,有效提升工具集成推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00070 2026-01-19 cs.RO cs.AI 70%

Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics

Robot-R1: 通过强化学习提升机器人中的具身推理

Dongyoung Kim, Sumin Park, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学) UC Berkeley(加州大学伯克利分校) RLWRLD

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 Robot-R1通过强化学习提升机器人中的具身推理,优于SFT方法并超越GPT-4o在低级动作控制推理任务中

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19804 2026-01-19 math.CO math.NT 67%

Forbidden Sidon subsets of perfect difference sets, featuring a human-assisted proof

完美差集中的禁止西顿子集,包含人机协作证明

Boris Alexeev, Dustin G. Mixon

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究发现了一个反例,推翻了埃德尔斯关于有限西顿集可扩展为完美差集的猜想,并通过人机协作验证了反例的正确性。

Comments 15 pages, 1 figure. v2 includes 4 ancillary files which enable full Lean reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10909 2026-01-19 cs.CV 67%

FrankenMotion: Part-level Human Motion Generation and Composition

FrankenMotion: 部位级人类动作生成与组合

Chuqiao Li, Xianghui Xie, Yong Cao, Andreas Geiger, Gerard Pons-Moll

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校区)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 FrankenMotion通过原子性、时间感知的部位级动作标注,实现了对身体部位和原子动作的双重控制,首次在动作生成中引入细粒度部位级标注。

Comments Project page: https://coral79.github.io/frankenmotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11517 2026-01-19 cs.CL cs.AI 62%

Do explanations generalize across large reasoning models?

解释是否能在大型推理模型中泛化?

Koyena Pal, David Bau, Chandan Singh

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型推理模型生成的解释是否能泛化,发现CoT解释能提高模型间一致性,并提出基于句子的融合策略提升一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏