arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-19 至 2026-01-19 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 28 篇

2403.18344 2026-01-19 cs.AI 92%

LC-LLM: Explainable Lane-Change Intention and Trajectory Predictions with Large Language Models

LC-LLM: 基于大语言模型的可解释车道变更意图与轨迹预测

Mingxing Peng, Xusen Guo, Xianda Chen, Meixin Zhu, Kehua Chen

机构 * Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)系统中心) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科学与技术大学跨学科研究院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出LC-LLM模型,利用大语言模型的推理能力,实现车道变更意图和轨迹的可解释预测。

Comments 12 pages, 9 figures

Journal ref Communications in Transportation Research 5 (2025): 100170

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10983 2026-01-19 cs.CY 91%

Evaluating 21st-Century Competencies in Postsecondary Curricula with Large Language Models: Performance Benchmarking and Reasoning-Based Prompting Strategies

利用大语言模型评估21世纪能力在高等教育课程中的表现:性能基准测试与基于推理的提示策略

Zhen Xu, Xin Guan, Chenxi Shi, Qinhao Chen, Renzhe Yu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 本研究利用大语言模型评估21世纪能力在高等教育课程中的表现,提出基于推理的提示策略提升课程分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10110 2026-01-19 cs.CL cs.HC 91%

Generate-Then-Validate: A Novel Question Generation Approach Using Small Language Models

生成后再验证:一种利用小语言模型的新型问题生成方法

Yumou Wei, John Stamper, Paulo F. Carvalho

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出了一种利用小语言模型的新型问题生成方法,通过生成后再验证策略生成高质量问题,验证了其在学习分析中的有效性。

Comments Accepted as a full research paper for the 16th International Conference on Learning Analytics and Knowledge (LAK'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10963 2026-01-19 eess.SP 87%

Large Wireless Foundation Models: Stronger over Bigger

大规模无线基础模型:更强且更大

Xiang Cheng, Boxun Liu, Xuanyu Liu, Xuesong Cai

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出大规模无线基础模型(LWFMs),通过无线约束下的新框架赋能物理层,结合现有通用模型和新模型构建,提升无线通信的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11881 2026-01-19 cs.LG cs.AI cs.CL 87%

Better LLM Reasoning via Dual-Play

通过双对抗提升大语言模型推理能力

Zhengxin Zhang, Chengyu Huang, Aochong Oliver Li, Claire Cardie

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PasoDoble通过双对抗训练框架提升大语言模型推理能力,无需外部监督,通过Proposer生成挑战性问题和Solver解决问题,共同训练以增强稳定性与性能。

Comments 33 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04359 2026-01-19 cs.AI 85%

Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning

基于语义和token熵的高效强化学习用于LLM推理

Hongye Cao, Zhixin Bai, Ziyue Peng, Boyan Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) Institute of Artificial Intelligence, NineVerse, Beijing(九章人工智能研究院,北京)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于语义和token熵的高效强化学习框架,通过优化数据组织和算法设计缓解熵崩溃,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11468 2026-01-19 cs.AI cs.IT math.IT 83%

Exploring LLM Features in Predictive Process Monitoring for Small-Scale Event-Logs

探索LLM特性在小规模事件日志预测过程监控中的应用

Alessandro Padella, Massimiliano de Leoni, Marlon Dumas

机构 * University of Tartu(塔尔图大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出基于LLM的预测过程监控方法,通过扩展框架评估其通用性、语义利用和推理能力,在小规模事件日志中实现了优于传统方法的预测性能。

Comments 19 pages, 4 figure, TMIS journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11354 2026-01-19 cs.AI cs.CL 79%

AstroReason-Bench: Evaluating Unified Agentic Planning across Heterogeneous Space Planning Problems

AstroReason-Bench: 评估跨异构空间规划问题的统一代理规划

Weiyi Wang, Xinchi Chen, Jingjing Gong, Xuanjing Huang, Xipeng Qiu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AstroReason-Bench通过评估代理在复杂空间规划问题中的表现,揭示了通用规划在现实约束下的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11000 2026-01-19 cs.CL cs.AI 79%

When Personalization Misleads: Understanding and Mitigating Hallucinations in Personalized LLMs

当个性化误导:理解并缓解个性化大语言模型中的幻觉现象

Zhongxiang Sun, Yi Zhan, Chenglei Shen, Weijie Yu, Xiao Zhang, Ming He, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) AI Lab at Lenovo Research(联想研究院人工智能实验室) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际商务与经济大学人工智能与数据科学学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FPPS方法,通过轻量级推理时间策略缓解个性化大语言模型中的事实性幻觉问题,并引入PFQABench基准评估事实性和个性化问答性能。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25063 2026-01-19 cs.LG cs.CL 79%

Many Minds from One Model: Bayesian-Inspired Transformers for Population Diversity

一模多样:基于贝叶斯思想的变压器用于群体多样性

Diji Yang, Yi Zhang

机构 * University of California Santa Cruz(加州大学圣克ruz分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 B-Trans通过在归一化层中引入随机性,实现从单一预训练模型中采样出多样且连贯的变压器实例,提升响应多样性与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11322 2026-01-19 cs.CV cs.LO 78%

Enhancing Vision Language Models with Logic Reasoning for Situational Awareness

通过逻辑推理增强视觉语言模型以提升情境感知能力

Pavana Pradeep, Krishna Kant, Suya Yu

机构 * CIS Department, Temple University(Temple大学计算机与信息科学系) ARL(美国陆军研究实验室)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文通过整合逻辑推理与传统计算机视觉方法,提升视觉语言模型在情境感知中的准确性与细粒度事件识别能力。

Comments Accepted for publication in IEEE Transactions on AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11332 2026-01-19 cs.CL 77%

Idea First, Code Later: Disentangling Problem Solving from Code Generation in Evaluating LLMs for Competitive Programming

先有想法,后写代码:在评估LLM用于竞技编程时,将问题解决与代码生成解耦

Sama Hadhoud, Alaa Elsetohy, Frederikus Hudi, Jan Christian Blaise Cruz, Steven Halim, Alham Fikri Aji

机构 * MBZUAI NAIST National University of Singapore(国立新加坡大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过编辑稿而非代码来评估LLM在竞技编程中的问题解决能力,并引入数据集和评估方法,强调区分问题解决与实现的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01439 2026-01-19 cs.AI cs.RO 77%

Probabilistic Mission Design for Neuro-Symbolic Unmanned Aircraft Systems

基于概率的方法用于神经符号无人机系统任务设计

Simon Kohaut, Benedict Flade, Daniel Ochs, Devendra Singh Dhami, Julian Eggert, Kristian Kersting

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出概率任务设计(ProMis)方法,结合神经符号技术,用于在法律框架内导航无人驾驶航空器,通过混合概率逻辑程序和机器学习模型提升任务规划的可靠性和适应性。

Comments arXiv admin note: text overlap with arXiv:2406.03454

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10865 2026-01-19 cs.CR cs.SE 75%

Multi-Agent Taint Specification Extraction for Vulnerability Detection

多代理污点规范提取用于漏洞检测

Jonah Ghebremichael, Saastha Vasan, Saad Ullah, Greg Tystahl, David Adei, Christopher Kruegel, Giovanni Vigna, William Enck, Alexandros Kapravelos

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SemTaint通过结合LLM语义理解和传统静态分析,提取定制化的污点规范以提升漏洞检测效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01298 2026-01-19 cs.IR 75%

Augmented Knowledge Graph Querying leveraging LLMs

增强知识图谱查询利用大语言模型

Marco Arazzi, Davide Ligari, Serena Nicolazzo, Antonino Nocera

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SparqLLM通过结合RAG和LLM技术,实现高效的知识图谱查询与可视化,提升非专家用户的数据交互能力。

Journal ref 2025 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07128 2026-01-19 cs.CL 74%

DeepSeek-R1 Thoughtology: Let's think about LLM Reasoning

DeepSeek-R1 思维学:让我们思考LLM推理

Sara Vera Marjanović, Arkil Patel, Vaibhav Adlakha, Milad Aghajohari, Parishad BehnamGhader, Mehar Bhatia, Aditi Khandelwal, Austin Kraft, Benno Krojer, Xing Han Lù, Nicholas Meade, Dongchan Shin, Amirhossein Kazemnejad, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Siva Reddy

专题命中 推理与问题求解 :LLM(title);分类 cs.CL

AI总结 DeepSeek-R1通过多步骤推理链实现复杂问题解决,研究揭示其推理性能的'甜点'及潜在安全漏洞。

Comments 135 pages, Published to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11255 2026-01-19 cs.CL cs.LG 73%

Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering

树状推理:改进多跳问题回答的检索增强生成

Yuling Shi, Maolin Sun, Zijun Liu, Mo Yang, Yixiong Fang, Tianran Sun, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 RT-RAG通过构建推理树来提升多跳问题回答的准确性和一致性,实验结果显示其在F1和EM指标上均优于现有方法。

Comments Accepted to GLOW@WWW2026. Code available at https://github.com/sakura20221/RT-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10825 2026-01-19 cs.CL cs.CY cs.LG 73%

Reasoning Models Generate Societies of Thought

推理模型生成思想社会

Junsol Kim, Shiyang Lai, Nino Scherrer, Blaise Agüera y Arcas, James Evans

机构 * Google, Paradigms of Intelligence Team(谷歌,智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣达菲研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 推理模型通过模拟多代理互动生成思想社会,提升推理准确性与多样性,揭示了社会结构对问题解决的促进作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10810 2026-01-19 cs.LG cs.AI 73%

Digital Metabolism: Decoupling Logic from Facts via Regenerative Unlearning -- Towards a Pure Neural Logic Core

数字代谢:通过再生反学习解耦逻辑与事实 -- 向纯神经逻辑核心迈进

Mengmeng Peng, Zhenyu Fang, He Sun

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出'数字代谢'假说,通过再生反学习解耦逻辑与事实,实现纯神经逻辑核心,提升模型推理能力并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11093 2026-01-19 cs.CL 70%

Integrity Shield A System for Ethical AI Use & Authorship Transparency in Assessments

完整性防护:一个用于伦理AI使用和评估中的作者透明度的系统

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Integrity Shield通过在文档层嵌入水印,防止大型语言模型回答受保护的考试,同时保持外观不变,并在多个考试中实现了高阻止率和检测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08274 2026-01-19 cs.CL 70%

Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees

发现与强化工具集成推理链 via 滚出树

Kun Li, Zenan Xu, Junan Li, Zengrui Jin, Jinghao Deng, Zexuan Qiu, Bo Zhou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DART通过强化学习框架在长链推理中自发使用工具,无需人工标注,有效提升工具集成推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00070 2026-01-19 cs.RO cs.AI 70%

Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics

Robot-R1: 通过强化学习提升机器人中的具身推理

Dongyoung Kim, Sumin Park, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学) UC Berkeley(加州大学伯克利分校) RLWRLD

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 Robot-R1通过强化学习提升机器人中的具身推理,优于SFT方法并超越GPT-4o在低级动作控制推理任务中

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19804 2026-01-19 math.CO math.NT 67%

Forbidden Sidon subsets of perfect difference sets, featuring a human-assisted proof

完美差集中的禁止西顿子集,包含人机协作证明

Boris Alexeev, Dustin G. Mixon

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究发现了一个反例,推翻了埃德尔斯关于有限西顿集可扩展为完美差集的猜想,并通过人机协作验证了反例的正确性。

Comments 15 pages, 1 figure. v2 includes 4 ancillary files which enable full Lean reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10909 2026-01-19 cs.CV 67%

FrankenMotion: Part-level Human Motion Generation and Composition

FrankenMotion: 部位级人类动作生成与组合

Chuqiao Li, Xianghui Xie, Yong Cao, Andreas Geiger, Gerard Pons-Moll

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校区)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 FrankenMotion通过原子性、时间感知的部位级动作标注,实现了对身体部位和原子动作的双重控制,首次在动作生成中引入细粒度部位级标注。

Comments Project page: https://coral79.github.io/frankenmotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11517 2026-01-19 cs.CL cs.AI 62%

Do explanations generalize across large reasoning models?

解释是否能在大型推理模型中泛化?

Koyena Pal, David Bau, Chandan Singh

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型推理模型生成的解释是否能泛化,发现CoT解释能提高模型间一致性,并提出基于句子的融合策略提升一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11252 2026-01-19 cs.AI 57%

Beyond Model Scaling: Test-Time Intervention for Efficient Deep Reasoning

超越模型扩展:用于高效深度推理的测试时干预

Qianyue Wang, Jinwu Hu, Yufeng Wang, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(琶洲实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 Think-with-Me通过测试时干预提升深度推理效率,实现准确性和推理长度的平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04823 2026-01-19 cs.LG q-bio.BM 57%

ProteinGuide: On-the-fly property guidance for protein sequence generative models

ProteinGuide: 为蛋白质序列生成模型实现即插即用的属性指导

Junhao Xiong, Ishan Gaur, Maria Lukarska, Hunter Nisonoff, Luke M. Oltrogge, David F. Savage, Jennifer Listgarten

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(电气工程与计算机科学系,加州大学伯克利分校) Center for Computational Biology, University of California, Berkeley(计算生物学中心,加州大学伯克利分校) Department of Molecular and Cell Biology, University of California, Berkeley(分子与细胞生物学系,加州大学伯克利分校) Innovative Genomics Institute, University of California, Berkeley(创新基因组研究所,加州大学伯克利分校) Howard Hughes Medical Institute, University of California, Berkeley(霍华德·休斯医学研究所,加州大学伯克利分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 ProteinGuide为蛋白质序列生成模型提供即插即用的属性指导方法,通过实验验证其在提高编辑效率方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11284 2026-01-19 cs.HC cs.IR 50%

"Can You Tell Me?": Designing Copilots to Support Human Judgement in Online Information Seeking

你能告诉我吗?:设计支持在线信息寻求中人类判断的Copilot

Markus Bink, Marten Risius, Udo Kruschwitz, David Elsweiler

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出一种基于LLM的Copilot,旨在支持用户在在线信息寻求中的判断,通过促进数字素养技能提升,但实验显示其在提升回答准确性和搜索参与度方面效果有限。

Comments Pre-Print accepted at CHIIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏