arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 193 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 15 篇

2512.24849 2026-01-01 cond-mat.mtrl-sci cond-mat.supr-con 50%

SSCHA-based evolutionary crystal structure prediction at finite temperatures with account for quantum nuclear motion

基于SSCHA的有限温度下晶体结构预测及量子核运动考虑

Daniil Poletaev, Artem Oganov

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出基于SSCHA和MLIPs的有限温度晶体结构预测方法,通过比较AL-MLIPs和uMLIPs在LaH₁₀中的应用,展示量子非谐性对稳定性排名的重要性,扩展了CSP的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03734 2026-01-01 cs.RO cs.CV 50%

OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction

OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型

Huang Huang, Fangchen Liu, Letian Fu, Tingfan Wu, Mustafa Mukadam, Jitendra Malik, Ken Goldberg, Pieter Abbeel

机构 * University of California, Berkeley(加州大学伯克利分校) Meta AI

专题命中 指令微调 :language model(abstract)

AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 9 篇

2504.15843 2026-01-01 cs.CL 87%

Pre-DPO: Improving Data Utilization in Direct Preference Optimization Using a Guiding Reference Model

Pre-DPO:通过引导参考模型提升直接偏好优化的数据利用

Junshu Pan, Wei Shen, Shulin Huang, Qiji Zhou, Yue Zhang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 Pre-DPO通过引入引导参考模型提升直接偏好优化的数据利用效率,有效提高大语言模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24609 2026-01-01 cs.AI 85%

Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization

强化学习增强的LLM代理用于协作决策与性能优化

Dong Qiu, Duo Xu, Limengxi Yue

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出强化学习增强的LLM代理框架,通过GRPO和联合奖励优化,提升多智能体协作任务的效率与一致性。

Comments Accepted by IEEE ICFTIC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06970 2026-01-01 cs.CV 80%

Guiding Cross-Modal Representations with MLLM Priors via Preference Alignment

通过偏好对齐引导跨模态表示

Pengfei Zhao, Rongbo Luan, Wei Zhang, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);preference optimization(abstract)

AI总结 MAPLE通过利用多模态大语言模型的细粒度对齐先验,引导跨模态表示学习,提升细粒度检索性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15159 2026-01-01 cs.CV 78%

OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization

OnlineVPO: 对齐视频扩散模型与在线视频中心偏好优化

Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance Project Page(字节跳动项目)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 OnlineVPO通过改进反馈源和调节方法,提出一种针对视频扩散模型的高效偏好学习框架,提升视频生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24693 2026-01-01 cs.CL 77%

MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models

MUSIC: 多步指令对比用于多轮奖励模型

Wenzhe Li, Shujian Zhang, Wenxuan Zhou, John Lambert, Chi Jin, Andrew Hard, Rajiv Mathews, Lun Wang

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03142 2026-01-01 cs.LG 77%

Not All Tokens Are Meant to Be Forgotten

并非所有标记都旨在被遗忘

Xiangyu Zhou, Yao Qiang, Saleh Zare Zade, Douglas Zytko, Prashant Khanduri, Dongxiao Zhu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出TIF框架,通过目标信息标识符和偏好优化方法,解决LLM过度遗忘问题,提升去学习效果并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25023 2026-01-01 cs.LG 70%

ResponseRank: Data-Efficient Reward Modeling through Preference Strength Learning

ResponseRank: 通过偏好强度学习实现数据高效的奖励建模

Timo Kaufmann, Yannick Metz, Daniel Keim, Eyke Hüllermeier

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 ResponseRank通过本地有效相对强度信号稳健学习偏好强度,提升样本效率和鲁棒性,引入Pearson距离相关性度量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 67%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23971 2026-01-01 cs.CL 57%

CEC-Zero: Zero-Supervision Character Error Correction with Self-Generated Rewards

CEC-Zero: 无监督字符错误纠正与自生成奖励

Zhiming Lin, Kai Zhao, Sophie Zhang, Peilai Yu, Canran Xiao

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 CEC-Zero通过无监督强化学习框架,利用自动生成的奖励在无需标注的情况下提升大语言模型的字符错误纠正能力,实现了在多个基准测试中的性能提升。

Comments AAAI'26 poster

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 12 篇

2512.23862 2026-01-01 cs.LG cs.AI cs.CL 88%

Probing the Limits of Compressive Memory: A Study of Infini-Attention in Small-Scale Pretraining

探测压缩记忆的极限:对Infini-Attention在小规模预训练中的研究

Ruizhe Huang, Kexuan Zhang, Yihao Fang, Baifeng Yu

机构 * Huawei Technologies Canada Co., Ltd(华为技术加拿大有限公司)

专题命中 长上下文与记忆 :pretraining(title,abstract);language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本研究通过Infini-Attention在小规模预训练中提升SLMs的长上下文能力,验证了其在有限参数下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24969 2026-01-01 cond-mat.stat-mech cs.CL physics.bio-ph q-bio.NC 88%

Large language models and the entropy of English

大语言模型与英语的熵

Colin Scheibner, Lindsay M. Smith, William Bialek

机构 * Joseph Henry Laboratories of Physics(乔赛亚·亨利物理实验室) Princeton Center for Theoretical Science(普林斯顿理论科学中心) Lewis--Sigler Institute for Integrative Genomics(刘易斯-西格尔整合基因组学研究所) Princeton University(普林斯顿大学) Initiative for the Theoretical Sciences(理论科学倡议) The CUNY Graduate Center(纽约市立大学研究生中心)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过大语言模型揭示英语文本中长程结构的熵特性及依赖关系

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23836 2026-01-01 cs.CL cs.AI cs.LG 83%

Retrieval Augmented Question Answering: When Should LLMs Admit Ignorance?

检索增强型问答:当LLMs应承认无知时

Dingmin Wang, Ji Ma, Shankar Kumar

机构 * Google Research(谷歌研究) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种自适应提示策略,通过分割检索信息并逐步提示LLM回答问题,以提高问答性能并减少无关信息的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24077 2026-01-01 cs.AI 70%

LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm

LoongFlow:通过认知计划-执行-总结范式实现定向进化搜索

Chunhui Wan, Xunan Dai, Zhuo Wang, Minglei Li, Yanpeng Wang, Yinan Mao, Yu Lan, Zhiwen Xiao

机构 * Baidu Inc(百度公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LoongFlow通过认知计划-执行-总结范式实现高效进化搜索,提升算法发现与流水线优化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23760 2026-01-01 cs.CR cs.AI 70%

Audited Skill-Graph Self-Improvement for Agentic LLMs via Verifiable Rewards, Experience Synthesis, and Continual Memory

通过可验证奖励、经验合成和持续记忆对代理LLM进行审计化技能图自改进

Ken Huang, Jerry Huang

机构 * OWASP Fairfax, VA, USA Kleiner Perkins

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASG-SI框架,通过可验证奖励、经验合成和持续记忆实现代理LLM的审计化技能图自改进,以提升安全性和可追溯性。

Comments 11 pages, 4 figures. Includes a complete runnable reference implementation and audit logging framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10969 2026-01-01 cs.CV 67%

Bringing The Consistency Gap: Explicit Structured Memory for Interleaved Image-Text Generation

弥合一致性差距:用于交错图像-文本生成的显式结构化记忆

Zeteng Lin, Xingxing Li, Wen You, Xiaoyang Li, Zehan Lu, Yujun Cai, Jing Tang

机构 * Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) University of Queensland(昆士兰大学)

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract)

AI总结 IUT-Plug通过显式结构化记忆机制解决多模态生成中的上下文漂移问题,提升长序列一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23852 2026-01-01 cs.LG cs.CL 66%

Trellis: Learning to Compress Key-Value Memory in Attention Models

Trellis: 在注意力模型中学习压缩键值记忆

Mahdi Karami, Ali Behrouz, Praneeth Kacham, Vahab Mirrokni

机构 * Google Research(谷歌研究)

专题命中 长上下文与记忆 :language model(abstract,comments);分类 cs.CL、cs.LG

AI总结 Trellis通过动态压缩键值内存提升注意力模型的效率与长上下文处理能力

Comments In Second Conference on Language Modeling (COLM) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24695 2026-01-01 cs.LG cs.AI 62%

Nested Learning: The Illusion of Deep Learning Architectures

嵌套学习:深度学习架构的幻觉

Ali Behrouz, Meisam Razaviyayn, Peilin Zhong, Vahab Mirrokni

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌套学习范式,通过多级优化问题设计更高效的学习算法,展示持续学习模块Hope在语言建模等任务中的表现。

Comments A version of this work is published at Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24684 2026-01-01 cs.CL cs.AI 62%

R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory

R-Debater:通过论证记忆的检索增强辩论生成

Maoyuan Li, Zhongsheng Wang, Haoyuan Li, Jiamou Liu

机构 * Wuhan College of Communication(武汉通信学院) Wuhan College of Communication University of Auckland(武汉通信学院奥克兰大学) University of Auckland(奥克兰大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 R-Debater通过整合检索和结构化规划,实现了更忠实、一致且连贯的多轮辩论生成。

Comments Accepteed by AAMAS 2026 full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05646 2026-01-01 cs.LG cs.AI 62%

Lattice: Learning to Efficiently Compress the Memory

Lattice: 学习高效压缩内存

Mahdi Karami, Razvan Pascanu, Vahab Mirrokni

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Lattice通过正交更新机制,高效压缩内存,提升语言建模和联想回忆任务的性能与内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23675 2026-01-01 cs.LG 57%

End-to-End Test-Time Training for Long Context

端到端的测试时间训练用于长上下文

Arnuv Tandon, Karan Dalal, Xinhao Li, Daniel Koceja, Marcel Rød, Sam Buchanan, Xiaolong Wang, Jure Leskovec, Sanmi Koyejo, Tatsunori Hashimoto, Carlos Guestrin, Jed McCaleb, Yejin Choi, Yu Sun

机构 * NVIDIA(NVIDIA公司) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) UC San Diego(圣地亚哥大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种端到端的测试时间训练方法,通过在测试时进行token预测和训练时的元学习,实现长上下文处理,具有与完整注意力相同的扩展性但更高效的推理速度。

Comments Code: https://github.com/test-time-training/e2e

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24172 2026-01-01 cs.CV cs.LG 57%

Deep Global Clustering for Hyperspectral Image Segmentation: Concepts, Applications, and Open Challenges

超光谱图像分割的深度全局聚类:概念、应用与开放挑战

Yu-Tang Chang, Pin-Wei Chen, Shih-Fang Chen

机构 * Department of Biomechatronics Engineering(生物机电工程系) National Taiwan University(台湾国立大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 本文提出深度全局聚类框架,用于高效超光谱图像分割,通过局部块观测学习全局聚类结构,实现快速训练与稳定内存使用,同时在农业监测中展示出无监督疾病检测能力。

Comments 10 pages, 4 figures. Technical report extending ACPA 2025 conference paper. Code and data available at https://github.com/b05611038/HSI_global_clustering

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 27 篇

2508.00743 2026-01-01 cs.CL cs.AI cs.LG 90%

Multi-step retrieval and reasoning improves radiology question answering with large language models

多步检索与推理提升大型语言模型在放射学问答中的表现

Sebastian Wind, Jeta Sopa, Daniel Truhn, Mahshad Lotfinia, Tri-Thien Nguyen, Keno Bressem, Lisa Adams, Mirabela Rusu, Harald Köstler, Gerhard Wellein, Andreas Maier, Soroosh Tayebi Arasteh

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RaR通过多步检索与推理提升放射学问答中大型语言模型的诊断准确性和事实一致性。

Comments Published in npj Digital Medicine

Journal ref npj Digit. Med. 8, 790 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24661 2026-01-01 cs.CL cs.AI 90%

Do Large Language Models Know What They Are Capable Of?

大语言模型是否了解自己的能力?

Casey O. Barkan, Sid Black, Oliver Sourbut

机构 * RAND Corporation(RAND公司) UK AI Security Institute(英国人工智能安全研究所) The Future of Life Foundation(未来生命基金会)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在预测自身能力时存在过度自信,且随着任务推进可能恶化,但通过失败经验可部分缓解,揭示了其能力认知不足的问题。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24014 2026-01-01 cs.CL cs.AI 90%

iCLP: Large Language Model Reasoning with Implicit Cognition Latent Planning

iCLP: 基于隐式认知潜在规划的大语言模型推理

Sijia Chen, Di Niu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Alberta(阿尔伯塔大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 iCLP通过隐式认知潜在规划提升大语言模型的推理准确性和效率,实现跨领域泛化与可解释性。

Comments 9 pages, 6 figures. The source code is publicly available at https://github.com/AgenticFinLab/latent-planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23932 2026-01-01 cs.AI 89%

A Proof-of-Concept for Explainable Disease Diagnosis Using Large Language Models and Answer Set Programming

可解释疾病诊断的大型语言模型与答案集编程证明概念

Ioanna Gemou, Evangelos Lamprou

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究提出McCoy框架,结合大型语言模型与答案集编程,实现可解释的疾病诊断,初步结果显示其在小规模诊断任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22942 2026-01-01 cs.RO cs.AI 89%

AINav: Large Language Model-Based Adaptive Interactive Navigation

AINav: 基于大语言模型的自适应交互导航

Kangjie Zhou, Yao Mu, Haoyang Song, Yi Zeng, Pengying Wu, Han Gao, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院人工智能研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 AINav通过基于大语言模型的自适应交互导航方法,实现复杂环境中的路径规划与目标达成。

Comments 13 pages, 12 figures, accepted to IEEE Robotics & Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01930 2026-01-01 cs.RO 89%

Large Language Model-Driven Closed-Loop UAV Operation with Semantic Observations

基于大语言模型的闭环无人机操作与语义观测

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of CIS, University of Massachusetts Dartmouth(CIS系,马萨诸塞大学达特茅斯分校) Department of CSIS, California State University San Marcos(CSIS系,加州州立大学桑马科斯分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于大语言模型的闭环无人机操作框架,通过代码生成器和评估器实现可靠操作,提升复杂任务的成功率和完整性。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG 87%

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏