arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 218 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2601.03781 2026-01-08 cs.CV 89%

MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction

MVP: 通过自监督掩码视频预测增强视频大型语言模型

Xiaokun Sun, Zezhong Wu, Zewen Ding, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 MVP通过自监督掩码视频预测提升视频大语言模型的时间推理和因果理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11963 2026-01-08 cs.CL 88%

ToolRM: Outcome Reward Models for Tool-Calling Large Language Models

ToolRM: 用于工具调用大型语言模型的成果奖励模型

Mayank Agarwal, Ibrahim Abdelaziz, Kinjal Basu, Merve Unuvar, Luis A. Lastras, Yara Rizk, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ToolRM通过领域特定建模提升工具调用奖励模型性能,实现25%的改进并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03661 2026-01-08 cs.LG cs.AI 79%

AMIR-GRPO: Inducing Implicit Preference Signals into GRPO

AMIR-GRPO:将隐式偏好信号引入GRPO

Amir Hossein Yari, Fajri Koto

机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03608 2026-01-08 cs.IR cs.LG 77%

Shielded RecRL: Explanation Generation for Recommender Systems without Ranking Degradation

屏蔽的推荐强化学习:无需降级的推荐系统解释生成

Ansh Tiwari, Ayush Chauhan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 Shielded RecRL通过双塔架构和复合奖励信号,在不降低推荐准确性的情况下,提升推荐系统个性化解释的质量和用户交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03468 2026-01-08 cs.CV 75%

Understanding Reward Hacking in Text-to-Image Reinforcement Learning

理解文本到图像强化学习中的奖励黑客行为

Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 67%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 8 篇

2601.03417 2026-01-08 cs.CL 88%

Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models

隐式图,显式检索:迈向高效且可解释的长周期记忆 для 大语言模型

Xin Zhang, Kailai Yang, Hao Li, Chenyue Li, Qiyu Wei, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LatentGraphMem结合隐式图记忆与显式子图检索,实现高效且可解释的长周期记忆,提升大语言模型的推理能力与可解释性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24067 2026-01-08 cs.LG 83%

TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model

TransMamba: 一种序列级混合Transformer-Mamba语言模型

Yixing Li, Ruobing Xie, Zhen Yang, Xingwu Sun, Shuaipeng Li, Weidong Han, Zhanhui Kang, Yu Cheng, Chengzhong Xu, Di Wang, Jie Jiang

机构 * Tencent Hunyuan(腾讯文英) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 TransMamba通过共享参数矩阵统一Transformer和Mamba,实现序列级动态切换注意力与SSM机制,提升训练效率和性能。

Comments Accepted by AAAI 2026. Code: https://github.com/Yixing-Li/TransMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02659 2026-01-08 cs.CL cs.LG 81%

Empirical Comparison of Encoder-Based Language Models and Feature-Based Supervised Machine Learning Approaches to Automated Scoring of Long Essays

基于编码器的语言模型与基于特征的监督机器学习方法在长作文自动评分中的实证比较

Kuo Wang, Haowei Hua, Pengfei Yan, Hong Jiao, Dan Song

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究比较了基于编码器的语言模型与基于特征的监督机器学习方法在长作文自动评分中的表现,发现嵌入集成模型在评分效果上优于单一语言模型。

Comments 22 pages, 5 figures, 3 tables, presented at National Council on Measurement in Education 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03515 2026-01-08 cs.CL cs.AI 73%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 73%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13197 2026-01-08 cs.CL 70%

Text Anomaly Detection with Simplified Isolation Kernel

基于简化隔离核的文本异常检测

Yang Cao, Sikun Yang, Yujiu Yang, Lianyong Qi, Ming Liu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息科技学院) Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究学院) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) Dongguan Key Laboratory for Intelligence and Information Technology, China(东莞智能与信息技术重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Petroleum (East China), China(中国石油大学(华东)) School of IT, Deakin University(德肯大学信息科技学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出简化隔离核(SIK)方法,通过将高维嵌入转换为低维稀疏表示,提升文本异常检测的性能与效率。

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03618 2026-01-08 cs.DB 67%

The Pneuma Project: Reifying Information Needs as Relational Schemas to Automate Discovery, Guide Preparation, and Align Data with Intent

Pneuma项目:将信息需求作为关系模式来自动化发现、指导准备并使数据与意图一致

Muhammad Imam Luthfi Balaka, Raul Castro Fernandez

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract)

AI总结 Pneuma项目通过将信息需求转化为关系模式,利用语言模型实现自动化发现与文档生成,提升数据与意图的一致性。

Comments CIDR 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07782 2026-01-08 cs.LG 57%

GatedFWA: Linear Flash Windowed Attention with Gated Associative Memory

带有门控关联记忆的线性滑动窗口注意力

Jiaxu Liu, Yuhe Bai, Xiangyu Yin, Christos-Savvas Bouganis

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 GatedFWA是一种通过门控关联记忆机制提升滑动窗口注意力稳定性和梯度流动的高效注意力机制,适用于自回归模型和语言建模任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 44 篇

2512.00947 2026-01-08 cs.CL cs.AI 90%

Table as a Modality for Large Language Models

表格作为大语言模型的一种模态

Liyao Li, Chao Ye, Wentao Ye, Yifei Sun, Zhe Jiang, Haobo Wang, Jiaming Tian, Yiming Zhang, Ningtao Wang, Xing Fu, Gang Chen, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) University of Michigan(密歇根大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 TAMO通过将表格视为独立模态,结合文本令牌,提升大语言模型对表格数据的推理能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20707 2026-01-08 cs.CL cs.AI physics.ed-ph 90%

Dissecting Physics Reasoning in Small Language Models: A Multi-Dimensional Analysis from an Educational Perspective

解构小型语言模型中的物理推理:从教育视角的多维分析

Nicy Scaria, Silvester John Joseph Kennedy, Krishna Agarwal, Diksha Seth, Deepak Subramani

机构 * Computational and Data Sciences, Indian Institute of Science, India(计算机与数据科学,印度科学研究院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 本文从教育视角出发,通过Physbench评估了小型语言模型在物理推理中的可靠性,发现其在多步骤推理中存在显著的可靠性缺口,且失败模式随模型能力变化,强调评估需更注重推理过程而非最终答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03287 2026-01-08 cs.CR cs.AI 89%

Automated Post-Incident Policy Gap Analysis via Threat-Informed Evidence Mapping using Large Language Models

通过大语言模型进行威胁感知证据映射的自动事后政策差距分析

Huan Lin Oh, Jay Yong Jun Jie, Mandy Lee Ling Siu, Jonathan Pan

机构 * Nanyang Technological University, Singapore(南洋理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型进行威胁感知证据映射,实现自动事后政策差距分析,提升网络安全事件审查的效率与可审计性。

Comments 5 pages, 1 figure. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03542 2026-01-08 cs.CL cs.AI 88%

Layer-Order Inversion: Rethinking Latent Multi-Hop Reasoning in Large Language Models

层序倒置:重新思考大语言模型中的潜在多跳推理

Xukai Liu, Ye Liu, Jipeng Zhang, Yanghai Zhang, Kai Zhang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出"层序倒置"现象,通过概率性回忆与提取框架解释大语言模型中多跳推理的机制,揭示了层序倒置与总跳步数的关系,并提供了多跳失败的诊断方法。

Comments 16 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19640 2026-01-08 cs.CL 88%

Interleaved Reasoning for Large Language Models via Reinforcement Learning

通过强化学习实现大型语言模型的交错推理

Roy Xie, David Qiu, Deepak Gopinath, Dong Lin, Yanchao Sun, Chong Wang, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过强化学习实现大型语言模型的交错推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03589 2026-01-08 cs.CL 87%

OLA: Output Language Alignment in Code-Switched LLM Interactions

OLA:代码切换交互中的输出语言对齐

Juhyun Oh, Haneul Yoo, Faiz Ghifari Haznitrama, Alice Oh

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03775 2026-01-08 cs.CL 85%

Do LLM Self-Explanations Help Users Predict Model Behavior? Evaluating Counterfactual Simulatability with Pragmatic Perturbations

LLM自我解释是否有助于用户预测模型行为?通过语用扰动评估反事实可模拟性

Pingjun Hong, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(计算机科学系,维也纳大学) UniVie Doctoral School Computer Science, University of Vienna(UniVie 计算机科学博士学院,维也纳大学) Faculty of Philological and Cultural Studies, University of Vienna(文学与文化研究系,维也纳大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过语用扰动评估LLM自我解释对用户预测模型行为的帮助,发现自我解释能提升模拟准确性,但效果受扰动策略和评判者能力影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03285 2026-01-08 physics.ed-ph cs.AI 85%

Feedback Indices to Evaluate LLM Responses to Rebuttals for Multiple Choice Type Questions

反馈指数用于评估LLM对多项选择题反驳的响应

Justin C. Dunlap, Anne-Simone Parent, Ralf Widenhorn

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出反馈指数评估LLM对多项选择题反驳的响应,通过分析谄媚和固执行为,揭示模型在不同世代间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02110 2026-01-08 cs.AI 85%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23314 2026-01-08 cs.AI cs.CL cs.LG cs.MA 85%

SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science

SPIO:基于LLM的多智能体规划的集成与选择策略在自动化数据科学中的应用

Wonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * Enhans Peking University(北京大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIO通过基于LLM的多智能体规划,在自动化数据科学中实现了集成与选择策略,提升了流程的灵活性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17394 2026-01-08 cs.CL cs.CV cs.CY 83%

Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?

视觉语言模型是否是跨文化理论思维推理者?

Zabir Al Nazi, GM Shahariar, Md. Abrar Hossain, Wei Peng

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21318 2026-01-08 cs.AI 83%

Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations

超越化学问答:利用模块化化学操作评估LLM的化学推理

Hao Li, He Cao, Bin Feng, Yanjun Shao, Xiangru Tang, Zhiyuan Yan, Li Yuan, Yonghong Tian, Yu Li

机构 * Pengcheng Laboratory(鹏城实验室) International Digital Economy Academy(国际数字经济学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of AI for Science, Peking University(北京大学科学人工智能学院) Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ChemCoTBench框架,通过模块化化学操作评估LLM在化学推理中的能力,解决分子优化和反应预测等复杂任务。

Comments Accepted by NeurIPS 2025 Dataset Track, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13935 2026-01-08 cs.CL cs.AI 82%

Big Reasoning with Small Models: Instruction Retrieval at Inference Time

大模型的推理:推理时的指令检索

Kenan Alkiek, David Jurgens, Vinod Vydiswaran

机构 * School of Information University of Michigan(信息学院 华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);SLM(abstract);prompting(abstract)

AI总结 本文提出一种在推理时通过检索结构化指令来增强小型模型推理能力的方法,通过领域背景与分步程序的配对,提升模型在医学、法律和数学等领域的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03500 2026-01-08 cs.CV cs.AI 79%

SDCD: Structure-Disrupted Contrastive Decoding for Mitigating Hallucinations in Large Vision-Language Models

SDCD: 结构破坏对比解码用于缓解大视觉-语言模型中的幻觉

Yuxuan Xia, Siheng Wang, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 SDCD通过结构破坏对比解码缓解大视觉-语言模型中的幻觉问题,有效抑制纹理驱动偏见,提升多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14540 2026-01-08 cs.AI 77%

VERUS-LM: a Versatile Framework for Combining LLMs with Symbolic Reasoning

VERUS-LM:一种结合大语言模型与符号推理的多功能框架

Benjamin Callewaert, Simon Vandevelde, Joost Vennekens

机构 * Leuven.AI -- KU Leuven Institute for AI(Leuven.AI — 哥伦比亚大学莱顿人工智能研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 VERUS-LM通过结合大语言模型与符号推理,提升复杂推理任务的适应性与效率,实现更广泛的推理能力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 47-62

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 77%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏