arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-03 至 2025-12-03 共收录 179 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2512.02807 2025-12-03 cs.CL 88%

SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment

SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03317 2025-12-03 cs.CV 78%

Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models

Diffusion-SDPO:用于扩散模型的受保护直接偏好优化

Minghao Fu, Guo-Hua Wang, Tianyu Cui, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 Diffusion-SDPO通过保护性更新规则提升扩散模型对人类偏好的对齐效果。

Comments The code is publicly available at https://github.com/AIDC-AI/Diffusion-SDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02882 2025-12-03 cs.LG cs.AI cs.CL 75%

OptPO: Optimal Rollout Allocation for Test-time Policy Optimization

OptPO:测试时间策略优化的最优回放分配

Youkang Wang, Jian Wang, Rubing Chen, Tianyi Zeng, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptPO通过自适应分配推理预算,结合贝叶斯序列概率比率检验实现测试时间策略优化,减少回放开销并提高准确性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02631 2025-12-03 cs.LG 70%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06942 2025-12-03 cs.CL cs.CR 70%

HLPD: Aligning LLMs to Human Language Preference for Machine-Revised Text Detection

HLPD: 通过人类语言偏好对齐大语言模型以检测机器修订文本

Fangqi Dai, Xingjian Jiang, Zizhuang Deng

专题命中 后训练与偏好优化 :LLM(abstract);preference optimization(abstract);分类 cs.CL

AI总结 HLPD通过人类语言偏好优化提升机器修订文本检测性能,实现对GPT系列模型和先进大语言模型生成文本的高效识别。

Comments 20 pages, 10 figures, accepted by AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 10 篇

2512.03001 2025-12-03 cs.AI 90%

Invasive Context Engineering to Control Large Language Models

侵入式上下文工程以控制大语言模型

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出侵入式上下文工程方法,通过在LLM上下文中插入控制句子以提升其安全性,避免长上下文场景下的数据短缺问题。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02445 2025-12-03 cs.LG cs.AI cs.CL 87%

When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents

当拒绝失效时:长上下文LLM代理中的不稳定安全机制

Tsimur Hadeliya, Mohammad Ali Jauhar, Nidhi Sakpal, Diogo Cruz

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现长上下文LLM代理在性能和拒绝率上存在不稳定安全问题,揭示了评估长多步骤任务代理安全性的挑战。

Comments 12 pages, 11 figures. Accepted at AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02228 2025-12-03 cs.AI cs.LG 86%

STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls

STRIDE:一种选择AI模态的系统框架——代理AI、AI助手或LLM调用

Shubhi Asthana, Bing Zhang, Chad DeLuca, Ruchi Mahindru, Hima Patel

机构 * IBM Research – Almaden(IBM阿尔马登研究实验室) IBM Research – Yorktown(IBM约克镇研究实验室) IBM Research – India(IBM印度研究实验室)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 STRIDE提供了一种系统框架,帮助选择AI模态,通过评估任务动态性决定是否使用自主代理,提升效率并降低成本。

Comments 10 pages, 4 Figures, 5 Tables Paper presented at NeurIPS 2025 LAW workshop: Bridging Language, Agent, and World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02665 2025-12-03 cs.CL 85%

Input Order Shapes LLM Semantic Alignment in Multi-Document Summarization

输入顺序影响多文档摘要中LLM语义对齐

Jing Ma

机构 * University of Zurich(苏黎世大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现输入顺序显著影响LLM在多文档摘要中的语义对齐,优先位置的文章对摘要的语义相似性有显著影响。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15450 2025-12-03 cs.CL 83%

SkyLadder: Better and Faster Pretraining via Context Window Scheduling

SkyLadder: 通过上下文窗口调度实现更优更高效的预训练

Tongyao Zhu, Qian Liu, Haonan Wang, Shiqi Chen, Xiangming Gu, Tianyu Pang, Min-Yen Kan

机构 * National University of Singapore(新加坡国立大学) Sea AI Lab(Sea AI实验室) City University of Hong Kong(香港城市大学)

专题命中 长上下文与记忆 :pretraining(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SkyLadder通过上下文窗口调度策略,在保持基准性能的同时,提升了长上下文任务的表现,并加快了训练速度。

Comments Accepted to NeurIPS 2025. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02720 2025-12-03 cs.AI cs.LG 73%

StockMem: An Event-Reflection Memory Framework for Stock Forecasting

StockMem: 一种用于股票预测的事件反射内存框架

He Wang, Wenyilin Xiao, Songqiao Han, Hailiang Huang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 StockMem通过事件反射双层内存框架,有效整合事件信息与价格动态,提升股票预测的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02363 2025-12-03 cs.CL cs.AI 73%

Memory-Augmented Knowledge Fusion with Safety-Aware Decoding for Domain-Adaptive Question Answering

具有安全意识解码的记忆增强知识融合用于领域自适应问答

Lei Fu, Xiang Chen, Kaige Gao Xinyue Huang, Kejian Tong

机构 * Independent Researcher(独立研究者) Boston University(波士顿大学) Binghamton University(伯克利大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过记忆增强和安全意识解码提升领域自适应问答的准确性和安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02337 2025-12-03 cs.LG 70%

SpecPV: Improving Self-Speculative Decoding for Long-Context Generation via Partial Verification

SpecPV:通过部分验证改进长上下文生成的自我推测解码

Zhendong Tan, Xingjun Zhang, Chaoyi Hu, Junjie Peng, Kun Xia

机构 * School of Computer Science and Technology, Xi'an Jiaotong University, Xi'an, China(计算机科学与技术学院,西安交通大学,西安,中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SpecPV通过部分验证和周期性完整验证提升长上下文生成效率,实现6倍解码加速

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02329 2025-12-03 cs.SE 67%

Towards autonomous normative multi-agent systems for Human-AI software engineering teams

迈向自主规范的多智能体系统用于人机软件工程团队

Hoa Khanh Dam, Geeta Mahala, Rashina Hoda, Xi Zheng, Cristina Conati

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出自主规范的多智能体系统,通过大型语言模型赋能,实现人机协作的高效软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11856 2025-12-03 cs.IR 67%

Telco-oRAG: Optimizing Retrieval-augmented Generation for Telecom Queries via Hybrid Retrieval and Neural Routing

Telco-oRAG: 通过混合检索与神经路由优化电信查询的检索增强生成

Andrei-Laurentiu Bornea, Fadhel Ayed, Antonio De Domenico, Nicola Piovesan, Tareq Si Salem, Ali Maatouk

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 Telco-oRAG通过混合检索与神经路由优化,提升电信领域问题回答的准确性和效率,实现开源大模型在电信基准测试中接近GPT-4水平。

Comments 12 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 26 篇

2512.02246 2025-12-03 cs.CL cs.AI 91%

DETAIL Matters: Measuring the Impact of Prompt Specificity on Reasoning in Large Language Models

DETAIL 重要性:测量提示特定性对大语言模型推理的影响

Olivia Kim

机构 * Emory University(埃默里大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过DETAIL框架研究提示特定性对大语言模型推理性能的影响,发现特定性提升准确性,尤其对小型模型和程序性任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07646 2025-12-03 cs.CL cs.AI 90%

On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data

大型语言模型在匿名数据上的时间问答能力研究

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JP Morgan Chase(人工智能研究, 花旗集团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在匿名数据上的时间推理能力,开发了RATA数据集并比较了多种方法,发现需要集成方法而非单一LLM。

Comments 18 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02499 2025-12-03 cs.AI 89%

COPE: Chain-Of-Thought Prediction Engine for Open-Source Large Language Model Based Stroke Outcome Prediction from Clinical Notes

COPE:基于开源大语言模型的链式推理预测引擎用于从临床笔记预测中风结局

Yongkai Liu, Helena Feng, Bin Jiang, Yixin Wang, Max Wintermark, David S. Liebeskind, Michael Moseley, Maarten Lansberg, Gregory Albers, Jeremy Heit, Greg Zaharchuk

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 COPE通过链式推理框架从临床笔记预测中风预后,优于现有模型,提供轻量级且可解释的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02987 2025-12-03 cs.CL cs.AI 88%

Fine-Tuned Large Language Models for Logical Translation: Reducing Hallucinations with Lang2Logic

针对逻辑翻译的微调大型语言模型:通过Lang2Logic减少幻觉

Muyu Pan, Dheeraj Kodakandla, Mahfuza Farooque

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种通过微调大型语言模型来减少逻辑翻译中幻觉的框架,利用自定义语法和符号计算库生成可靠的合取范式。

Comments IEEE ISNCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02677 2025-12-03 cs.AI 88%

Exploring Depth Generalization in Large Language Models for Solving Recursive Logic Tasks

探索大型语言模型在解决递归逻辑任务中的深度泛化能力

Zhiyuan He

机构 * Zhiyuan He(He)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出了一种循环定位和替换流程,用于解决大型语言模型在递归逻辑任务中的深度泛化问题,通过分解递归问题并利用两个专门模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02841 2025-12-03 cs.CL cs.AI cs.HC cs.LG 87%

Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages

跨语言提示引导性:迈向跨语言的准确且稳健的大语言模型行为

Lechen Zhang, Yusheng Zhou, Tolga Ergen, Lajanugen Logeswaran, Moontae Lee, David Jurgens

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) LG AI Research(LG人工智能研究)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种统一的四维评估框架,通过大规模实验揭示了提示组件对跨语言行为的影响,并开发了提示优化框架以提升多语言LLM的准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01830 2025-12-03 cs.CV 87%

OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic

OpenREAD: 基于LLM作为批评者的开放性推理端到端自动驾驶框架

Songyan Zhang, Wenhui Huang, Zhan Chen, Chua Jiahao Collister, Qihang Huang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学) Harvard University, USA(哈佛大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 OpenREAD通过端到端强化微调框架,结合LLM作为批评者,提升自动驾驶中的推理与规划能力,实现从高层推理到低层轨迹规划的全面优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16264 2025-12-03 cs.CL cs.AI cs.HC cs.LG 86%

ParlAI Vote: A Web Platform for Analyzing Gender and Political Bias in Large Language Models

ParlAI Vote:一个用于分析大型语言模型中性别和政治偏见的网络平台

Wenjie Lin, Hange Liu, Yingying Zhuang, Xutao Mao, Jingwei Shi, Xudong Han, Tianyu Shi, Jinrui Yang

机构 * Purdue University(普渡大学) Johns Hopkins University(约翰霍普金斯大学) Vanderbilt University(范德比大学) University of Toronto(多伦多大学) The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 ParlAI Vote是一个用于分析大型语言模型中性别和政治偏见的网络平台,通过可视化和交互功能揭示LLMs在政治分析中的系统性偏见。

Comments online demo: https://euro-parl-vote-demo.vercel.app/; Video: https://www.youtube.com/@Jinrui-sf2jg

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13352 2025-12-03 cs.AI cs.RO 85%

Agentic UAVs: LLM-Driven Autonomy with Integrated Tool-Calling and Cognitive Reasoning

智能无人机:基于大语言模型的自主性与集成工具调用和认知推理

Anis Koubaa, Khaled Gabr

机构 * AlfaisalX: Center of Excellence of Cognitive Robotics and Autonomous Agents(阿尔法西尔研究中心:认知机器人与自主代理中心) Alfaisal University(阿尔法西尔大学) Prince Sultan University(普森大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Agentic UAVs框架,利用大语言模型实现无人机的高自主性与外部系统集成,通过模拟实验验证其在搜索救援任务中的有效性。

Comments 17 pages, 2 figure

Journal ref The International Conference on Smart Systems and Emerging Technologies (SmartTech 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02389 2025-12-03 cs.AI cs.LG 84%

Synthetic Error Injection Fails to Elicit Self-Correction In Language Models

合成错误注入无法在语言模型中引发自我修正

David X. Wu, Shreyas Kapur, Anant Sahai, Stuart Russell

机构 * ucb(伯克利大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现合成错误注入无法有效提升语言模型的自我修正能力,揭示了策略性强化学习在激发自我修正方面的独特优势。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01155 2025-12-03 cs.SE cs.AI 81%

Beyond Greenfield: The D3 Framework for AI-Driven Productivity in Brownfield Engineering

超越Greenfield:面向Brownfield工程的D3框架:AI驱动的生产力框架

Krishna Kumaar Sharma

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出D3框架,通过双代理提示架构提升Brownfield工程中LLM的应用效果,实验证明在遗留系统探索、文档重建等任务中,AI辅助显著提升生产力和减少认知负荷。

Comments 53 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17238 2025-12-03 cs.LG 81%

Training a Scientific Reasoning Model for Chemistry

为化学训练一个推理模型

Siddharth M. Narayanan, James D. Braza, Ryan-Rhys Griffiths, Albert Bou, Geemi Wellawatte, Mayk Caldas Ramos, Ludovico Mitchener, Samuel G. Rodriques, Andrew D. White

机构 * FutureHouse Inc.(FutureHouse公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种基于强化学习的推理模型,用于化学领域,能高效处理多种化学任务,超越现有模型和人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02405 2025-12-03 cs.CV cs.AI cs.LG 79%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02185 2025-12-03 cs.CL cs.AI cs.LG 78%

Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models

在行动前剪枝:面向推理语言模型的自反思结构剪枝

Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Guanchu Wang, Minwoo Lee, Shu-ping Yeh, Li Yang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学) Intel Corporation(英特尔公司)

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 RESP通过自反思结构化剪枝框架,在保持推理连贯性的同时显著提升稀疏度下的性能

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00360 2025-12-03 cs.PL 78%

ChopChop: a Programmable Framework for Semantically Constraining the Output of Language Models

ChopChop: 一种可编程框架,用于对语言模型输出进行语义约束

Shaan Nagy, Timothy Zhou, Nadia Polikarpova, Loris D'Antoni

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 ChopChop是一种可编程框架,通过语义约束提升语言模型输出的正确性和类型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏