arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-26 至 2026-08-26 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 25 篇

2608.24482 2026-08-26 cs.LG cs.AI cs.CL 新提交 91%

Beyond Static Interpretability: Anticipating Post-SFT Mechanisms from Pre-SFT Parameters for Better Tuning

超越静态可解释性:基于预SFT参数预测后SFT机制以实现更优微调

Hang Chen, Jiaying Zhu, Wenya Wang

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Computer Science and Engineering(计算机科学与工程学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :SFT(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对传统机制可解释性无法在训练前识别任务关键机制的局限,提出前瞻性定位框架,结合双粒度定位流程,实现了更优的SFT指导与稳健的可扩展性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24224 2026-08-26 cs.HC 新提交 90%

Aura: Dynamic Intra-Turn Emotion-Aware Adaptation of Large Language Model Responses

Aura:大型语言模型响应的轮内动态情感感知适配

Rachel Schuchert, Christian Holz

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出Aura框架,通过感知用户情绪、概率信念模型选干预、LoRA适配器定制响应,经20人用户研究,较Llama-3提升学习增益、减21%交互时间,优化人机交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-26 cs.AI cs.CL cs.CV cs.MM 版本更新 90%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02304 2026-08-26 cs.AI cs.LG 版本更新 90%

Comparing Explanations is Not Enough, Explain the Change: New Standards are Needed to Explain Behavioral Shifts in Large Language Models

比较解释并不足够,解释变化:需要新的标准来解释大型语言模型中的行为转变

Martino Ciaperoni, Marzio Di Vece, Roberto Pellungrini, Luca Pappalardo, Fosca Giannotti, Francesco Giannini

机构 * Scuola Normale Superiore(诺莱学院) ISTI-CNR(意大利国家研究委员会ISTI研究所) University of Pisa(比萨大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的XAI方法,旨在解释大型语言模型在干预后行为转变的原因和机制,以应对现有解释方法无法解释行为转变的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23959 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 89%

NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution

NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。

Comments To appear in EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08873 2026-08-26 cs.AI 版本更新 88%

UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models

UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24168 2026-08-26 cs.CL cs.SD 新提交 85%

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

FireRedAudio:一种具有解耦连续表示的通用音频语言模型,用于理解与生成

Junjie Li, Xuelong Geng, Kun Xie, Feiyu Shen, Yichen Wu, Ziqi Dai, Yichen Han, Yan Jia, Kai Huang, Junjie Chen, Yixuan Li, Manzhen Wei, Fenglong Xie, Lei Xie, Xu Tang, Yao Hu

机构 * Xiaohongshu(小红书)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 FireRedAudio是首个公开的统一音频-语言模型,采用解耦连续表示,支持音频理解、多语种ASR、各类TTS及语音编辑,性能优于相关模型。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24310 2026-08-26 cs.AI 新提交 81%

OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning

OPDSearch+:用于搜索增强推理的带RL优化的在线策略蒸馏

Qinglin Ye, Zhiyuan Gu, Jingjie Xia, Yiheng Zhang, Kaiyan Zhao, Shunchao Zheng, Yuhang Mu, Wenchao Du, Yiming Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) Wuhan University(武汉大学) Georgia Institute of Technology(佐治亚理工学院) Northwestern Polytechnical University(西北工业大学) University of Hong Kong(香港大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 OPDSearch+是无需教师微调的搜索增强推理蒸馏范式,利用冻结的现成指令模型分两阶段优化3B模型,在7个QA基准上优于所有3B RL基线,HotpotQA和2WikiMultihopQA分别提升13.1%、8.5%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04469 2026-08-26 cs.CL 版本更新 79%

Don't Commit Alone: Joint Token Commitment in Diffusion Language Models

不要单独提交:扩散大语言模型中的联合令牌提交

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhongguancun Academy(中关村科学城)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 研究扩散大语言模型中多令牌提交问题,提出CoCommit方法,通过标记门控协调步骤延迟提交,重新应用骨干网络最后n层使标记位置协调,近似联合模式解码,提高推理和精确答案任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10277 2026-08-26 cs.LG 版本更新 79%

Lightweight Adaptive Feature Composition for Heterogeneous Downstream Adaptation of Wireless Foundation Models

无线基础模型中多任务泛化的统一自适应特征组合框架

Yuxuan Shi, Tingting Yang, Li Sun, Liwen Jing, Kangning Ma, Yuwei Wang, Mengfan Zheng

机构 * Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) Purple Mountain Laboratories(紫金山实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出RAFC路由适配器,通过轻量级任务驱动网络动态组合Transformer各层隐藏特征,实现无线基础模型的多任务泛化,仅增加少于50K参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22293 2026-08-26 cs.LG physics.geo-ph 版本更新 79%

Topology enables learning-based hydrodynamic prediction of the global river system

基于拓扑信息的AI基础模型实现全球河流预报

Hancheng Ren, Gang Zhao, Shuo Wang, Louise Slater, Dai Yamazaki, Shu Liu, Jingfang Fan, Xueying Li, Shibo Cui, Ziming Yu, Shengyu Kang, Depeng Zuo, Dingzhi Peng, Zongxue Xu, Bo Pang

机构 * College of Water Sciences, Beijing Normal University, Beijing, China(北京师范大学水科学学院) School of Geography and the Environment, University of Oxford, Oxford, UK(牛津大学地理与环境学院) Department of Transdisciplinary Science and Engineering, Institute of Science Tokyo, Tokyo, Japan(东京科学研究所跨学科科学与工程系) School of Systems Science, Beijing Normal University, Beijing, China(北京师范大学系统科学学院) Institute of Industrial Science, University of Tokyo, Tokyo, Japan(东京大学工业科学研究所) China Institute of Water Resources and Hydropower Research, Beijing, China(中国水利水电科学研究院) State Key Laboratory of Hydro-Science and Engineering, Department of Hydraulic Engineering, Tsinghua University, Beijing, China(清华大学水利科学与工程国家重点实验室) School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) School of Water Resources and Hydropower Engineering, Wuhan University, Wuhan, China(武汉大学水利水电学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 GraphRiverCast通过拓扑信息和物理对齐的神经操作符架构,实现了全球河流系统的系统性水动力模拟,无需历史数据即可进行稳健预测。

Comments 21 pages, 4 figures. Main text only; the supplementary materials accompany the journal version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-08-26 cs.CV cs.AI 版本更新 77%

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23897 2026-08-26 cs.CL cs.AI 新提交 73%

Names Can Hurt: Spotting Slopsquatting Risks Caused by Package Name Hallucinations in Local Coding LLMs

名称会造成危害:检测本地编码大语言模型中包名幻觉引发的slopsquatting风险

Akash Raj, Sargam Sahu

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对本地编码大语言模型的包名幻觉引发的slopsquatting风险,提出双层检测器结合LangGraph状态机,在300个提示词上实现76%无幻觉代码,用户满意度达4.4分,21/24用户有采用意向。

Comments 14 pages, 2 figures, 6 tables. Code and data at this https URL (https://github.com/sargamsahu1011/package-hallucination-detector)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13705 2026-08-26 cs.LG cs.AI 版本更新 73%

When Can One Neuron Fix Repetition Loops in LLMs?

编辑1个神经元能修复LLM中的重复循环吗?

Aristotelis Lazaridis, Aman Sharma, Dylan Bates, Brian King, Vincent Lu, Jack FitzGerald

机构 * Edgerunner AI

专题命中 指令微调 :LLM(title_cn);分类 cs.AI、cs.LG

AI总结 本文发现Gemma 4模型在长事实列举任务中高达95%的概率陷入重复循环,通过逐层消融和逐神经元归因定位到少量MLP神经元,并用静态权重编辑(小至单个神经元符号反转)消除循环,但无法解决因知识缺失导致的“末日循环”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24041 2026-08-26 cs.AI 新提交 70%

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

用于词级时间戳标注的相对时间间隔表示:基于掩码训练

Quanwei Tang, Zhiyu Tang, Xu Li, Dong Zhang, Shoushan, Guodong Zhou

机构 * Soochow University(苏州大学) University of Queenland(昆士兰大学) AISpeech Ltd(思必驰科技有限公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对SpeechLLMs时间对齐输出能力不足的问题,提出用相对时间戳替代绝对时间戳,结合混合微调策略与掩码训练目标,在提升时间戳预测准确率的同时保持了语音转录性能。

Comments ICASSP2026 Accpeted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23664 2026-08-26 cs.CV cs.LG 新提交 70%

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

通过速度匹配扩展扩散模型的强化学习

Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出基于奖励的速度匹配(RVM)方法,用于扩散模型的奖励微调,其训练成本显著降低,性能优于或相当基于轨迹的策略梯度方法,还通过动态跟踪奖励改善了视频生成的运动效果。

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10243 2026-08-26 cs.CL 版本更新 70%

GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning

GR-SAP: 生成性重放用于在微调过程中保持安全对齐

Zhouxiang Fang, Jiawei Zhou, Hanjie Chen

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GR-SAP通过生成领域特定对齐数据来保持微调过程中的安全对齐,有效缓解了微调导致的安全退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24209 2026-08-26 cs.MM 新提交 67%

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

面向统一框架内多模态视听学习任务的任务解耦低秩适配方法

Hanyu Xuan, Mengqi Zhang, Junjun Mao, Fei Wang, Kun Li, Guanghui Yue, Zhiliang Wu, Hehe Fan

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出统一框架下的任务解耦低秩适配(LoRA)机制,解决多视听任务联合训练的干扰问题,在多项视听任务上优于现有统一模型及部分任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24188 2026-08-26 cs.AI cs.CL cs.LG cs.SE 新提交 67%

Paritok-4B: Intent-Conditioned Context Compression for Coding Agents

Paritok-4B:面向编码智能体的意图条件上下文压缩模型

Jiayu Shi, Luzhuo Chen

机构 * Paritok

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对编码智能体上下文占比过高的问题,提出意图条件抽取式压缩模型 Paritok-4B,在 SWE-bench Lite 上实现高压缩率的同时,未显著降低求解率,且成本更低、可自托管。

Comments 20 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23830 2026-08-26 cs.CL cs.LG 新提交 62%

Mitigating Exploration Bias in RL for Multi-Instruction Following

缓解多指令遵循强化学习中的探索偏差

Mian Zhang, Yueqin Yin, Kaiyu He, Peilin Wu, Xinlu Zhang, Mingyuan Zhou, Zhiyu Zoey Chen

机构 * UT Dallas(德克萨斯大学达拉斯分校) UT Austin(德克萨斯大学奥斯汀分校) UC Santa Barbara(加利福尼亚大学圣巴巴拉分校)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 针对多指令遵循RL中偏向简单指令的探索偏差,本文提出两个衡量指标与含行为引导、稀缺感知奖励的两阶段框架,在三个基准上显著优于基线。

Comments EMNLP 2026 Acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20054 2026-08-26 cs.AI cs.LG cs.MA 版本更新 62%

What You Can't See Is What You Learn: Slot-Selective Evidence Masking Favors Compositional Generalization in Shared-Genome Language-Model Societies

你看不见的是你所学的:受限证据可见性有利于共享基因组语言模型社群中的组合泛化

Narcis Marincat

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究受限证据可见性对共享基因组语言模型社群的影响,发现受限可见性可显著提升组合泛化能力,虽未通过完整预注册测试,但利于形成可重用的值索引接口。

Comments 20 pages, 3 figures, 5 tables. v3: corrective revision -- title updated; attribution narrowed to the masking regime (visibility-alone claim awaits a role-marked control); mask-crossover diagnostic added. Code: this https URL (https://github.com/tokenosopher/populus-evidence-partitioning); checkpoints: this https URL (https://huggingface.co/tokenosopher/populus-evidence-partitioning-checkpoints)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24133 2026-08-26 cs.CV cs.AI cs.IR 新提交 57%

PlaceSeek: Human-Centered Geospatial Retrieval of Urban Outdoor Places via Semantic Grounding and Affective Alignment

PlaceSeek:通过语义 grounding 与情感对齐实现以人类为中心的城市户外地点地理空间检索

Ziqi Cui, Shangyu Lou

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) San Diego State University(圣地亚哥州立大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 该研究针对现有地理空间检索难以满足情感/活动类需求的问题,提出 PlaceSeek 框架,通过语义 grounding 与情感对齐实现城市户外地点检索,在米兰数据集上的表现优于多种基线方法。

Comments Accepted as a Research Paper (short) at ACM SIGSPATIAL 2026. This arXiv version is the full version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23812 2026-08-26 cs.CL 新提交 57%

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

从偏好到原则:基于评分规则的接地知识答案对齐

Aman Saini, Priyanshu Kumar, Eric Peng, Kai Yuan, Harsh Girase, Wanming Chen

机构 * Apple(苹果公司)

专题命中 指令微调 :post-training(abstract);分类 cs.CL

AI总结 本研究针对开放域问答的奖励信号设计难题,提出基于检索证据生成查询特定多维评分规则的奖励框架,经实验验证其比基线方法有显著性能提升,为复杂开放域问答提供更有效的奖励监督。

Comments 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23807 2026-08-26 cs.AI 新提交 57%

Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

部署掩码扩散大语言模型:基于真实硬件的特性分析与设计原则

Farhana Amin, Sabiha Afroz, Mona Moghadampanah, Dimitrios S. Nikolopoulos

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文通过真实硬件实验分析LLaDA-8B-Instruct等dLLM的部署特性,发现其请求步数离散、批处理可分摊CPU开销等规律,提出适配dLLM的部署设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07922 2026-08-26 cs.LG cs.DC 版本更新 57%

SketchGuard: Scaling Byzantine-Robust Decentralized Federated Learning via Sketch-Based Screening

SketchGuard:基于 Sketch 筛选实现可扩展的拜占庭鲁棒去中心化联邦学习

Murtaza Rangwala, Farag Azzedin, Richard O. Sinnott, Rajkumar Buyya

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Department of Information and Computer Science, King Fahd University of Petroleum and Minerals(国王法赫德石油与矿物大学信息与计算机科学系)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 SketchGuard 是一种基于 Sketch 筛选的拜占庭鲁棒去中心化联邦学习方法,修复了 naive 实现的安全漏洞,可在保证鲁棒性的同时降低通信开销,适用于多种攻击和任务场景。

Comments 14 pages, Code Available: this https URL (https://github.com/murtazahr/sketchguard)

详情

展开后加载摘要…

URL PDF HTML 收藏