arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 464 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 464 篇

2606.05693 2026-06-16 cs.LG cs.IR 版本更新 86%

MolE-RAG: Molecular Structure-Enhanced Retrieval-Augmented Generation for Chemistry

MolE-RAG:面向化学的分子结构增强检索增强生成

Joey Chan, Wonbin Kweon, Ashley Shin, Niharika Bhattacharjee, Pengcheng Jiang, Yue Guo, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出无需训练的分子中心检索增强生成框架MolE-RAG,通过整合检索文献、分子特定信息和结构相似分子三种上下文,显著提升LLM在分子性质预测任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04976 2026-06-15 cs.CV cs.AI 版本更新 86%

3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding

3D-RFT:基于视频的3D场景理解的强化微调

Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出3D-RFT框架,将可验证奖励的强化学习(RLVR)扩展到视频3D感知与推理,通过直接优化评估指标(如3D IoU和F1分数)提升性能,4B模型超越8B模型。

Comments Accepted at ICML 2026. Project page: https://3d-rft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06196 2026-06-15 cs.CL cs.HC 版本更新 86%

EiCAP: Beyond Fluency, Probing and Improving Emotional Intelligence in LLMs via Psychologically Grounded Multi-Turn Dialogue

EiCAP:超越流畅性,通过心理学基础的多轮对话探究和提升大语言模型的情感智能

Nizi Nazar, Pardis Sadat Zahraei, Dilek Hakkani-Tür, Natasa Milic-Frayling, Ehsaneddin Asgari

机构 * Qatar Computing Research Institute (QCRI), Hamad Bin Khalifa University(卡塔尔计算研究所(QCRI),哈马德·本·卡伊夫大学) University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于心理学六层情感智能分类法的EiCAP框架,包含评估基准EiCAP-Bench和微调语料EiCAP-SFT,发现通用对话微调不提升情感智能,而基于情感智能的LoRA微调显著提升模型在所有24个子类别上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14717 2026-06-10 cs.CL 版本更新 86%

What Really Matters for Table LLMs? A Meta-Evaluation of Model and Data Effects

表格LLM真正重要的是什么?模型与数据影响的元评估

Naihao Deng, Sheng Zhang, Henghui Zhu, Shuaichen Chang, Jiani Zhang, Alexander Hanbo Li, Chung-Wei Hang, Hideo Kobayashi, Yiqun Hu, Patrick Ng

机构 * University of Michigan(密歇根大学) AWS AI Labs(AWS人工智能实验室) Figma OKX Google(谷歌)

专题命中 指令微调 :LLM(title_cn,abstract);foundation model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 通过指令微调12个模型并在16个基准上评估,发现基座模型选择比训练数据对性能影响更大,泛化与推理仍是挑战。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26176 2026-06-09 cs.DB cs.CL 版本更新 86%

CacheRAG: A Semantic Caching System for Retrieval-Augmented Generation in Knowledge Graph Question Answering

CacheRAG:面向知识图谱问答中检索增强生成的语义缓存系统

Yushi Sun, Lei Chen

机构 * HKUST Hong Kong China(香港理工大学(中国)) HKUST(GZ) / HKUST Guangzhou / Hong Kong China (2018)(香港理工大学(广州)/ 香港理工大学(广州)/ 香港中国(2018))

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM驱动的KGQA系统作为无状态规划器导致模式幻觉和检索覆盖有限的问题,提出CacheRAG,一种基于缓存的架构,通过模式无关接口、多样性优化缓存检索和有界启发式扩展,将无状态规划器转变为持续学习器,显著提升准确性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01802 2026-06-08 cs.SD cs.AI 版本更新 86%

MOSS-Audio Technical Report

MOSS-Audio 技术报告

Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen, Ke Chen, Wenxuan Wang, Yang Wang, Yaozhou Jiang, Yi Jiang, Zhengyuan Lin, Ziqi Chen, Zhaoye Fei, Chenghao Liu, Donghua Yu, Jun Zhan, Kang Yu, Kexin Huang, Liwei Fan, Mingshu Chen, Qinyuan Cheng, Ruixiao Li, Shimin Li, Songlin Wang, Xingjian Zhao, Yang Gao, Yitian Gong, Yiyang Zhang, Zhe Xu, Xipeng Qiu

机构 * OpenMOSS Team(开放MOSS团队)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出统一音频-语言模型 MOSS-Audio,通过 DeepStack 跨层特征注入和时间标记实现语音、环境声和音乐的理解,在音频字幕、时间感知问答、时间戳转录和音频推理任务上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27940 2026-08-03 cs.LG cs.CL 版本更新 86%

TriShield: Zero-Utility-Loss Defense Against Privacy Backdoors in Federated Language Model Fine-Tuning via Orthogonal Gradient Projection and Optimizer State Entanglement

TriShield:通过正交梯度投影与优化器状态纠缠实现联邦语言模型微调中隐私后门的零效用损失防御

Cheng Wei

机构 * Honor Device Co., Ltd.(荣耀终端有限公司)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 TriShield是一种三层确定性防御,通过参数特征检测、有状态虚拟迭代和零效用正交投影,可完全抵御NeuroImprint攻击,且零模型效用损失、无额外通信轮次,计算开销低。

Comments 12 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03536 2026-07-28 cs.CL cs.AI cs.IR 版本更新 86%

SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems

SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐

Haochang Hao, Yifan Xu, Xinzhuo Li, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。

Comments Accepted by SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07074 2026-07-28 cs.CL cs.AI 版本更新 86%

LuxInstruct: A Cross-Lingual Instruction Tuning Dataset For Luxembourgish

LuxInstruct:一个用于卢森堡语的跨语言指令微调数据集

Fred Philippy, Laura Bernardy, Siwen Guo, Jacques Klein, Tegawendé F. Bissyandé

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院) Zortify Labs, Zortify S.A.(Zortify实验室)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对卢森堡语缺乏高质量指令数据集问题,利用英、法、德对齐数据创建跨语言指令微调数据集,避免机器翻译弊端,提升模型在卢森堡语中的生成能力,为低资源语言发展提供新思路。

Comments Paper accepted at KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26654 2026-08-19 cs.CL cs.AI cs.CY cs.LG 版本更新 86%

Constitutional Midtraining: Content Presence Drives Alignment Gains

宪法式中间训练:内容存在驱动对齐增益

Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt

机构 * University of Oxford(牛津大学) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Geodesic Research Oxford Internet Institute, University of Oxford(牛津大学互联网研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出宪法式中间训练方法,在中间训练中插入基于原则价值观的内容,可提升模型对齐的泛化性与持久性,削弱SFT灌输的敲诈倾向且不造成能力损失,为以SFT为中心的流程提供低成本补充方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00280 2026-08-05 cs.OS cs.SE 版本更新 86%

Benchmarking LLMs on File System Design and Implementation

在文件系统设计与实现上对大语言模型(LLMs)进行基准测试:优势、不足与缺陷

Yuqi Xue, Daixuan Li, Jian Huang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出针对文件系统特定任务的LLM基准框架phi-Bench,含505项六类任务,测试开源与专有LLMs,揭示模型效率、失败原因及缓解技术,将开源phi-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07829 2026-07-29 cs.CL cs.AI cs.LG 版本更新 86%

Building Large-Scale English-Romanian Literary Translation Resources with Open Models

构建大规模英语-罗马尼亚文学翻译资源的开放模型

Mihai Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

机构 * Babeș-Bolyai University(巴克斯-波耶_ai大学) KlusAI Labs(KlusAI实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出TF2框架,通过开放模型和大规模合成语料库构建英语-罗马尼亚文学翻译资源,实现高效、低成本的高质量翻译。

Comments 21 pages. Published version: Front. Artif. Intell. 9:1807431 (2026). Datasets and models released on Hugging Face

Journal ref Front. Artif. Intell. 9:1807431 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14926 2026-07-07 cs.CL cs.AI cs.LG 版本更新 86%

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

罗马尼亚视觉语言模型的参数高效多模态指令微调

George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology(科学技术大学)

专题命中 指令微调 :language model(title);instruction tuning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对罗马尼亚语这种低资源语言,通过翻译并扩展Flickr30K数据集,采用参数高效的LoRA方法微调开源视觉语言模型来降低多模态NLP资源差距,模型在视觉问答等任务中能力提升且语法错误减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23946 2026-06-23 cs.LG cs.AI cs.CL stat.ML 版本更新 86%

Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm

探索-执行链:迈向高效的结构化推理范式

Kaisen Yang, Tinghe Zhang, Rushi Shah, Kaicheng Yang, Qinwei Ma, Dianbo Liu, Alex Lamb

机构 * Qizhi Institute(启智研究院) Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) College of AI, Tsinghua University(清华大学人工智能学院) Engineering Department, National University of Singapore(新加坡国立大学工程系) Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) IIIS, Tsinghua University(清华大学人工智能研究院) College of Software, Northeastern University(东北大学软件学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23982 2026-08-18 cs.MA cs.AI 版本更新 85%

Moral Hazard in Multi-Agent Language Models

多智能体语言模型中的道德风险

Dane Malenfant

专题命中 指令微调 :language model(title);SFT(abstract,abstract_cn);language agent(abstract);分类 cs.AI

AI总结 研究多智能体语言模型中的道德风险,引入对话道德风险游戏,评估七个模型并分解行为,用多种优化机制更新,发现效果异质,强调应报告机制级行为而非仅团队成功。

Comments New frontier baselines, new open weight inference baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09633 2026-08-14 cs.CV cs.LG 版本更新 85%

LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection

仅基于LoRA的适配还不够:探究基础模型在人脸呈现攻击检测中的局限性

Peter Lorenz, Anjith George, Marcel Sébastien

机构 * Idiap Research Institute(伊迪亚普研究所) University of Lausanne (UNIL)(洛桑大学)

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 本研究系统评估32种基础模型,发现LoRA适配仅优化数据集内人脸PAD性能,跨数据集泛化仍受限,指出仅靠LoRA适配不足以解决人脸PAD跨数据集性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20449 2026-08-04 cs.CL 版本更新 85%

LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-mixup:基于语言模型的混合文本数据增强方法

Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04853 2026-07-07 cs.CL 版本更新 85%

Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"

分解式提示无法弥补知识差距,但有助于模型说“我不知道”

Dhruv Madhwal, Lyuxin David Zhang, Dan Roth, Tomer Wolfson, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) University of Pennsylvania(宾夕法尼亚大学) Oracle AI

专题命中 指令微调 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型在闭卷问答中识别知识局限的问题,评估三种提示方式在不同模型规模和多跳问答基准下的影响,利用提示方式间的分歧信号实现无训练弃权策略,提升模型可靠性。

Comments Camera-ready version. Published in Findings of ACL 2026. Code and data: https://github.com/dhruvmadhwal/disagreement-based-abstention

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09715 2026-06-11 cs.AI 版本更新 85%

Does the Question Really Matter? Training-Free Data Selection for Vision-Language SFT

问题真的重要吗?视觉-语言SFT的无训练数据选择

Peng Sun, Yi Yang, Huawen Shen, Yi Ban, Tianfan Fu, Yanbo Wang, Yuqiang Li

机构 * Nanjing University(南京大学) Institute of Information Engineering(信息工程研究所) North University of China(中国北方大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(title,title_cn);instruction tuning(abstract);分类 cs.AI

AI总结 提出CVS方法,利用冻结的视觉-语言大模型评估问题对答案有效性的影响,无需训练即可筛选出需要跨模态推理的高质量样本,在多个数据集上以少量数据超越全量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03867 2026-06-24 cs.CL cs.AI 版本更新 85%

A Training-Free Mixture-of-Agents Framework for Multi-Document Summarization using LLMs and Knowledge Graphs

一种基于LLM和知识图谱的无训练混合智能体框架用于多文档摘要

Cuong Vuong Tuan, Trang Mai Xuan, Tien-Cuong Nguyen, Vu-Duc Ngo, Thien Van Luong

机构 * Faculty of Artificial Intelligence and Data Science, Phenikaa University(人工智能与数据科学学院,泛尼克大学) VNPT AI, VNPT Group(VNPT AI,VNPT集团) MobiFone Research and Development Center, MobiFone Corporation(MobiFone研发与开发中心,MobiFone公司) Business AI Lab, Faculty of Data Science and Artificial Intelligence, National Economics University, College of Technology(商业人工智能实验室,数据科学与人工智能学院,国家经济大学,技术学院)

专题命中 指令微调 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练、结合大语言模型和知识图谱的混合智能体框架,通过分解摘要任务为专用智能体(抽取、知识感知抽象、迭代精炼)并利用多视角一致性机制,在英文和越南语数据集上取得领先性能。

Comments Accepted by Neural Computing and Applications

Journal ref Neural Comput & Applic 38, 538 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18383 2026-06-19 cs.CL cs.AI 版本更新 85%

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习

ChangSu Choi, Hoyun Song, Dongyeon Kim, WooHyeon Jung, Minkyung Cho, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) LG CNS

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13132 2026-08-19 cs.NI 版本更新 85%

LLM-Driven Large-Scale Spectrum Access

基于大语言模型的大规模频谱接入

Ning Yang, Jinliang Gao, Haijun Zhang

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn)

AI总结 本文提出基于群体相对策略优化的LSA框架,通过分层状态序列化机制解决超长提示导致的计算崩溃问题,实现高效频谱管理。

Comments 11 pages, 2 figures, 8 tables. Submitted to IEEE Transactions on Mobile Computing (TMC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23088 2026-08-19 cs.CV 版本更新 85%

Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy

词中结构:用于人类大脑显微镜的弱监督视觉-语言建模

Matthew Sutton, Katrin Amunts, Timo Dickscheid, Christian Schiffer

机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);foundation model(abstract)

AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。

Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26690 2026-08-13 cs.LG 版本更新 84%

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

LoRAQuant:将LoRA混合精度量化至超低比特

Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) RBC Borealis Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03742 2026-08-11 cs.CL 版本更新 84%

Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus

针对低资源塔吉克语文本生成的大语言模型参数高效微调基准测试:基于塔吉克网络语料库

Mullosharaf K. Arabov

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL

AI总结 该研究发布塔吉克网络语料库,测试9种架构17种配置的三种微调策略,得出Mistral 7B搭配QLoRA r=8为最优方案,是首个针对塔吉克语文本生成的PEFT基准测试。

Comments LaTeLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11149 2026-08-11 cs.CL 版本更新 84%

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

数据重复胜过数据扩展在长链推理监督微调中

Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

机构 * University of Technology Nuremberg(图恩大学) NVIDIA(英伟达)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究发现,在长链推理监督微调中,数据重复训练比数据扩展更有效,通过token准确率作为停止标准可替代昂贵的数据扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16637 2026-08-04 cs.AI 版本更新 84%

TopoTuner: Topological Finetuning of Large Language Models

TopoTuner:大语言模型的拓扑微调

Abdulkadir Erol, Yash Mahajan, Vepaul Hariprashad, Baha Rababah, Santu Karmaker, Cuneyt G. Akcora, Mubarak Shah

机构 * University of Central Florida(中佛罗里达大学) University of Manitoba(曼尼托巴大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 研究针对大语言模型微调成本高及LoRA不足的问题,提出TopoTuner框架,通过拓扑引导选择性冻结注意力投影矩阵,从源数据集学习可复用冻结配置文件,在多模型上效果优于LoRA且大幅减少训练时间和参数更新量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22818 2026-07-20 cs.CR cs.AI 版本更新 84%

Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models

嵌入空间中的隐秘行动:基于几何的隐写术与大语言模型中的检测

Charles Westphal, Keivan Navaie, Fernando E. Rosas

机构 * UCL Centre for Artificial Intelligence, University College London, UK(伦敦大学学院人工智能中心,大学学院伦敦) School of Computing and Communications, Lancaster University, UK(兰卡斯特大学计算机与通讯学院) Department of Informatics, University of Sussex, UK(苏塞克斯大学信息学院) Centre for Psychedelic Research and Centre for Complexity Science, Imperial College London, UK(伦敦帝国学院迷幻研究与复杂科学中心) Centre for Eudaimonia and Human Flourishing, University of Oxford, UK(牛津大学幸福与人类繁荣中心)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 本研究提出了一种低恢复性隐写术,通过嵌入空间衍生映射提升秘密恢复率,同时减少负载恢复性,并提出基于机制可解释性的检测方法,提高微调模型中的秘密检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01193 2026-06-26 cs.CL 版本更新 84%

Embarrassingly Simple Self-Distillation Improves Code Generation

令人惊讶的简单自蒸馏方法提升代码生成能力

Ruixiang Zhang, Richard He Bai, Huangjie Zheng, Navdeep Jaitly, Ronan Collobert, Yizhe Zhang

机构 * Apple(苹果公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出简单自蒸馏(SSD)方法,仅利用模型自身输出进行微调,无需验证器或强化学习,显著提升代码生成性能,并揭示其通过重塑token分布解决精度-探索冲突的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17421 2026-06-16 cs.CL 版本更新 84%

Oops, Wait: Discourse Tokens Matter in Reasoning Model

哎呀,等等:话语标记在推理模型中的重要性

Jaehui Hwang, Byeongho Heo, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究话语标记(如“wait”)在推理轨迹中的作用,发现数据高效微调可部分复现其模式,但不如大规模后训练与高置信答案转换对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏