arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2512.13660 2026-07-07 cs.RO cs.CV 版本更新 82%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 指令微调 :language model(title);SFT(abstract,abstract_cn)

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06714 2026-07-02 cs.CV 新提交 82%

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

锚定而非分级:视觉-语言模型在纹理倾斜感知中失败

Qian Zhang, Michal Golovanevsky, Fulvio Domini, James Tompkin

机构 * Brown University(布朗大学) Harvard University(哈佛大学)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 研究视觉-语言模型(VLM)在纹理倾斜感知任务中的表现,发现零样本和上下文提示均产生锚定失败,仅预测少数离散角度,监督微调部分缓解但残留锚定,表明问题在于表示到输出的语言接口无法分级表达。

Comments 15 pages. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04862 2026-06-29 cs.SD 版本更新 82%

Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models

先聚焦后聆听:探索用于噪声鲁棒的大规模音频语言模型的即插即用音频增强器

Han Yin, Yang Xiao, Younghoo Kwon, Ting Dang, Jung-Woo Choi

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 指令微调 :language model(title,abstract);foundation model(abstract)

AI总结 提出即插即用的音频增强器FTL,通过分离语音与非语音并利用模态路由器预测目标模态,生成任务自适应增强信号,无需微调即可提升LALMs在噪声环境下的性能。

Comments Accepted by ICML 2026 Workshop (Machine Learning for Audio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19944 2026-06-19 cs.CV 新提交 82%

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

Timage: 一种用于微调视觉语言模型的文本嵌入图像生成范式

Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han

机构 * Fudan University(复旦大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Tencent Jarvis Lab(腾讯贾维斯实验室) Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract)

AI总结 提出Timage范式,通过约束薛定谔桥将查询文本作为排版覆盖层嵌入图像,以显式空间锚点引导模型关注,在不侵蚀骨干能力前提下提升细粒度空间推理性能。

Comments ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 82%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(title,title_cn)

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16334 2026-06-16 cs.CV 新提交 82%

Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT

时间盲:使用CHRONOSIGHT基准测试视觉语言模型的时间推理能力

Parthaw Goswami, Jaynto Goswami Deep

机构 * Department of Computer Science, University of Missouri(密苏里大学计算机科学系) SAP

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 提出CHRONOSIGHT基准,从五个维度评估视觉语言模型的时间推理能力,发现模型与人类存在巨大差距(人类平均0.89,最佳模型0.40),并通过微调显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16161 2026-06-16 cs.CV 新提交 82%

Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification

多模态大语言模型赋能的通用行人重识别重排序

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract)

AI总结 提出利用多模态大语言模型(MLLM)的泛化能力,通过微调MLLM并计算μ-距离来改进推理阶段的重排序,从而提升领域泛化行人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25853 2026-06-16 cs.CL cs.AI cs.LG 版本更新 82%

G-Loss: Graph-Guided Fine-Tuning of Language Models

G-Loss:图引导的语言模型微调

Aditya Sharma, Vinti Agarwal, Rajesh Kumar

机构 * BITS Pilani(BITS 派拉尼) Bucknell University(巴克内尔大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出G-Loss损失函数,通过构建文档相似度图并利用半监督标签传播捕捉全局语义结构,引导语言模型学习更具判别性和鲁棒性的嵌入,在多个分类任务上提升准确率并加速收敛。

Comments 20 pages, Learning on Graphs (LoG2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12704 2026-06-12 physics.chem-ph cond-mat.mtrl-sci 新提交 82%

Fine-tuning MLIP foundation models: strategies for accuracy and transferability

微调MLIP基础模型:准确性与可迁移性的策略

Tamás Lajos Tompa, Eszter Varga-Umbrich, Ilyes Batatia, Alin M. Elena, Noam Bernstein, Gábor Csányi

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract)

AI总结 评估七种微调策略在化学多样性基准上的表现,发现基础模型质量、E0初始化和超参数选择比策略本身更重要,多头部回放能保持分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05713 2026-06-05 cs.MM cs.SD eess.AS 82%

Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis

超越生成式解码:来自原生全模态大语言模型的判别性隐藏状态读出用于多模态情感分析

Bin Wen, Tien-Ping Tan

机构 * School of Computer Sciences, Universiti Sains Malaysia, Penang, Malaysia(计算机科学学院,马来西亚国际科学大学,槟城)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract)

AI总结 针对多模态情感分析中生成式读出将连续回归绑定到离散自回归解码导致精度和效率损失的问题,提出基于原生全模态大语言模型Qwen2.5-Omni-7B的Thinker模块的判别性读出方法,通过轻量回归头直接映射最终层隐藏状态,在单消费级GPU上实现最先进性能。

Comments 18 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26761 2026-06-05 cs.CV 82%

Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning

Once-For-All: 一种用于多模态指令微调的“一次训练,随时选择”框架

Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract)

AI总结 提出OFA框架,通过一次训练可迁移的选择器,无需重新计算即可从任意数据集或模型中筛选出最具信息量的多模态指令数据,实现高效微调。

Comments 15 pages, 6 figures. Mingkang Dong and Hongyi Cai contributed equally to this work. Muxin Pu is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10419 2026-06-03 cs.LG cs.AI cs.CL stat.ML 82%

Multiple Choice Learning of Low-Rank Adapters for Language Modeling

低秩适配器的多选学习用于语言建模

Victor Letzelter, Hugo Malard, Mathieu Fontaine, Gaël Richard, Slim Essid, Andrei Bursuc, Patrick Pérez

机构 * Institut National de la Recherche Scientifique (INRS)(国家科学研究院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LoRA-MCL训练方案,通过多选学习和低秩适配扩展语言模型的下一词预测,以在推理时解码多样且合理的句子延续。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12247 2026-06-03 cs.CL cs.AI cs.LG 82%

Plan, Verify and Fill: A Structured Parallel Decoding Approach for Diffusion Language Models

规划、验证与填充:扩散语言模型的结构化并行解码方法

Miao Li, Hanyang Jiang, Sikai Cheng, Hengyu Fu, Yuhang Cai, Baihe Huang, Tinghan Ye, Xuanzhou Chen, Pascal Van Hentenryck

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Plan-Verify-Fill (PVF)方法,通过定量验证进行分层骨架规划,并采用验证协议实现结构化停止,在保持准确性的同时将函数评估次数减少高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01838 2026-06-02 cs.CL cs.AI cs.LG 82%

LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models

LayerRoute: 基于LoRA微调的输入条件自适应层跳过方法用于智能语言模型

Prateek Kumar Sikdar

机构 * Accenture(埃森哲)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LayerRoute,通过为每个Transformer块添加轻量级路由器和LoRA适配器,根据输入类型(工具调用或规划推理)自适应跳过层,在仅增加0.22%可训练参数下实现12.91%的跳过差异并提升质量。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01202 2026-06-02 cs.AI cs.CL cs.LG 82%

The Shape of Wisdom: Decision Trajectories in Language Models

智慧的形状:语言模型中的决策轨迹

Shailesh Rana

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析三种语言模型在MMLU上的9000条轨迹,提出用答案边际、边际变化和决策翻转距离描述轨迹,发现正确性与稳定性不同,并探究了注意力与MLP标量对边际的影响。

Comments 6 pages, 5 figures. Code and derived artifacts: https://github.com/gut-puncture/The-Shape-of-Wisdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00673 2026-06-02 cs.CV 82%

T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

T-CLIP:面向对比语言-图像预训练的热感知

Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee, Brejesh Lall

机构 * Indian Institute of Technology Delhi, India(印度理工学院德里分校) NVIDIA AI Technology Center, India(NVIDIA AI技术中心) Jawaharlal Nehru University, India(贾瓦哈拉尔·尼赫鲁大学)

专题命中 指令微调 :pretraining(title);LLM(abstract_cn);language model(abstract)

AI总结 针对CLIP无法对齐热图像与文本描述的问题,提出物理感知的热描述数据集IR-Cap和解耦双LoRA框架T-CLIP,实现场景级和对象级热理解,在跨模态检索任务上超越所有基线。

Comments 34pages (including references and appendix), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26421 2026-05-27 cs.CV 82%

HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection

HydraPrompt: 面向合成图像检测的视觉语言模型自适应非对称框架

Senyuan Shi, Hao Tan, Zichang Tan, Shuhan Feng, Ajian Liu, Sergio Escalera, Jun Wan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) University of Barcelona(巴塞罗那大学)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 提出一种非对称提示框架HydraPrompt,通过动态调整类别中心对齐细粒度图像线索,结合条件监督对比学习,实现合成图像检测的SOTA性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19037 2026-05-26 cs.CL cs.AI cs.IT cs.LG cs.NE math.IT 82%

Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models

速度规划:用于掩码扩散语言模型的膨胀调度

Omer Luxembourg, Haim Permuter, Eliya Nachmani

机构 * School of Electrical and Computer Engineering, Ben-Gurion University of the Negev, Beersheba, Israel(电气与计算机工程学院,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出膨胀解掩码调度器(DUS),通过将序列位置划分为非相邻的膨胀组并并行解掩码,最小化联合熵增益上界,在不修改去噪器的情况下实现高达5.8倍加速。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08879 2026-05-20 cs.RO 82%

Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT

通过保守监督微调在流匹配视觉-语言-动作中保持基础能力

Tianyi Zhang, Shaopeng Zhai, Haoran Zhang, Fuxian Huang, Qi Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :SFT(title,abstract)

AI总结 本文提出保守监督微调(ConSFT)方法,旨在通过动态调整学习信号来减少流匹配视觉-语言-动作模型在微调过程中对预训练能力的损害,从而在不依赖先验数据或架构开销的情况下提升模型在目标分布上的适应性和能力保留。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10499 2026-05-18 math.DS cs.DM 82%

A Three-Dimensional SFT with Sparse Columns

三维稀疏列SFT

Ville Salo, Ilkka Törmä

专题命中 指令微调 :SFT(title,title_cn)

AI总结 本文构建了一个非平凡的三维有限型子移位,其投影Z-子动力学为2稀疏,即任一垂直列中最多有两个非零符号。该子移位在子动力学方向上是确定性的,因此与部分单元自动机的时间空间图集拓扑共轭。还提出了由Wang立方体定义的变体及二元字母表的子移位。

Comments 28 pages, 5 figures; this version has slightly simpler mats

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14291 2026-05-15 cs.CR cs.AI cs.CL cs.CV cs.LG 82%

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

机构 * School of Computing Augmented Intelligence, Arizona State University, Tempe, AZ, USA Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09187 2026-05-12 cs.AI cs.CL cs.LG 82%

Emergent Semantic Role Understanding in Language Models

语言模型中语义角色理解的涌现

Carla Griffiths, Mirco Musolesi

机构 * University College London(伦敦大学学院) University of Bologna(博洛尼亚大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型预训练中语义角色理解的涌现情况,发现预训练表示包含显著的语义角色信息,但未完全匹配微调模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06723 2026-05-11 cs.AI cs.CL cs.LG 82%

When Does a Language Model Commit? A Finite-Answer Theory of Pre-Verbalization Commitment

语言模型何时做出承诺?一种有限答案理论的预言语承诺

Long Zhang, Wei-neng Chen, Feng-feng Wei, Zi-bo Qin

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在生成最终答案前的推理过程,通过有限答案偏好稳定化理论分析模型在回答前的承诺时间,发现其在可解析前稳定,且信号可从隐藏状态恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22125 2026-04-28 cs.CV 82%

GA2-CLIP: Generic Attribute Anchor for Efficient Prompt Tuningin Video-Language Models

GA2-CLIP:通用属性锚点用于视频-语言模型高效提示微调

Bin Wang, Ruotong Hu, Wentong Li, Wenqian Wang, Mingliang Gao, Runmin Cong, Wei Zhang, Xudong Jiang

机构 * Shandong Provincial Key Laboratory of New Power Distribution & Utilization Technology and Equipment, School of Electrical and Electronic Engineering, Shandong University of Technology(山东省新型电力分布与利用技术及设备重点实验室,山东理工大学电气与电子工程学院) School of Computer Science and Technology, Shandong University of Technology(山东理工大学计算机科学与技术学院) School of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) Pillar of Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计 pillar) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 GA2-CLIP通过引入外部监督提示和无关视频集,优化视频任务中V-L模型的泛化性能,防止语义空间过拟合,提升模型在新类别预测上的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19482 2026-04-28 cs.CV 82%

Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following

无需指令的大型视觉语言模型在医疗指令遵循中的调优

Myeongkyun Kang, Soopil Kim, Xiaoxiao Li, Sang Hyun Park

机构 * Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Department of Robotics and Mechatronics Engineering, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院机器人与机电工程系) Division of Intelligent Robot, Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院智能机器人系) Vector Institute(向量研究所) Department of Computer Science and Engineering, Pohang University of Science and Technology (POSTECH)(釜山科学技术大学计算机科学与工程系)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract)

AI总结 本文提出无需指令的调优方法,利用图像描述对训练模型,提升医疗领域视觉语言模型的指令遵循能力,实现多选视觉问答任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17326 2026-04-16 cs.CV 82%

Democratising Pathology Co-Pilots: An Open Pipeline and Dataset for Whole-Slide Vision-Language Modelling

让病理共驾民主化:一个开放的管道和数据集用于整张滑片视觉-语言建模

Sander Moonemans, Sebastiaan Ram, Frédérique Meeuwsen, Carlijn Lems, Jeroen van der Laak, Geert Litjens, Francesco Ciompi

机构 * Computational Pathology Group, Radboud University Medical Center(计算病理组,拉德堡德大学医学中心)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract)

AI总结 本文提出Polysome工具和HISTAI-Instruct数据集,训练出ANTONI-α模型,在整张滑片VQA任务中超越MedGemma,所有方法和数据公开。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14971 2026-04-08 cs.CV cs.AI cs.CL cs.LG 82%

Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models

Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型

Md Zarif Hossain, Ahmed Imteaj

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04088 2026-04-07 cs.CL cs.AI cs.CY cs.LG 82%

Embedding Enhancement via Fine-Tuned Language Models for Learner-Item Cognitive Modeling

通过微调语言模型增强嵌入以实现学习者-项目认知建模

Yuanhao Liu, Zihan Zhou, Kaiying Wu, Shuo Liu, Yiyang Huang, Jiajun Guo, Aimin Zhou, Hong Qian

机构 * East China Normal University(华东师范大学) Tencent Inc(腾讯公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EduEmbed框架,通过微调语言模型提升学习者-项目认知建模的嵌入表示,在多种认知诊断任务中实现稳健性能。

Comments Accepted by The ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19715 2026-04-02 cs.CL cs.AI cs.LG 82%

Graceful Forgetting in Generative Language Models

生成语言模型中的优雅遗忘

Chunyang Jiang, Chi-min Chan, Yiyang Cai, Yulong Liu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Learning With Forgetting框架,通过Fisher信息矩阵评估并周期性删除无关知识,提升生成语言模型的微调性能。

Comments 8 pages, 6 figures. EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26666 2026-03-30 cs.RO 82%

VLA-OPD: Bridging Offline SFT and Online RL for Vision-Language-Action Models via On-Policy Distillation

VLA-OPD: 通过在线策略蒸馏连接离线SFT与在线RL以构建视觉-语言-动作模型

Zhide Zhong, Haodong Yan, Junfeng Li, Junjie He, Tianran Zhang, Haoang Li

专题命中 指令微调 :SFT(title,abstract);post-training(abstract)

AI总结 本文提出VLA-OPD框架,通过在线策略蒸馏结合离线SFT与在线RL,解决预训练模型在部署中的分布偏移和灾难性遗忘问题,提升样本效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏