Exploring Cross-lingual Textual Style Transfer with Large Multilingual Language Models
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.LG
专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL
Comments Version 5. Find list of changes in Appendix F (page 35)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments EMNLP 2021 (long paper)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL
从学生-辅导对话中诊断误解:生成、检索、重排序
机构 * Eedi Renaissance Philanthropy Learning Engineering Virtual Institute(Eedi 理性慈善学习工程虚拟研究所)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出利用大语言模型从学生-辅导对话中检测误解的方法,通过生成、检索和重排序提升误解识别的准确性。
Comments Published as Oral Paper at Learning at Scale, 2026. Link: https://dl.acm.org/doi/10.1145/3774398.3811609. 21 pages, 8 figures, 8 tables. Joshua Mitton and Prarthana Bhattacharyya contributed equally to this paper
InSight-doc:面向长文档理解的智能体视觉感知框架
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Huawei(华为)
专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。
重新思考联邦LoRA中的因子共享:一种秩感知自适应方法
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Fudan University(复旦大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对联邦LoRA的因子共享问题,提出FedAS-LoRA方法,通过RSS指标在训练前选择共享侧,提升了大语言模型联邦微调的性能。
Comments 20 pages
MERaLiON-GR:适用于英语及东南亚语言的语音性别识别模型
机构 * Institute of Advanced Intelligence and Computing (IAIC), A*STAR(先进智能与计算研究院(IAIC),新加坡科技研究局)
专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出MERaLiON-GR语音性别识别模型,通过微调MERaLiON-SpeechEncoder-2并结合LoRA及多尺度ECAPA-TDNN网络,在多语言东南亚数据集上性能优于Vox-Profile和Audio-LLM,凸显专用语音模型的价值。
MOON3.0: 基于推理的多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。
Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures
Token Buncher: 保护大语言模型免受有害强化学习微调的威胁
机构 * Nanyang Technological University(南洋理工大学) ; Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) ; Northwestern University(西北大学)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。
Comments Accepted by ACM CCS 26
从方向到大小:多模态指令微调如何在Transformer隐藏状态中重新组织身份指定提示的几何编码
机构 * Axis Dynamics SpA(轴动力公司)
专题命中 指令微调 :language model(abstract);post-training(abstract);SFT(abstract);RLHF(abstract)
AI总结 研究四种训练后模式的Transformer语言模型,通过五个几何指标比较三种提示条件,发现多模态指令微调会使身份编码从方向重组为大小,此重组特定于该模式,还定位了W_1作为方法贡献。
Comments 16 pages, 8 tables. Working draft v0.3. Uses Ollivier-Ricci curvature and edge-wise Wasserstein-1 as primary geometric statistic; four models (Gemma-4-E4B, Gemma-4-E4B-it, DeepSeek-R1-Distill-Qwen-7B, Qwen2.5-7B-Instruct)
TimeRFT:通过强化微调提升TSFMs的时间序列预测通用性
机构 * University of Alberta(阿尔伯塔大学) ; Alibaba Cloud(阿里云) ; City University of Hong Kong(香港城市大学)
专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 TimeRFT通过强化微调方法解决时间序列基础模型在特定任务适应中的泛化问题,提升预测精度和抗分布偏移能力。
Comments 15 pages, 8 figures, In Submission
策略,而非收益:标准型博弈的行为嵌入
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。
用于长期代理任务的进度条件分组策略优化
机构 * Southeast University(东南大学) ; Kuaishou Technology(快手科技) ; Meituan(美团)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究长期代理任务中基于分组策略优化的采样不平衡问题,提出进度条件分组策略优化(ProGPO),通过特定条件下利用首次访问观察覆盖率,为访问更多新状态的轨迹或步骤赋予优势,实验证明该方法优于基线,尤其在困难任务上效果显著。
容量之上的数据质量:将文档内化到LoRA适配器中用于闭卷问答
专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 研究将文档内化到LoRA适配器用于闭卷问答,发现适配器容量足够时,训练数据质量主导闭卷准确率,一次整理大幅提升准确率,确认容量趋势及秩与学习率耦合,内化适配器在低延迟下表现优于检索基线,还报告了调试LLM训练的过程。
ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。
一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Nanyang Technological University(南洋理工大学)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。
Comments 10 pages, 5 figures
对不起,我无法处理盲文:揭示当前最先进语言模型中的无障碍性缺陷
机构 * orinu Inc.(奥里努公司)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究评估先进语言模型在韩语-盲文翻译上的表现,发现其存在缺陷。通过人工标注数据集测试,发现输出差且不稳定。对比发现,对小模型进行监督微调效果更好,揭示了当前语言模型的局限,证明特定监督的有效性。
Comments Accepted at the LTEDI Workshop at ACL 2026
结构引导的实体解析:微调大语言模型以实现复杂语言上下文中的鲁棒姓名匹配
机构 * Dream Sports
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出结构引导实体解析(SGER)框架,通过两阶段课程微调大语言模型,先学习姓名语法结构再优化匹配任务,在印度身份数据上达到99.02%准确率和0.994 F1分数,已部署于Dream11平台服务2.5亿+用户。
Comments Accepted to ACL 2026. 8 pages, 1 figure, 2 tables
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), pages 1461-1468, 2026
超越静态规则:文本到SQL中潜在漏洞的自动发现
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Beihang University(北京航空航天大学) ; Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) ; Southern University of Science and Technology(南方科技大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。
Comments Accepted by Findings of ACL 2026
TUDUM:面向Qwen3.5-27B的土耳其语思维推理流水线
机构 * Department of Artificial Intelligence and Data Engineering(人工智能与数据工程系) ; Faculty of Engineering(工程学院) ; Ankara University(安卡拉大学)
专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出TUDUM流水线,通过SFT和GRPO强化学习将Qwen3.5-27B适配为土耳其语思维模型,使推理过程本身使用土耳其语,而非仅输出本地化答案。
保持几何的正交初始化用于RLVR中的低秩适应
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对RLVR中LoRA初始化问题,提出保持几何的正交初始化方法(RLPO和RLMO),理论证明其最小化与全微调差距,实验表明稳定训练且优于标准LoRA。
Comments 30 pages, accepted to ICML 2026
良性多语言微调的安全影响异质性
专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。
Comments 9 pages
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026
微调是否会抹去你的修改?关于知识编辑与适应脆弱共存的研究
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究探讨了微调对知识编辑的影响,发现微调会显著降低编辑效果,且仅微调编辑层可有效去除编辑,同时保持下游性能。
Comments Accepted to KDD 2026
LLawCo: 学习合作法则以建模具身多智能体行为
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Mitsubishi Electric Research Laboratories(三菱电机研究实验室)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。
Comments Accepted to ICML 2026
潜在个人记忆:将个人记忆表示为动态软提示
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Samsung Research America(三星美国研究院)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出潜在个人记忆(LPM)框架,通过可解释的潜在槽矩阵和交叉注意力网络生成动态软提示,在冻结大语言模型上高效编码用户历史,在PersonaMem v1和LoCoMO基准上优于LoRA和提示调优,并大幅降低KV缓存使用。
Comments 17 pages, 3 figures
DRIFT: 通过在线策略数据归因优化指令数据
机构 * Tsinghua University(清华大学)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT方法,利用在线策略影响函数解决标准影响函数在指令微调数据归因中的近邻偏差和梯度范数偏差问题,通过模型自身生成作为验证目标,提升7B模型性能上限。
AdaMame: 一种自适应多语言推理的训练方案
机构 * University of Maryland(马里兰大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 针对多语言推理中的语言崩溃问题,提出两阶段训练方案AdaMame,通过SFT建立多语言能力,再以自适应GRPO优化推理语言对齐,在准确率、语言保真度和令牌效率上达到帕累托最优。
Comments 20 pages, 5 figures
量化进化策略:以低精度代价实现量化大语言模型的高精度微调
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Cognizant AI Lab(Cognizant AI实验室) ; UT Austin(得克萨斯大学奥斯汀分校)
专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出量化进化策略(QES),通过集成累积误差反馈和无状态种子重放,直接在量化空间进行全参数微调,无需反向传播,显著优于现有零阶微调方法。
Comments Added more tasks and baselines