DeepSeek-VL: Towards Real-World Vision-Language Understanding
专题命中 指令微调 :LLM(abstract);language model(abstract);foundation model(abstract);instruction tuning(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 指令微调 :LLM(abstract);language model(abstract);foundation model(abstract);instruction tuning(abstract)
专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL
机构 * UMass Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 指令微调 :LLM(abstract,comments);large language model(abstract);language model(abstract);instruction tuning(abstract)
Comments Code available at https://github.com/HyejunJeong/bias_llm
语言模型水印的跨语言公平性审计
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出含四组件的跨语言公平性评估框架,应用于多方案、生成器、语言及模型 regime,揭示单语言评估无法发现的失效模式,发现水印跨语言公平性差距源于语言属性的结构性问题。
Comments 24 pages
音频-语言模型在利用多模态上下文进行构音障碍语音识别时的失效问题
专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 该研究构建基于SAP数据集的基准,发现现有音频-语言模型无法有效利用构音障碍语音的临床上下文,而LoRA适配方法可将WER降低52%,为包容性ASR提供测试平台。
你确定你确定吗?指令微调对置信度和词汇多样性的影响
机构 * Cohere Labs(Cohere实验室) ; Laboratoire Hubert Curien(于贝尔·居里实验室) ; Bennett University(班尼特大学) ; Western University(西安大略大学)
专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究指令微调对语言模型置信度与生成理由词汇多样性的影响,发现指令微调虽小幅降低校准度但显著改变置信度,且对理由多样性的影响存在差异,二者是指令微调的不同效应。
SPRInG: 通过选择性参数适应和检索插值生成实现连续大语言模型个性化
机构 * Yonsei University(延世大学)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 SPRInG通过选择性参数适应和检索插值生成,实现连续大语言模型个性化,有效应对用户偏好变化带来的挑战。
Comments under review, 29 pages
SemiAdapt-Instruct:通过潜在领域专用适配器实现可扩展的指令微调
机构 * University of Limerick(利默里克大学)
专题命中 指令微调 :instruction tuning(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 SemiAdapt-Instruct是一种模块化指令微调框架,可发现潜在指令领域并训练对应LoRA适配器,无需全模型微调即可扩展,性能优于全模型微调且具备整体方法无法实现的可扩展性。
MDLMPE:面向掩码扩散语言模型的分布感知位置编码
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 针对掩码扩散语言模型位置编码对动态标记可用性结构不敏感的问题,提出MDLMPE,通过编码标记可用性等实现分布感知,在LLaDA、DREAM等实验中性能优于传统方法。
SpatioLM:面向视觉-语言模型的通用物理空间智能
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。
Comments 27 pages,13 figures,16 tables
用纠错码对语言模型进行水印标记
机构 * University of Pennsylvania(宾夕法尼亚大学) ; New Jersey Institute of Technology(新泽西理工学院)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出了一种基于纠错码的鲁棒二进制码水印方法,用于区分机器生成文本与人类文本,具有鲁棒性和高效性。
MS-GPT:将串联质谱的从头结构解析重新思考为分子语言模型的谱诱导后验查询
机构 * ByteDance Inc.(字节跳动公司) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 研究针对MS/MS分子结构解析问题,提出MS-GPT方法,将指纹介导的从头解析重铸为谱诱导后验查询分子语言模型,经校准、排序等操作,在NPLIB1和MassSpecGym上达新最优水平,提升召回率且增加少量推理成本。
Comments 18 pages, 14 figures, and 9 tables, including appendices. Source code and model checkpoints are available at https://github.com/VIKI623/MS-GPT
自信的欺骗:信心如何放大语言模型欺骗的风险
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型欺骗问题,通过多种方式衡量信心,发现其会产生高信心欺骗性回答,错位微调加剧问题,模型能识别自身欺骗性输出却不避免,指出自信的欺骗是独特风险,需综合评估欺骗、信心与意识。
问两次,看两次:提示回声解决视觉语言模型中的问题优先悖论
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型中问题优先提示的悖论,发现问题前置虽能引导感知但后续答案生成阶段难关注到问题。提出问题回声方法,即在图像两侧重复问题,解决了悖论,在多基准测试中表现出色且无需训练等。
扩展即时语言模型
机构 * Yale School of Management(耶鲁大学管理学院) ; AQR Capital Management(AQR资产管理公司) ; NBER(美国国家经济研究局) ; Swiss Finance Institute(瑞士金融研究所) ; EPFL(洛桑联邦理工学院) ; CEPR(经济政策研究中心)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 研究旨在解决大型语言模型的前瞻性偏差问题,通过在大量按时间顺序过滤的令牌上训练仅解码器变压器构建即时语言模型,缩小了与无约束模型的性能差距,经LoRA微调提升可用性,并发布完整管道支持相关研究。
利用指令微调与合并实现推理模型适配
专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究如何利用大量未使用的监督微调数据提升推理语言模型性能,先对模型进行经典指令微调,再与原始推理模型合并,该技术在多领域提升了模型性能且成本效益高。
高效地使口语语言模型适应新加坡语境
机构 * xData Home Team Science & Technology Agency (HTX)(新加坡内政团队科技局)
专题命中 指令微调 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI
AI总结 研究针对原始训练数据不可用且需多语言口语交互的情况,将开源口语语言模型适应新加坡语境。核心方法是结合LoRA微调等技术,构建多语言数据集。贡献是HT - Moonstone(5B)在多数任务表现出色,口音和性别识别佳,且原始语音问答能力损失小。
Comments 10 pages, 2 figures
ReCoLoRA:用于持续语言模型微调的频谱感知递归合并
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对持续语言模型微调中类似LoRA方法新任务覆盖旧任务的问题,提出ReCoLoRA框架,通过特定初始化、选秩及递归合并等操作,在多任务持续GLUE序列实验中,用更少参数取得更好成绩。
StochasT:基于随机轮次深度的视觉指令微调学习
机构 * Boston University(波士顿大学) ; Rutgers University(罗格斯大学)
专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 针对视觉指令微调中多轮训练与单轮测试不匹配的问题,提出StochasT方法,通过随机分组语言任务为不同大小的轮次深度,增强模型在单轮和多轮场景下的鲁棒性。
Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/StochasT
为返回的模型进行训练:改进迭代平均语言模型的优化
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) ; Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 针对返回迭代平均而非最终迭代的语言模型,提出PACE方法,通过最优控制理论优化平均估计器,在二次模型中证明其能显著降低均方误差,并在1-2B参数LM微调和GPT-2预训练中优于AdamW。
KnowsTFM:知识引导的小型表格基础模型微调
机构 * Jožef Stefan Institute and Postgraduate School(乔塞夫·斯蒂芬研究所和研究生学院) ; Department of Computer Science and Technology, University of Cambridge, UK(剑桥大学计算机科学与技术系) ; Télécom Paris, Institut Polytechnique de Paris, FR(巴黎电信学院,巴黎理工学院)
专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 针对专业领域数据稀缺且分布偏移的问题,提出通过知识图谱结构先验和参数高效低秩更新微调小型表格基础模型,在专业任务上取得显著提升。
低宜人性人格条件化用于安全的大语言模型微调
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对温暖微调降低大语言模型安全性的问题,提出基于低宜人性人格的改写流水线,在保持对话温暖的同时降低越狱成功率与有害输出率。
Comments 9 pages, 8 tables, 5 figures
通过深度混合集成微调语言模型
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 提出MoDE框架,将后期层作为集成通过学习路由权重贡献最终logits,可在任何微调方法上应用,以较小参数开销提升推理性能。
定位语言模型中的锚定路径
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 指令微调 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究提示中无关数字如何影响语言模型数值推理的锚定效应,通过logit差值度量和电路归因定位,发现边级方法优于节点级方法,并揭示锚定路径的共享与迁移特性。
PermDoRA -- 理解语言模型中的适配器干扰:参数空间几何的局限性
机构 * Independent Researcher(独立研究员)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 研究适配器组合中的干扰是否源于线性参数更新重叠,通过DoRA-RBAC框架和几何感知合并策略实验,发现参数空间几何不是干扰主因,而是共享非线性表示中的交互。
Comments 18 Pages, COLM 2026
DRIFT:一种用于视觉-语言模型中连续输出解码的残差流适配器
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; West Lafayette Jr./Sr. High School(韦斯特拉法叶高中)
专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT框架,通过结合基础预测器和基于流匹配的生成式精化模块,将预训练视觉-语言模型适配到连续解码任务,在视觉定位和机器人控制等任务上优于回归和生成方法。
微调提升语言模型中的信息传递
机构 * Department of Statistics(统计学系) ; University of Chicago(芝加哥大学) ; Department of Data Science(数据科学系) ; Department of Computer Science(计算机科学系)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 提出冠层熵(Canopy Entropy)度量,从树结构视角量化生成空间的有效大小,发现微调模型在总熵降低时仍能增强长度-熵率正相关,从而更高效地将不确定性转化为语义多样性。
面向设备上大语言模型微调的内存高效结构化反向传播
机构 * OptAI Inc.(OptAI公司)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出MeSP方法,通过手动推导利用LoRA低秩结构的反向传播,在计算数学等价梯度的同时平均减少49%内存,使内存受限设备上的微调成为可能。
Comments ACL2026
进展如何?语言模型中的强化学习招募了一个功能性福利轴
机构 * New York University(纽约大学)
专题命中 指令微调 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG
AI总结 本文通过迷宫环境实验,发现强化学习会招募语言模型中预先存在的功能性福利表征(即对系统目标达成程度的估计),从而广泛影响模型行为,且该表征在训练前已存在。
Comments 81 pages, 43 figures, 32 tables
PACZero: 通过符号量化的语言模型PAC隐私微调
机构 * CWI Amsterdam(阿姆斯特丹信息与计算科学研究所) ; MIT Cambridge(麻省理工学院) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 提出PACZero系列零阶机制,通过符号量化实现零互信息下的PAC隐私微调,在SST-2和SQuAD上取得竞争性结果。