SpecRL: Reinforcement Learning with Test-Based Completeness Rewards for Formal Specification Synthesis
通过负测试作为完整性信号的强化学习用于形式规范综合
专题命中 指令微调 :LLM(abstract_cn)
AI总结 本文提出SpecRL框架,利用负测试比例作为规范完整性的信号,提升规范强度和验证成功率,实验显示其在不同模型规模上表现优异。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过负测试作为完整性信号的强化学习用于形式规范综合
专题命中 指令微调 :LLM(abstract_cn)
AI总结 本文提出SpecRL框架,利用负测试比例作为规范完整性的信号,提升规范强度和验证成功率,实验显示其在不同模型规模上表现优异。
SHIFT: 视频扩散模型中的运动对齐与对抗混合微调
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; University of Chinese Academy of Science(中国科学院大学)
专题命中 指令微调 :post-training(abstract)
AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。
Comments Accepted by ECCV2026
StereoVLA:利用立体视觉增强视觉-语言-动作模型
机构 * Galbot ; CFCS, School of CS, Peking University(北京大学计算机学院CFCS) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The University of Hong Kong(香港大学) ; Xiamen University Malaysia(厦门大学马来西亚分校) ; Southern University of Science and Technology(南方科技大学)
专题命中 指令微调 :foundation model(abstract)
AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。
VLMs 是视频推理的好老师:通过自适应测试时优化
机构 * City University of Hong Kong(香港城市大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 指令微调 :language model(abstract)
AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。
Comments Project Page: https://VLM-as-Teacher.github.io/
AnimeAdapter: 细粒度且一致的零样本动漫人物生成
机构 * National University of Singapore, Singapore(新加坡国立大学)
专题命中 指令微调 :language model(abstract)
AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。
CAMEO: 一种条件感知与质量驱动的多智能体图像编辑编排器
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shenzhen University(深圳大学) ; Claremont McKenna College(克莱蒙特麦肯纳学院) ; Research Institute of Petroleum Exploration and Development, CNPC(石油勘探开发研究院,中石油)
专题命中 指令微调 :prompting(abstract)
AI总结 提出CAMEO多智能体框架,将条件图像编辑重构为质量感知的反馈驱动过程,通过分解编辑阶段、嵌入评估循环,在异常插入和人体姿态切换任务中平均胜率提升20%。
考虑光照的实例分割统一模型
机构 * Iowa State University(爱荷华州立大学)
专题命中 指令微调 :foundation model(abstract)
AI总结 本文提出了一种考虑光照的实例分割统一模型,通过开发Lighting Convolutional-Attention模块,在不微调重型主干网络的情况下提升分割鲁棒性,实验结果表明该方法能有效解决光照变化带来的领域差距问题。
SIL: 语言条件的人机协同适应的共生交互学习
机构 * Technical University of Leoben(莱博恩技术大学)
专题命中 指令微调 :foundation model(abstract)
AI总结 提出共生交互学习(SIL)框架,实现人类与智能体在共享潜在任务空间中的双向协同适应,通过联合信念状态、FM空间推理和记忆架构,在指令跟随等任务中达到90.4%完成率和0.83信念对齐分数。
UI2Code^N: 将UI到代码生成视为交互式视觉优化
机构 * Zhejiang University(浙江大学)
专题命中 指令微调 :language model(abstract)
AI总结 提出将UI截图转代码任务重构为交互式视觉优化问题,采用基于偏好的强化学习方法RVPO优化视觉排名,在UI起草、润色和编辑任务上达到SOTA。
Comments 27 pages
CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力
机构 * University of California Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学)
专题命中 指令微调 :language model(abstract)
AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。
LoRA-Key:面向用户的文本到图像扩散模型LoRA水印
专题命中 指令微调 :foundation model(abstract)
AI总结 提出LoRA-Key框架,通过可重用的用户特定水印LoRA实现版权保护,无需重新训练或修改目标LoRA。
AQA-TTRL:音频问答中的测试时强化学习自适应
专题命中 指令微调 :language model(abstract)
AI总结 提出AQA-TTRL框架,通过测试时强化学习利用无标签数据实现音频语言模型的在线自适应,采用多数投票生成伪标签、置信度加权和多次采样策略,在MMAU等基准上显著提升性能。
Comments Accepted to INTERSPEECH 2026
无机材料电响应的通用学习
专题命中 指令微调 :foundation model(abstract)
AI总结 提出MACE-Field场感知等变势,通过精确微分获得极化、玻恩有效电荷和极化率,实现跨化学体系的铁电与介电响应预测。
Comments 22 pages, 12 figures, 43 equations
Journal ref PRX Intelligence 1, 013006 (2026)
QUARE:通过多智能体辩证协商进行质量感知的需求分析
专题命中 指令微调 :LLM(abstract)
AI总结 QUARE通过多智能体辩证协商解决需求质量分析中的多属性冲突,生成高质量需求规格,提升合规性和可验证性。