Dual-Perspective Disentangled Multi-Intent Alignment for Enhanced Collaborative Filtering
双视角解耦多意图对齐用于增强协同过滤
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本文提出DMICF框架,通过双视角解耦多意图对齐方法,提升协同过滤的推荐效果,解决异构交互信号纠缠导致的语义模糊、鲁棒性差和可解释性不足问题。
Comments 11 pages, 8 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
双视角解耦多意图对齐用于增强协同过滤
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本文提出DMICF框架,通过双视角解耦多意图对齐方法,提升协同过滤的推荐效果,解决异构交互信号纠缠导致的语义模糊、鲁棒性差和可解释性不足问题。
Comments 11 pages, 8 figures
FineLAP: 通过异质监督驯化细粒度语言-音频预训练
机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) ; SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) ; Shanghai Innovation Institute(上海创新研究院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。
评估视觉语言和大语言模型用于印度尼西亚课堂自动学生评估
机构 * Quantic School of Business and Technology(Quantic商业与技术学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Indonesia University of Education(印度尼西亚教育大学) ; Monash University(莫纳什大学)
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 研究评估了视觉语言和大语言模型在印尼课堂中的自动学生评估效果,发现VLM在手写识别上存在困难,但LLM反馈仍具教学价值。
Comments Accepted at AIED 2026
在情境学习中选择数据是否有助于多模态大语言模型任务特定微调中的数据选择?
专题命中 VLM训练与架构 :multimodal large language model(abstract)
AI总结 本文提出CLIPPER方法,通过情境学习选择数据,提高多模态大语言模型任务特定微调的效率,实验表明其在数据效率和计算成本上优于现有方法。
Comments Accepted by ICME 2026
点桥:跨领域策略学习的3D表示
机构 * NVIDIA ; New York University(纽约大学) ; University of Washington(华盛顿大学)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。
既非此处亦非彼处:多语言编码器中混合语言文本的跨语言表示动态
机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) ; Microsoft Corporation(微软公司)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 研究探讨多语言编码器对混合语言文本的内部表示,发现标准模型在英语和印地语间表现良好,但混合文本与任一语言连接松散。通过训练混合数据可提升英语混合文本对齐,但损害英语-印地语对齐。引入三语后训练目标,使混合文本表示更接近构成语言,提升跨语言理解。
Comments 24 pages
边缘-云协同语音情绪描述 via 令牌级推测解码在音频-语言模型中
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本文提出基于不确定性引导推测解码的边缘-云协同框架,通过轻量级边缘模型和云验证器的协同,提升语音情绪描述的准确率和效率,同时降低延迟和隐私风险。
从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移
机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) ; Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。
模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系
专题命中 VLM训练与架构 :vision language model(abstract)
AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。
隐形微调:通过自动生成的CoT打破RVLMs的对齐
机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) ; University of Wisconsin--Madison(威斯康星大学麦迪逊分校) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。
Comments 15 pages, 7 figures
ArthroCut:膝关节置换术中机器人骨切除的自主策略学习
机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) ; School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) ; Longwood Valley MedTech
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 ArthroCut通过结合术前和术中数据,实现膝关节置换术中骨切除的自主策略学习,提升机器人手术的自主性和可解释性。
Comments Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA)
FAVLA:一种力适应的快速-慢速VLA模型用于接触丰富的机械臂操作
机构 * University of Science and Technology of China(中国科学技术大学) ; Xi'an Jiaotong University(西安交通大学) ; Central South University(中南大学)
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 FAVLA通过解耦慢感知规划与快速接触感知控制,提升接触丰富任务中的反应性和成功率。
并非所有注意力都是必需的:面向多模态大语言模型的参数和计算高效迁移学习
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) ; Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)
专题命中 VLM训练与架构 :MLLM(abstract)
AI总结 本文提出高效注意力跳过方法,通过减少冗余注意力计算提升多模态大语言模型的推理效率与性能。
将Gemma3映射到边缘数据流架构上
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 本文提出将Gemma3模型高效部署到边缘数据流架构上,通过硬件感知技术提升推理速度和能效,实现低功耗的LLM和VLM边缘推理。
Comments Original Version, data shall be updated
大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。
可泛化的粗到细机器人操作 via 语言对齐的3D关键点
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 CLAP通过任务分解、VLM微调和3D感知表示,提升机器人操作在新指令和环境下的泛化能力,实现更高的样本效率和操作精度。
Comments Published in ICLR 2026
表征对齐假说:跨嵌入模态的不变语义结构的证据及其后果
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 该研究提出表征对齐假说,探讨跨模态嵌入的不变语义结构,质疑其根本性,并提出新的哲学视角和区分方法。
Comments 23 pages, 3 figures
RoboSolver: 一种基于多智能体大语言模型的机器人臂问题求解框架
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 RoboSolver通过多智能体框架结合LLM和VLM,实现机器人臂问题的自动求解,准确率达0.97。
AgentRob: 从虚拟论坛代理到被劫持的物理机器人
机构 * Peking University(北京大学)
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 AgentRob通过模型上下文协议连接虚拟论坛与物理机器人,实现多代理协作控制,展示了论坛驱动的多机器人协调可行性。
Comments 10 pages, 2 figures
强化课程预对齐用于领域自适应视觉-语言模型
机构 * Tencent(腾讯)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文提出RCPA方法,通过课程意识的渐进调节机制,在领域自适应中平衡领域知识获取与通用能力保持。
ProAgentBench:基于真实数据评估LLM代理的前瞻性帮助
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 ProAgentBench通过真实用户数据构建基准,评估LLM代理在连续工作流程中的前瞻性帮助能力,揭示真实数据对预测准确性的提升作用。
PairUni: 用于统一多模态语言模型的成对训练
机构 * ByteDance(字节跳动)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。
Comments 22 pages, 11 figures, and 10 tables
LEAD:逐层专家对齐解码以生成准确的放射学报告
专题命中 VLM训练与架构 :vision language model(abstract)
AI总结 LEAD通过逐层专家对齐解码方法,提升放射学报告生成的准确性并减少幻觉。
A2Eval: 基于代理的自动评估用于具身脑
机构 * Zhejiang University, China(浙江大学) ; Westlake University, China(西湖大学) ; Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) ; University of Manchester, UK(曼彻斯特大学) ; Southern University of Science(南方科技大学) ; Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。
对大型行为模型在机器人操作中协同训练数据模态和策略的系统研究
机构 * Toyota Research Institute, Cambridge MA(丰田研究院) ; Tsinghua University, Beijing, China(清华大学)
专题命中 VLM训练与架构 :vision-language model(abstract)
AI总结 本文研究了机器人操作中协同训练不同数据模态和策略对行为模型性能的影响,发现视觉语言和跨身体数据显著提升泛化能力,而离散动作令牌无明显优势。
Shallow-π:基于流的视觉-语言-动作模型的知识蒸馏
机构 * Samsung Research South Korea(三星韩国研究)
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 Shallow-π通过知识蒸馏显著减少基于流的VLA模型的transformer深度,实现更快的推理速度和更高的性能
熊、所有熊,以及一些熊。语言模型归纳推理中的语言约束
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 VLM训练与架构 :vision language model(abstract)
AI总结 该研究探讨了视觉语言模型在区分不同归纳推理类型时的语言约束,通过实验发现模型与人类在行为上具有一致性,差异源于归纳约束而非表层形式。
AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型
机构 * Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :InternVL(abstract)
AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。
通过多任务学习与NLU集成实现统一的多模态和多语言检索
专题命中 VLM训练与架构 :vision language model(abstract)
AI总结 本文提出通过多任务学习与NLU集成实现统一的多模态和多语言检索,提升跨语言和跨模态的检索效率与准确性。
Comments 4 pages, 2 figures, submitted to IEEE ICASSP 2026
NewsRECON: 用于图像上下文化的新闻文章检索
机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(通用知识处理实验室(UKP实验室)、计算机科学系、图恩大学(TU Darmstadt)和应用网络安全国家研究中心ATHENE) ; Department of Electrical Engineering, KU Leuven(电气工程系、鲁汶大学) ; Department of Computer Science, KU Leuven(计算机科学系、鲁汶大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract)
AI总结 NewsRECON通过链接图像与相关新闻文章,利用元数据推断图像日期和位置,优于现有方法并结合多模态大语言模型实现新的SOTA结果。
Comments Preprint under review. Code available at https://github.com/jtonglet/arxiv2025-newsrecon