arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 15 篇

2608.24115 2026-08-26 cs.RO cs.AI 新提交 91%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: this https URL (https://worv-ai.github.io/ponderpounce/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24730 2026-08-26 cs.MM cs.HC 新提交 84%

Learning to Prefer Reliably: Error-Augmented Emotion Preference Optimization with Calibrated Fusion

学习可靠偏好:带校准融合的错误增强情感偏好优化

Zilong Huang, Junyi Peng, Junjie Li, Kai Li, Wenze Ren, Kong Aik Lee, Man-Wai Mak, Tatsuya Kawahara

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.MM

AI总结 针对情感偏好学习的稀疏监督与单一MLLM评判者的偏差问题,提出EAPO框架,构建错误增强数据集并通过边际校准软融合聚合多MLLM评判结果,提升情感偏好预测与鲁棒性。

Comments Accepted at ACM MM 2026 Workshop (MRAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-26 cs.CL cs.CV 版本更新 81%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 26 pages, 2 figures, 4 tables. This revision adds matched, inference-only Qwen2-VL-2B native/RIG L1 mechanism evidence: exact text-only equivalence, exact RIG Gauge invariance, native Gauge sensitivity, and retained same-instance spatial effects. Task-level Qwen benchmarks, training gains, stable task improvement, universality, and empirical superiority remain unestablished

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22979 2026-08-26 cs.AI 版本更新 79%

SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems

SA-RSQ:一种适用于多模态推荐系统的通用稀疏表示框架

Xiang Wang, Shigang Quan, Tingzhen Chang, Kang Yang, Sitong Chen, Yabo Fan, Xingxing Wang, Zhaodian He

机构 * Tianjin University(天津大学) Meituan(美团) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 针对工业多模态推荐系统的存储与延迟开销问题,提出SA-RSQ稀疏表示框架,经实验验证其在重构性能与CTR间的权衡表现良好,在线测试实现CTR与CPM的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24354 2026-08-26 cs.CR cs.AI cs.CL 新提交 79%

Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs

并非所有 token 都平等:多模态大语言模型(MLLMs)中后门的区域感知一致性修复

Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对 MLLMs 的后门风险,提出区域感知一致性修复框架 RACER,仅需 100 个干净样本即可有效抑制后门,平均 ASR 降至 1.1%且多数场景达 0%,同时保留模型正常效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24795 2026-08-26 cs.LG 新提交 78%

LION: A Clifford Neural Paradigm for Multimodal-Attributed Graph Learning

LION:面向多模态属性图学习的克利福德神经范式

Xunkai Li, Zekai Chen, Zhengyu Wu, Henan Sun, Daohan Su, Guang Zeng, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态属性图学习中模态对齐忽略上下文、模态融合缺乏适应性的问题,提出基于克利福德代数和解耦图神经范式的LION方法,在9个文本-图像多模态属性图数据集上的多类下游任务中显著优于现有最优基线。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24091 2026-08-26 cs.IR 新提交 78%

Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios

电商场景中用于点击率预测的原生多模态表示学习

Chao Yi, Feifan Yang, Jiawei Feng, Sishuo Chen, Zhangming Chan, Xiang-Rong Sheng, Han Zhu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对现有多模态CTR预测模型两阶段范式的缺陷,本文提出Mine-Then-Train方法,通过挖掘CTR数据的高质量样本微调多模态编码器,提升了模型性能。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交 74%

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24848 2026-08-26 cs.CL 新提交 70%

BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模

Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24366 2026-08-26 cs.CV cs.RO 新提交 70%

Variance-Guided Spatial Attention Fusion for Robust End-to-End Driving under Asymmetric Sensor Degradation

面向非对称传感器退化场景下鲁棒端到端驾驶的方差引导空间注意力融合

Weizhi Tao, Zengwang Jin, Xiao Wang, Hailong Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Anhui University(安徽大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出VG-SAF框架,通过物理增强器、模态专家与混合注意力机制,在CARLA Longest6基准上提升非对称传感器退化下的端到端驾驶鲁棒性。

Comments 17 pages, 9 figures, and 4 tables, including supplementary material. Submitted to IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04407 2026-08-26 eess.IV cs.CV cs.LG cs.MM 版本更新 62%

NAIMA: Semantics Aware RGB Guided Depth Super-Resolution

NAIMA:基于语义的RGB引导深度超分辨率

Tayyab Nasir, Daochang Liu, Ajmal Mian

机构 * The University of Western Australia(西澳大利亚大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出NAIMA框架,通过引导token注意力模块和DINOv2整合,提升RGB引导深度超分辨率的语义感知能力,在多尺度和数据集上实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24430 2026-08-26 cs.CV 新提交 57%

Vision Language Model Fusion for Explainable Face Recognition

用于可解释人脸识别的视觉语言模型融合

Ana Estrada-Real, Lydia Alapatt, Christoph Busch, Christian Rathgeb

机构 * Hochschule Darmstadt(达姆施塔特应用科学大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出多视觉语言模型(VLM)融合框架,结合相似度分数、文本解释与人脸图像,提升了人脸识别准确率,同时生成更丰富稳健的可解释决策,助力开发负责任的可解释人脸识别系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23970 2026-08-26 cs.AI cs.LG 新提交 57%

Giraffe: A Mapping Architecture from Hidden Text Representations to Visual Embeddings for Efficient Graphic Design

Giraffe:一种用于高效平面设计的从隐藏文本表示到视觉嵌入的映射架构

Nejla Ghaboosi

机构 * Canva Research(Canva研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 Giraffe 是一种轻量映射架构,以单 [IMG] token 实现从文本隐藏表示到视觉模型嵌入空间的转换,在平面设计生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23959 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 57%

NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution

NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。

Comments To appear in EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-08-26 cs.RO cs.AI 版本更新 57%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏