arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 86 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2604.23775 2026-08-26 cs.RO 版本更新 67%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23572 2026-08-26 q-bio.NC cs.AI cs.CV 新提交 62%

A Human-Factors Guided Cognitive Model of Visuospatial Complexity in Embodied Active Vision

面向具身主动视觉的、由人因因素引导的视觉空间认知复杂度模型

Vasiliki Kondyli, Jakob Suchan, Mehul Bhatt

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出一种多模态复杂度分析框架,以具身认知和主动视觉理论为基础,结合人因因素,为日常驾驶场景下视觉空间复杂度的表征及相关数据集构建提供理论支撑。

Comments Preprint; AIC 2025: Artificial Intelligence and Cognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24877 2026-08-26 cs.CV 新提交 57%

From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

从感知到行动:智能眼镜作为第一人称智能平台

Jiangning Zhang, Haojun Chen, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 该综述首次以统一框架系统研究智能眼镜,提出L0-L5框架等,连接任务与多类要素,制定评估协议,为智能眼镜的可信第一人称智能发展提供路线图。

Comments Project at this https URL (https://github.com/zhangzjn/awesome-smart-glasses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24169 2026-08-26 cs.CV cs.GR cs.HC 新提交 57%

ViSculpt: Visual-Centric Agentic Geometry Editing

ViSculpt:以视觉为中心的智能体几何编辑

Bo Pang, Jiaqi Pan, Xiaocheng Zhang, Jiacheng Xu, Guoping Wang, Peng-Shuai Wang

机构 * Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 该研究提出以视觉为中心的无训练多智能体系统ViSculpt,通过Blender GUI直接编辑现有三维网格,可遵循指令执行局部编辑并保留资产整体特征,为语言驱动的三维编辑提供了新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-26 cs.AI physics.flu-dyn 版本更新 57%

Self-Evolving Scientific Agent Designs Physically-Reasoned Whitebox Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10863 2026-08-26 cs.LG cs.AI 版本更新 57%

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体

Cong Pang, Xuyu Feng, Yujie Yi, Jiaqi Su, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

机构 * Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) SenseTime Research(商汤科技研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24749 2026-08-26 cs.SE 新提交 50%

From Natural Language Requirements to Graphical User Interfaces: Automated Prototyping and Verification with Pretrained Language Models

从自然语言需求到图形用户界面:基于预训练语言模型的自动原型设计与验证

Kristian Kolthoff

专题命中 多模态Agent :multimodal(abstract)

AI总结 本研究针对将自然语言需求转化为GUI原型及GUI应用需求验证的两大挑战,提出基于预训练语言模型的自动化方法,可显著减少相关手动工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 15 篇

2608.24115 2026-08-26 cs.RO cs.AI 新提交 91%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: this https URL (https://worv-ai.github.io/ponderpounce/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24730 2026-08-26 cs.MM cs.HC 新提交 84%

Learning to Prefer Reliably: Error-Augmented Emotion Preference Optimization with Calibrated Fusion

学习可靠偏好:带校准融合的错误增强情感偏好优化

Zilong Huang, Junyi Peng, Junjie Li, Kai Li, Wenze Ren, Kong Aik Lee, Man-Wai Mak, Tatsuya Kawahara

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.MM

AI总结 针对情感偏好学习的稀疏监督与单一MLLM评判者的偏差问题,提出EAPO框架,构建错误增强数据集并通过边际校准软融合聚合多MLLM评判结果,提升情感偏好预测与鲁棒性。

Comments Accepted at ACM MM 2026 Workshop (MRAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-26 cs.CL cs.CV 版本更新 81%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 26 pages, 2 figures, 4 tables. This revision adds matched, inference-only Qwen2-VL-2B native/RIG L1 mechanism evidence: exact text-only equivalence, exact RIG Gauge invariance, native Gauge sensitivity, and retained same-instance spatial effects. Task-level Qwen benchmarks, training gains, stable task improvement, universality, and empirical superiority remain unestablished

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22979 2026-08-26 cs.AI 版本更新 79%

SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems

SA-RSQ:一种适用于多模态推荐系统的通用稀疏表示框架

Xiang Wang, Shigang Quan, Tingzhen Chang, Kang Yang, Sitong Chen, Yabo Fan, Xingxing Wang, Zhaodian He

机构 * Tianjin University(天津大学) Meituan(美团) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 针对工业多模态推荐系统的存储与延迟开销问题,提出SA-RSQ稀疏表示框架,经实验验证其在重构性能与CTR间的权衡表现良好,在线测试实现CTR与CPM的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24354 2026-08-26 cs.CR cs.AI cs.CL 新提交 79%

Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs

并非所有 token 都平等:多模态大语言模型(MLLMs)中后门的区域感知一致性修复

Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对 MLLMs 的后门风险,提出区域感知一致性修复框架 RACER,仅需 100 个干净样本即可有效抑制后门,平均 ASR 降至 1.1%且多数场景达 0%,同时保留模型正常效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24795 2026-08-26 cs.LG 新提交 78%

LION: A Clifford Neural Paradigm for Multimodal-Attributed Graph Learning

LION:面向多模态属性图学习的克利福德神经范式

Xunkai Li, Zekai Chen, Zhengyu Wu, Henan Sun, Daohan Su, Guang Zeng, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态属性图学习中模态对齐忽略上下文、模态融合缺乏适应性的问题,提出基于克利福德代数和解耦图神经范式的LION方法,在9个文本-图像多模态属性图数据集上的多类下游任务中显著优于现有最优基线。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24091 2026-08-26 cs.IR 新提交 78%

Native Multimodal Representation Learning for Click-Through Rate Prediction in E-Commerce Scenarios

电商场景中用于点击率预测的原生多模态表示学习

Chao Yi, Feifan Yang, Jiawei Feng, Sishuo Chen, Zhangming Chan, Xiang-Rong Sheng, Han Zhu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对现有多模态CTR预测模型两阶段范式的缺陷,本文提出Mine-Then-Train方法,通过挖掘CTR数据的高质量样本微调多模态编码器,提升了模型性能。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交 74%

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24848 2026-08-26 cs.CL 新提交 70%

BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模

Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24366 2026-08-26 cs.CV cs.RO 新提交 70%

Variance-Guided Spatial Attention Fusion for Robust End-to-End Driving under Asymmetric Sensor Degradation

面向非对称传感器退化场景下鲁棒端到端驾驶的方差引导空间注意力融合

Weizhi Tao, Zengwang Jin, Xiao Wang, Hailong Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Anhui University(安徽大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出VG-SAF框架,通过物理增强器、模态专家与混合注意力机制,在CARLA Longest6基准上提升非对称传感器退化下的端到端驾驶鲁棒性。

Comments 17 pages, 9 figures, and 4 tables, including supplementary material. Submitted to IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04407 2026-08-26 eess.IV cs.CV cs.LG cs.MM 版本更新 62%

NAIMA: Semantics Aware RGB Guided Depth Super-Resolution

NAIMA:基于语义的RGB引导深度超分辨率

Tayyab Nasir, Daochang Liu, Ajmal Mian

机构 * The University of Western Australia(西澳大利亚大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出NAIMA框架,通过引导token注意力模块和DINOv2整合,提升RGB引导深度超分辨率的语义感知能力,在多尺度和数据集上实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24430 2026-08-26 cs.CV 新提交 57%

Vision Language Model Fusion for Explainable Face Recognition

用于可解释人脸识别的视觉语言模型融合

Ana Estrada-Real, Lydia Alapatt, Christoph Busch, Christian Rathgeb

机构 * Hochschule Darmstadt(达姆施塔特应用科学大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出多视觉语言模型(VLM)融合框架,结合相似度分数、文本解释与人脸图像,提升了人脸识别准确率,同时生成更丰富稳健的可解释决策,助力开发负责任的可解释人脸识别系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23970 2026-08-26 cs.AI cs.LG 新提交 57%

Giraffe: A Mapping Architecture from Hidden Text Representations to Visual Embeddings for Efficient Graphic Design

Giraffe:一种用于高效平面设计的从隐藏文本表示到视觉嵌入的映射架构

Nejla Ghaboosi

机构 * Canva Research(Canva研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 Giraffe 是一种轻量映射架构,以单 [IMG] token 实现从文本隐藏表示到视觉模型嵌入空间的转换,在平面设计生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23959 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 57%

NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution

NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。

Comments To appear in EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-08-26 cs.RO cs.AI 版本更新 57%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 4 篇

2511.08847 2026-08-26 q-bio.NC math.DS 版本更新 78%

Data-Driven Modeling of Spatiotemporal Dynamics Using Multimodal Imaging Data

基于多模态成像数据的时空动力学数据驱动建模

Chunyan Li, Yutong Mao, Xiao Liu, Wenrui Hao

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 该研究提出基于图的个性化动力学建模框架,整合多模态纵向成像数据,在1891名阿尔茨海默病患者中准确预测生物标志物轨迹,揭示个体化进展模式,优于现有基准。

Comments Provisionally accepted for publication in PLOS Computational Biology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13577 2026-08-26 cs.CV cs.LG cs.RO 版本更新 57%

Adaptive Multi-Mode Out-of-Distribution Detection for Trajectory Prediction in Autonomous Vehicles

动态感知:面向自动驾驶轨迹预测的自适应多模式异常检测

Tongfei Guo, Lili Su

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种自适应多模式异常检测框架,通过建模误差模式提升轨迹预测的鲁棒性,在复杂驾驶环境中实现更高效的异常检测。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24880 2026-08-26 eess.SP 新提交 50%

Coherent Direct D-MIMO Localization

相干直接D-MIMO定位

Benjamin J. B. Deutschmann, Lukas D'Angelo, Erik Leitinger, Klaus Witrisal

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对D-MIMO定位中相干处理的同步校准难题,本文提出基于I/II型似然的贝叶斯状态空间滤波器,证明相干处理性能更优,且推导了低复杂度并行粒子置信传播方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19428 2026-08-26 cond-mat.mtrl-sci 版本更新 50%

Mapping optical, chemical, structural features in ZrO2 via cross-sectional SEM-Cathodoluminescence correlation microscopy

通过交叉截面SEM-阴极发光相关显微镜映射ZrO2的光学、化学和结构特征

Ricardo Vidrio, Yuhan Tong, Junliang Liu, Bil Schneider, William O. Nachlas, Nathan Curtis, Maryam Zahedian, Alexander Kvit, Hongliang Zhang, Zefeng Yu, Ximeng Wang, Yongfeng Zhang, Adrien Couet, Jennifer T. Choy

专题命中 其他多模态 :multi-modal(abstract)

AI总结 通过交叉截面SEM-阴极发光相关显微镜研究ZrO2中光学、化学和结构特征的关联,揭示缺陷与微结构对电荷传输的影响。

Comments revised the funding number of the DOE BES to the correct one

详情

展开后加载摘要…

URL PDF HTML 收藏