arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2608.14026 2026-08-26 cs.CE 版本更新 85%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-08-26 cs.RO 版本更新 67%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23572 2026-08-26 q-bio.NC cs.AI cs.CV 新提交 62%

A Human-Factors Guided Cognitive Model of Visuospatial Complexity in Embodied Active Vision

面向具身主动视觉的、由人因因素引导的视觉空间认知复杂度模型

Vasiliki Kondyli, Jakob Suchan, Mehul Bhatt

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出一种多模态复杂度分析框架,以具身认知和主动视觉理论为基础,结合人因因素,为日常驾驶场景下视觉空间复杂度的表征及相关数据集构建提供理论支撑。

Comments Preprint; AIC 2025: Artificial Intelligence and Cognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24877 2026-08-26 cs.CV 新提交 57%

From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

从感知到行动:智能眼镜作为第一人称智能平台

Jiangning Zhang, Haojun Chen, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 该综述首次以统一框架系统研究智能眼镜,提出L0-L5框架等,连接任务与多类要素,制定评估协议,为智能眼镜的可信第一人称智能发展提供路线图。

Comments Project at this https URL (https://github.com/zhangzjn/awesome-smart-glasses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24169 2026-08-26 cs.CV cs.GR cs.HC 新提交 57%

ViSculpt: Visual-Centric Agentic Geometry Editing

ViSculpt:以视觉为中心的智能体几何编辑

Bo Pang, Jiaqi Pan, Xiaocheng Zhang, Jiacheng Xu, Guoping Wang, Peng-Shuai Wang

机构 * Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 该研究提出以视觉为中心的无训练多智能体系统ViSculpt,通过Blender GUI直接编辑现有三维网格,可遵循指令执行局部编辑并保留资产整体特征,为语言驱动的三维编辑提供了新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-26 cs.AI physics.flu-dyn 版本更新 57%

Self-Evolving Scientific Agent Designs Physically-Reasoned Whitebox Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10863 2026-08-26 cs.LG cs.AI 版本更新 57%

ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents

ICA: 信息感知的信用分配用于基于视觉的长周期信息寻求智能体

Cong Pang, Xuyu Feng, Yujie Yi, Jiaqi Su, Zixuan Chen, Jiawei Hong, Tiankuo Yao, Nang Yuan, Jiapeng Luo, Lewei Lu, Xin Lou

机构 * Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) SenseTime Research(商汤科技研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出ICA方法,通过视觉快照和信息层面信用分配,提升开放网络环境中信息寻求智能体的性能。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24749 2026-08-26 cs.SE 新提交 50%

From Natural Language Requirements to Graphical User Interfaces: Automated Prototyping and Verification with Pretrained Language Models

从自然语言需求到图形用户界面:基于预训练语言模型的自动原型设计与验证

Kristian Kolthoff

专题命中 多模态Agent :multimodal(abstract)

AI总结 本研究针对将自然语言需求转化为GUI原型及GUI应用需求验证的两大挑战,提出基于预训练语言模型的自动化方法,可显著减少相关手动工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏