arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-10 至 2026-02-10 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 13 篇

2411.11195 2026-02-10 cs.CR 88%

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

SoK:通过信息流和不对称威胁的全局博弈论分析,多模态基础模型的安全-安全性连续体

Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

专题命中 多模态Agent :multimodal(title,abstract);multimodal foundation model(title,abstract)

AI总结 本文通过信息流和博弈论分析,探讨多模态基础模型的安全与安全性连续体,提出系统级防护优于模型级防护,并定义自我破坏阈值以触发终止机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08211 2026-02-10 cs.CV 83%

Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension

Chain-of-Caption: 无需训练提升多模态大语言模型的指称表达理解

Yik Lung Pang, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出无需训练的Chain-of-Caption框架,通过结合多种上下文提升多模态大语言模型在指称表达理解任务中的性能。

Comments 4 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07624 2026-02-10 cs.AI 79%

M2A: Multimodal Memory Agent with Dual-Layer Hybrid Memory for Long-Term Personalized Interactions

M2A:具有双层混合记忆的多模态记忆代理用于长期个性化交互

Junyu Feng, Binxiao Xu, Jiayi Chen, Mengyu Dai, Cenyang Wu, Haodong Li, Bohan Zeng, Yunliu Xie, Hao Liang, Ming Lu, Wentao Zhang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 M2A通过双层混合记忆系统实现长期多模态交互中的个性化响应,利用在线更新机制提升用户偏好适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07215 2026-02-10 eess.SY cs.AI cs.DC cs.SY 79%

Multi-Agentic AI for Fairness-Aware and Accelerated Multi-modal Large Model Inference in Real-world Mobile Edge Networks

多智能体AI用于现实世界移动边缘网络中公平性感知和加速的多模态大模型推理

Haiyuan Li, Hari Madhukumar, Shuangyi Yan, Yulei Wu, Dimitra Simeonidou

机构 * Smart Internet Lab, Department of Electrical and Electronic Engineering, University of Bristol(布里斯托大学电子与电气工程系智能互联网实验室)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多智能体AI框架,通过优化提示路由和模型部署,实现移动边缘网络中多模态大模型推理的低延迟与高公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08368 2026-02-10 cs.MM cs.GR cs.HC cs.MA 70%

T2VTree: User-Centered Visual Analytics for Agent-Assisted Thought-to-Video Authoring

T2VTree: 以用户为中心的视觉分析用于代理辅助的思维到视频创作

Zhuoyun Zheng, Yu Dong, Gaorong Liang, Guan Li, Guihua Shan, Shiyu Cheng, Dong Tian, Jianlong Zhou, Jie Liang

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.MM

AI总结 T2VTree通过树形可视化和可编辑代理计划,支持多场景视频创作中的可靠细化、局部比较和实用重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07749 2026-02-10 cs.AI 57%

Geo-Code: A Code Framework for Reverse Code Generation from Geometric Images Based on Two-Stage Multi-Agent Evolution

Geo-Code: 一种基于双阶段多智能体演化的几何图像反向代码生成框架

Zhenyu Wu, Yanxi Long, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University, Beijing, China(人工智能学院,北京师范大学,北京,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Geo-Code提出一种基于双阶段多智能体演化的几何图像反向代码生成框架,通过像素级锚定和度量驱动的代码演化提升几何重建精度和视觉一致性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00181 2026-02-10 cs.CR cs.AI cs.LG 57%

CHAI: Command Hijacking against embodied AI

CHAI:针对具身AI的命令劫持

Luis Burbano, Diego Ortiz, Qi Sun, Siwei Yang, Haoqin Tu, Cihang Xie, Yinzhi Cao, Alvaro A Cardenas

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 CHAI是一种针对具身AI的物理环境间接提示注入攻击,通过嵌入误导性自然语言指令,利用多模态语言解释能力,有效提升了攻击性能,凸显了对传统对抗鲁棒性之外的防御需求。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07092 2026-02-10 cs.MA cs.AI 57%

Lemon Agent Technical Report

柠檬代理技术报告

Haipeng Jiang, Kailong Ren, Zimo Yin, Zhetao Sun, Xin Gan, Guangyi Lv, Ming He, Peng Wang, Congli Yin, Hong Pan, Changwen Zhang, Shan Tong, Zhengyu Xu, Zeping Chen, Yubin Huangfu, Yanzhi Xu, Xing Su, Qin Feng, Dong An, Jianping Fan

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 柠檬代理是一种基于AgentCortex框架的多代理系统,通过自适应调度和三级上下文管理策略,优化资源利用和任务处理效率,实现复杂场景下的高准确率表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01100 2026-02-10 cs.RO 50%

StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating

StreamVLA: 通过完成状态门控打破原因-行动循环

Tongqing Chen, Hang Wu, Jiasen Wang, Xiaotao Li, Lu Fang

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Shanghai University(上海大学) Wuhan University(武汉大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 StreamVLA通过完成状态门控机制,实现高效机器人操作,减少推理延迟并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11510 2026-02-10 stat.OT stat.CO 50%

Here Be Dragons: Bimodal posteriors arise from numerical integration error in longitudinal models

此处有龙:纵向模型中双峰后验分布源于数值积分误差

Tess O'Brien, Matthew T. Moores, David Warton, Daniel Falster

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文研究了纵向模型中数值积分误差导致的双峰后验分布问题,提出通过合适方法避免双峰性,对贝叶斯反演方法有重要影响。

Comments 33 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06966 2026-02-10 cs.RO 50%

Embodied Intelligence for Flexible Manufacturing: A Survey

具身智能在柔性制造中的应用:综述

Kai Xu, Hang Zhao, Ruizhen Hu, Min Yang, Hao Liu, Hui Zhang, Haibin Yu

机构 * National University of Defense Technology(中国人民解放军国防科技大学) Wuhan University(武汉大学) Shenzhen University(深圳大学) Hunan University(湖南大学) Shenyang Institute of Automation Chinese Academy of Sciences(中国科学院沈阳自动化研究所)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文综述了具身智能在柔性制造中的应用,分析了感知、控制和决策三个层面的技术挑战,并提出三阶段进化模型以指导其发展。

Comments in chinese language. ROBOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06030 2026-02-10 cs.MA cs.LG 50%

PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling

PhysicsAgentABM: 基于物理的生成基于主体的建模

Kavana Venkatesh, Yinhan He, Jundong Li, Jiaming Cui

机构 * University of Virginia(弗吉尼亚大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 PhysicsAgentABM通过结合符号推理与神经网络,实现基于物理的生成式主体建模,提升大规模模拟的准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏