arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-14 至 2026-08-14 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 12 篇

2608.12533 2026-08-14 physics.ed-ph 新提交 50%

Probing AI-generated physics solutions and preparing students to critique them

探究人工智能生成的物理解答并培养学生对其进行评判的能力

Nikhil Sanjay Borse, Amir Bralin, Sean Savage, N. Sanjay Rebello

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过调整框架评估OpenAI的o4-mini生成的物理解答,发现明确提示可提升解答完整性,MAPS指导能让学生更精准评判AI解答,为物理教育研究提供了新视角。

Comments 6 pages, 1 figure, Physics Education Research Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2608.12721 2026-08-14 cs.CV 新提交 70%

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12674 2026-08-14 cs.AI 新提交 57%

Lines and Ladders: A Context-Aware Multi-Agent Framework for Large-Scale Retail Price Taxonomy

Lines and Ladders:面向大规模零售价格分类的上下文感知多智能体框架

Ravi Teja Chunduri, Srikaran Reddy Boya, Deep Narayan Mishra, Ajay Kumar B, Karthik Kumaran, Pranay Kona

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 针对大规模零售商品定价管理难题,提出上下文感知多智能体框架自动化构建Lines and Ladders价格分类,3智能体系统在Lines任务F1达0.83,在多品类数据上表现优异且已投入生产。

Comments 8 pages. Accepted in the Main Conference of IEEE ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12763 2026-08-14 cs.CE 新提交 50%

ARIES-Mission2: A Zero-Shot Vision-Language-Action Framework for Fast Large-Scale Aerial Mission Generation

ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架

Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang

专题命中 多模态Agent :multimodal(abstract)

AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 6 篇

2508.08199 2026-08-14 cs.CV 版本更新 85%

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-14 cs.CL cs.CV 版本更新 84%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 24 pages, 2 figures. Major theoretical revision: reformulated cross-instance geometry, null-relation analysis, relation-stratified normalization, and representation-aware traversal coordinates; expanded related work and implementation details. Preliminary technical report; empirical validation is left to future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13385 2026-08-14 cs.CV 新提交 83%

When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL

何时仅需任务向量?隐式多模态上下文学习的经验理论

Jiaqian Li

机构 * Brown University(布朗大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出选择-实现假说,通过受控多模态任务和VQA基准研究发现,静态任务向量的成功取决于演示诱导变化的跨查询共享程度,为隐式多模态上下文学习的方法选择提供了统一经验理论。

Comments Accepted by Empirical Theory in Representation Learning @ ECCV 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12944 2026-08-14 cs.LG eess.IV stat.ML 新提交 78%

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

CardioState-JEPA:面向共享心脏表征的延迟感知跨模态学习

Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

机构 * Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 CardioState-JEPA是一种延迟感知跨模态心脏基础模型,通过对齐ECG、PPG、PCG的共享生理表征,在25项下游任务上显著提升了各模态的分类性能,实现了异质心脏信号的相互监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13045 2026-08-14 cs.CV 新提交 57%

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

P2Fusion:基于提示的双先验蒸馏红外-可见光图像渐进融合

Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hefei University of Technology(合肥工业大学) Rocket Force University of Engineering(火箭军工程大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对红外-可见光图像融合的信息差异挑战,提出基于双固有提示的P2Fusion框架,结合Teach-to-Fuse机制与GDER模块,在多数据集上实现SOTA性能并提升下游感知鲁棒性。

Comments Accepted by ECCV 2026. Website: https://p2fusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03089 2026-08-14 cs.LG cs.AI 版本更新 57%

Constitutional On-Policy Safe Distillation

宪法性在策略安全蒸馏

Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Yi Liu, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2608.12724 2026-08-14 cs.LG 新提交 85%

MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning

MAG:流形引导的半监督多模态上下文学习

Zirui Cheng, Xun Xu, Tiankai Chen, Fady Rezk, Bowen Zheng, Xiaodong Shi, Shijie Li, Kangkang Lu, Bharadwaj Veeravalli, Nancy F. Chen

专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本研究提出MAG框架,通过将未标记多模态数据用于半监督传播的演示选择,提升多模态大语言模型的上下文学习性能,在8个基准的标签稀缺场景下优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.13892 2026-08-14 cs.CL cs.IR 79%

Like Article, Like Audience: Enforcing Multimodal Correlations for Disinformation Detection

Liesbeth Allein, Marie-Francine Moens, Domenico Perrotta

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

Journal ref Allein, Liesbeth, Marie-Francine Moens, and Domenico Perrotta. "Preventing profiling for ethical fake news detection." Information Processing & Management 60.2 (2023): 103206

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00406 2026-08-14 eess.SP cs.LG cs.RO 版本更新 50%

LOCUS-DT: Localization via Observation-Conditioned Uncertainty Scoring with Digital Twins

LOCUS-DT:基于数字孪生的观测条件不确定性评分定位方法

Haozhe Lei, Roberto Bomfin, Marwa Chafii, Sundeep Rangan

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出LOCUS-DT框架,利用数字孪生和学习评分函数处理室内多径定位,泛化性好,在Sionna测试中比高斯类基准更精准捕捉多模态后验结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07426 2026-08-14 cs.RO 50%

Cable-driven Continuum Robotics: Proprioception via Proximal-integrated Force Sensing

基于电缆驱动的连续机器人:通过近端集成力传感实现本体感觉

Gang Zhang, Junyan Yan, Jibiao Chen, Shing Shin Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) T Stone Robotics Institute(T Stone机器人研究所) Department of Mechanical and Automation Engineering(机械与自动化工程系) Shun Hing Institute of Advanced Engineering(顺兴先进工程研究院) Multi-Scale Medical Robotics Center(多尺度医疗机器人中心) Curve Robotics Limited(Curve机器人有限公司)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出了一种基于近端集成力传感的新型本体感觉方法,用于提升微尺度连续机器人在三维接触力感知和形状估计方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏