arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-04 至 2026-02-04 共收录 82 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 16 篇

2602.02927 2026-02-04 stat.ML cs.LG 78%

Training-Free Self-Correction for Multimodal Masked Diffusion Models

无需训练的多模态掩码扩散模型自校正

Yidong Ouyang, Panwen Hu, Zhengyan Wan, Zhe Wang, Liyan Xie, Dmitriy Bespalov, Ying Nian Wu, Guang Cheng, Hongyuan Zha, Qiang Sun

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) East China Normal University(华东师范大学) University of Virginia(弗吉尼亚大学) University of Minnesota(明尼苏达大学) Drexel university(德雷塞尔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Toronto(多伦多大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出无需训练的多模态掩码扩散模型自校正方法,通过减少采样步骤提升生成质量,适用于文本到图像和多模态理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 75%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03414 2026-02-04 cs.CV cs.AI 73%

Socratic-Geo: Synthetic Data Generation and Geometric Reasoning via Multi-Agent Interaction

Socratic-Geo:通过多智能体交互实现合成数据生成与几何推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai University of Finance(上海财经大学) Wuhan University(武汉大学)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 Socratic-Geo通过多智能体交互实现合成数据生成与几何推理,利用教师代理和求解代理动态耦合数据合成与模型学习,提升图像生成和推理能力。

Comments 18pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03533 2026-02-04 cs.CV 70%

PnP-U3D: Plug-and-Play 3D Framework Bridging Autoregression and Diffusion for Unified Understanding and Generation

PnP-U3D: 无缝接入3D框架,连接自回归与扩散以实现统一的理解与生成

Yongwei Chen, Tianyi Wei, Yushi Lan, Zhaoyang Lyu, Shangchen Zhou, Xudong Xu, Xingang Pan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 PnP-U3D提出结合自回归与扩散的统一3D理解和生成框架,通过轻量级Transformer实现跨模态信息交换,提升3D生成与编辑性能。

Comments Yongwei Chen and Tianyi Wei contributed equally. Project page: https://cyw-3d.github.io/PnP-U3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03069 2026-02-04 cs.DB 67%

Skill-Based Autonomous Agents for Material Creep Database Construction

基于技能的自主代理用于材料蠕变数据库构建

Yue Wu, Tianhao Su, Shunbo Hu, Deng Pan

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

AI总结 本文提出基于技能的自主代理框架,用于从科学文献中自动提取高保真的材料蠕变数据,实现物理自洽的数据库构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02820 2026-02-04 cs.LG cs.AI cs.CV 62%

From Tokens to Numbers: Continuous Number Modeling for SVG Generation

从标记到数字:用于SVG生成的连续数字建模

Michael Ogezi, Martin Bell, Freda Shi, Ethan Smith

机构 * Cheriton School of Computer Science, University of Waterloo, Waterloo, ON, Canada(滑铁卢大学计算机科学学院) Vector Institute(向量研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出连续数字建模(CNM)方法,通过直接建模连续数值提升SVG生成的效率与质量,实现训练速度提升30%及更高的视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03215 2026-02-04 stat.ML cs.AI cs.LG 57%

Latent Neural-ODE for Model-Informed Precision Dosing: Overcoming Structural Assumptions in Pharmacokinetics

隐式神经微分方程用于模型指导的精准给药:克服药代动力学中的结构假设

Benjamin Maurel, Agathe Guilloux, Sarah Zohar, Moreno Ursino, Jean-Baptiste Woillard

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出基于隐式神经ODE的模型,用于精准给药中的他克莫司AUC预测,通过模拟和临床验证展示了其在复杂生物动态建模中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02924 2026-02-04 cs.LG cs.SY eess.SY 50%

How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?

如何通过扩散模型使拉格朗日量引导安全强化学习?

Xiaoyuan Cheng, Wenxuan Yuan, Boyang Li, Yuanchao Xu, Yiming Yang, Hao Liang, Bei Peng, Robert Loftin, Zhuo Sun, Yukun Hu

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) University of California, San Diego(加州大学圣地亚哥分校) Kyoto University(京都大学) King's College London(伦敦国王学院) University of Sheffield(谢菲尔德大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出ALGD算法,通过增强拉格朗日方法解决安全强化学习中的稳定性问题,实现稳定有效的政策生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14943 2026-02-04 cs.HC 50%

State of the Art of LLM-Enabled Interaction with Visualization

大语言模型赋能的可视化交互现状

Mathis Brossier, Tobias Isenberg, Konrad Schönborn, Jonas Unger, Mario Romero, Johanna Björklund, Anders Ynnerman, Lonni Besançon

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文系统回顾了大语言模型与可视化交互的研究现状,分析了6个维度的48篇论文,突出了新兴设计模式和评估挑战,旨在指导未来LLM增强的可视化研究和系统设计。

Comments Submitted to STARs of EuroVis'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 11 篇

2602.03263 2026-02-04 cs.AI 85%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03268 2026-02-04 cs.LG cs.AI cs.MM 84%

Unveiling Covert Toxicity in Multimodal Data via Toxicity Association Graphs: A Graph-Based Metric and Interpretable Detection Framework

通过毒性关联图揭示多模态数据中的隐性毒性:一种基于图的度量方法和可解释检测框架

Guanzong Wu, Zihao Zhu, Siwei Lyu, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出基于图的毒性关联图方法,通过多模态毒性隐性度度量标准实现对隐性毒性的可解释检测,提升多模态毒性检测的透明度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02536 2026-02-04 cs.LG cs.AI cs.CL cs.CV 82%

From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation

从稀疏决策到密集推理:一种多属性轨迹范式用于多模态调制

Tianle Gu, Kexin Huang, Lingyu Li, Ruilin Luo, Shiyang Huang, Zongqi Wang, Yujiu Yang, Yan Teng, Yingchun Wang

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UniMod提出一种多属性轨迹范式,通过多维边界学习提升多模态调制效果,以更少的数据实现高效安全内容识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 79%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16196 2026-02-04 stat.ME 78%

Inference on the Significance of Modalities in Multimodal Generalized Linear Models

在多模态广义线性模型中模态显著性的推断

Wanting Jin, Guorong Wu, Quefeng Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种基于熵的度量方法,用于评估多模态广义线性模型中各模态的信息增益,并通过模拟和神经影像数据验证了其有效性。

Comments This research was supported by the National Institutes of Health under grant R01-AG073259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01751 2026-02-04 cs.LG q-bio.QM 71%

MGKAN: Predicting Asymmetric Drug-Drug Interactions via a Multimodal Graph Kolmogorov-Arnold Network

MGKAN:通过多模态图科拉莫戈洛夫-阿诺德网络预测非对称药物-药物相互作用

Kunyi Fan, Mengjie Chen, Longlong Li, Cunquan Qu

机构 * School of Mathematics, Shandong University, Jinan, China(山东大学数学学院) Data Science Institute, Shandong University, Jinan, China(山东大学数据科学研究院)

专题命中 多模态评测 :multimodal(title)

AI总结 MGKAN通过多模态图科拉莫戈洛夫-阿诺德网络有效预测非对称药物-药物相互作用,提升建模的非线性和方向性。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14661 2026-02-04 cs.DB cs.AI 57%

Abacus: A Cost-Based Optimizer for Semantic Operator Systems

Abacus:一种基于成本的语义运算系统优化器

Matthew Russo, Chunwei Liu, Sivaprasad Sudhir, Gerardo Vitagliano, Michael Cafarella, Tim Kraska, Samuel Madden

机构 * MIT(麻省理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 Abacus是一种基于成本的优化器,用于优化语义运算系统,通过评估运算符性能并优化系统质量、成本和延迟,实现更高效的文档处理任务。

Comments To be published in VLDB'26, 14 pages, 8 figures

Journal ref PVLDB, 19(5): 1060 - 1073, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03285 2026-02-04 cs.AI 57%

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03217 2026-02-04 cs.LG cs.AI 57%

Topology Matters: A Cautionary Case Study of Graph SSL on Neuro-Inspired Benchmarks

拓扑至关重要:图SSL在神经启发基准上的警示案例研究

May Kristine Jonson Carlon, Su Myat Noe, Haojiong Wang, Yasuo Kuniyoshi

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一个分层SSL框架,揭示了通用图SSL在连接体数据上的局限性,强调需设计拓扑感知的SSL目标以保持结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03416 2026-02-04 cs.IR 50%

AesRec: A Dataset for Aesthetics-Aligned Clothing Outfit Recommendation

AesRec:一个用于美学对齐的服装搭配推荐数据集

Wenxin Ye, Lin Li, Ming Li, Yang Shen, Kanghong Wang, Jimmy Xiangji Huang

专题命中 多模态评测 :multimodal(abstract)

AI总结 AesRec数据集通过系统化的定量美学注释,为开发与美学对齐的服装推荐系统提供了支持,实验表明整合量化美学信息能提升用户审美指导与个性化需求的满足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02564 2026-02-04 cs.LG cs.MA 50%

Label Curation Using Agentic AI

使用代理AI进行标签校准

Subhodeep Ghosh, Bayan Divaaniaazar, Md Ishat-E-Rabban, Spencer Clarke, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 AURA通过代理AI框架实现大规模多模态数据标注,通过概率模型联合推断真实标签和标注者可靠性,提升标注准确性并评估标注者质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 9 篇

2602.03028 2026-02-04 cs.CV 77%

MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration

MUSE:一种通过闭环认知协调的多智能体框架用于无约束故事构思

Wenzhang Sun, Zhenyu Wang, Zhangchi Hu, Chunfeng Wang, Hao Li, Wei Chen

机构 * Li Auto(利奥自动化)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 MUSE通过闭环认知协调的多智能体框架,提升长篇叙事的连贯性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03320 2026-02-04 cs.CV cs.AI 62%

MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning

MedSAM-Agent: 通过多轮代理强化学习赋能交互式医学图像分割

Shengyuan Liu, Liuxin Bao, Qi Yang, Wanting Geng, Boyun Zheng, Chenxin Li, Wenting Chen, Houwen Peng, Yixuan Yuan

机构 * Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hunyuan Group, Tencent(腾讯洪音集团) Institute of Automation, the Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Dalian University of Technology, Dalian, China(大连理工大学) Stanford University, Stanford, USA(斯坦福大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 MedSAM-Agent通过多轮代理强化学习提升医学图像分割的交互效率与准确性

Comments 23 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02559 2026-02-04 cs.AI cs.CV cs.LG cs.MA 62%

Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers

基于经验的多智能体系统是无需训练的上下文感知地球观测者

Pengyu Dai, Weihao Xuan, Junjue Wang, Hongruixuan Chen, Jian Song, Yafei Ou, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Hokkaido University(北海道大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GeoEvolver通过结构化交互使LLM代理无需训练即可获得地球观测专业知识,提升复杂任务的成功率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00197 2026-02-04 q-bio.QM cs.AI cs.CL 62%

Rank-and-Reason: Multi-Agent Collaboration Accelerates Zero-Shot Protein Mutation Prediction

Rank-and-Reason: 多智能体协作加速零样本蛋白质突变预测

Yang Tan, Yuanxi Yu, Can Wu, Bozitao Zhong, Mingchen Li, Guisheng Fan, Jiankang Zhu, Yafeng Liang, Nanqing Dong, Liang Hong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science(南方大学(科学)) East China University of Science and Technology(东中国科学与技术大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 Rank-and-Reason通过多智能体协作提升零样本蛋白质突变预测的准确性与效率,显著提高湿实验验证的成功率。

Comments 22 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03376 2026-02-04 cs.RO cs.CV 57%

PlanTRansformer: Unified Prediction and Planning with Goal-conditioned Transformer

PlanTRansformer: 一种结合目标条件变换器的统一预测与规划

Constantin Selzer, Fabina B. Flohr

机构 * Department of Electrical Engineering and Information Technology, Intelligent Vehicles Lab (IVL), Munich University of Applied Science(电气工程与信息科技系,智能车辆实验室(IVL),慕尼黑应用科学大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 PlanTRansformer通过整合目标条件预测、动态可行性等技术,提升自动驾驶中的预测与规划性能。

Comments Submitted and accepted at IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02961 2026-02-04 cs.AI 57%

Generative Engine Optimization: A VLM and Agent Framework for Pinterest Acquisition Growth

生成引擎优化:一个面向Pinterest获取增长的VLM和代理框架

Faye Zhang, Qianyu Cheng, Jasmine Wan, Vishwakarma Singh, Jinfeng Rao, Kofi Boakye

机构 * Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Pinterest提出GEO框架,通过微调VLM和AI代理预测用户搜索需求,构建语义连贯的集合页面,提升生成搜索时代的视觉平台流量增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03153 2026-02-04 cs.RO 50%

When Attention Betrays: Erasing Backdoor Attacks in Robotic Policies by Reconstructing Visual Tokens

当注意力背叛时:通过重建视觉标记在机器人策略中消除后门攻击

Xuetao Li, Pinhan Fu, Wenke Huang, Nengyuan Pan, Songhua Yang, Kaiyan Zhao, Guancheng Wan, Mengde Li, Jifeng Xuan, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Faculty of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Institute of Technological Sciences, Wuhan University(武汉大学技术科学研究院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 Bera通过重建视觉标记消除机器人策略中的后门攻击,无需重新训练模型即可有效防御后门风险。

Comments ICRA2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02959 2026-02-04 cs.LG cs.SY eess.SY 50%

Human-Centric Traffic Signal Control for Equity: A Multi-Agent Action Branching Deep Reinforcement Learning Approach

以人为中心的交通信号控制以实现公平性:一种多智能体动作分支深度强化学习方法

Xiaocai Zhang, Neema Nassir, Lok Sang Chan, Milad Haghani

机构 * Department of Infrastructure Engineering, Faculty of Engineering and Information Technology, The University of Melbourne, VIC 3010, Australia(工程与信息技术学院基础设施工程系,墨尔本大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种以人为中心的多智能体动作分支深度强化学习方法,通过分解交通走廊控制并优化旅行者公平性,有效减少受延迟旅行者数量,提升交通信号系统的公平性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12311 2026-02-04 cs.RO 50%

Scene-Adaptive Motion Planning with Explicit Mixture of Experts and Interaction-Oriented Optimization

场景自适应运动规划与显式专家混合及交互导向优化

Hongbiao Zhu, Liulong Ma, Xian Wu, Xin Deng, Xiaoyao Liang

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪公司自动驾驶新技术研究院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出EMoE-Planner,通过显式专家混合和交互导向优化,解决复杂城市环境中自主驾驶轨迹规划的多模态、场景多样性和环境交互问题,实现超越传统规则算法的性能。

Comments Main text 10 pages with 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 16 篇

2406.15098 2026-02-04 cs.LG cs.AI 83%

How Intermodal Interaction Affects the Performance of Deep Multimodal Fusion for Mixed-Type Time Series

多模态交互如何影响深度多模态融合在混合类型时间序列中的性能

Simon Dietz, Thomas Altstidl, Dario Zanca, Björn Eskofier, An Nguyen

机构 * FAU Erlangen-Nürnberg(弗赖堡大学埃尔朗根-纽伦堡分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文研究了多模态交互对深度多模态融合在混合类型时间序列预测中的影响,通过三种融合类型和五种融合方法的比较,揭示了交互强度和方向对融合策略选择的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏