arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 170 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 18 篇

2604.02583 2026-08-18 cs.CV 版本更新 70%

FusionBERT: Multi-View Image--3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder

FusionBERT: 多视角图像-3D检索 via 跨注意力视觉融合与正常感知3D编码器

Wei Li, Yufan Ren, Hanqing Jiang, Jianhui Ding, Zhen Peng, Leman Feng, Yichun Shentu, Guoqiang Xu, Baigui Sun

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(三一集团Wolf 1069 b实验室) Zhejiang University(浙江大学) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) BPIT, Sany Group(三一集团BPIT)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 FusionBERT通过跨注意力视觉融合和正常感知3D编码器,实现多视角图像-3D多模态检索,提升跨模态检索性能。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12779 2026-08-18 cs.CV cs.CL 62%

Open Vocabulary Panoptic Segmentation With Retrieval Augmentation

开放词汇全景分割与检索增强

Nafis Sadeq, Qingfeng Liu, Mostafa El-Khamy

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出RetCLIP方法,通过检索增强提升开放词汇全景分割的性能,实现对未见类别的有效分割。

Journal ref IEEE International Workshop on Machine Learning for Signal Processing (MLSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16417 2026-08-18 cs.CL 新提交 57%

D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

D2-ScaleAgent:面向长文档理解的双维度缩放方法

Hao Zhang, Longrong Yang, Lunhao Duan, Ziyang Wang, Qing-Guo Chen, Shanshan Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15736 2026-08-18 cs.AI 新提交 57%

Toward AI-Friendly Cartography: Understanding How Color Design Influences Foundation Model Spatial Reasoning on Sequential Choropleth Maps

面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理

Yonghe Sun, Zhenjia Liu, Hua Liao, Wenjia Xu, Nai Yang, Weihua Dong, Zhiwei Wei

机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。

Comments 42 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14666 2026-08-18 cs.AI 新提交 57%

Cross-Domain Industrial Fault Detection by Causal Mechanism Monitoring

基于因果机制监测的跨域工业故障检测

Dhiraj Neupane, Mohamed Reda Bouadjenek, Richard Dazeley, Sunil Aryal

机构 * Deakin University(迪肯大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对工业系统的耦合故障检测问题,提出CMR-Mamba方法,通过因果正则化的Mamba编码器与kNN流形评分实现跨域故障检测,在多类耦合故障域上优于基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14627 2026-08-18 eess.SP 新提交 50%

AI-Native 6G for Distributed Intelligence: Traffic Characteristics, Awareness, and AI Grid

面向分布式智能的AI原生6G:流量特性、感知与AI网格

Lopamudra Kundu, Xingqin Lin, Shuvo Chowdhury, Sree Sankar

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对AI原生6G的流量特性等问题,提出AI Grid分布式AI基础设施平台,结合AI感知连接使6G成为分布式智能平台。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16407 2026-08-18 cs.IR cs.LG 新提交 50%

POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment

结合大语言模型增强多图学习与对比对齐的兴趣点推荐

Burak Tamer, Wolfram Höpken, Zehui Wang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15741 2026-08-18 cs.RO 新提交 50%

Some Modifications to Our End-to-End UAV Planner

对我们的端到端无人机规划器的若干改进

Junjie Lu, Bailing Tian

机构 * TJU-Aerial-Robotics(TJU空中机器人实验室)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 该研究针对端到端无人机规划器YOPO的缺陷,通过采用MINCO参数化、扩展多模态预测、添加动态约束及替换损失函数等改进,提升了轨迹质量与避障安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15624 2026-08-18 cs.IR 新提交 50%

Can Retrievers Find the Same Paper from Different Aspects? A Multi-Aspect Full-Paper Scientific Retrieval Benchmark

检索器能否从不同方面找到同一篇论文?一个多方面全论文科学检索基准

Yiyang Wei, Fang Guo, Qiji Zhou, Zhizhang Fu, Mengru Ding, Kai Yang, Yue Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究推出多方面全论文科学检索基准MAPLE及查询生成流程MAPLE-Synth,发现现有检索器在从单一方面与多方面检索论文间存在显著差距,为相关检索器研发提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 22 篇

2608.16513 2026-08-18 cs.CV cs.AI 新提交 91%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16484 2026-08-18 cs.CV 新提交 91%

Remote-Sensing City Layout Extraction with MLLM

基于多模态大语言模型(MLLM)的遥感城市布局提取

Zigan Zhou, Kai Li, Yupeng Deng

机构 * City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute(空天信息创新研究院)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本研究提出Code-as-City方法,利用MLLM将遥感顶视图图像转化为含平面与3D输出的可编辑城市布局,在CityLayout-100数据集上取得41.1%、48.3%的交并比,验证了视觉观测转城市代码的可行性。

Comments 4 pages, 2 figures, 4 tables. Accepted to IEEE APGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14584 2026-08-18 cs.CL cs.AI 新提交 84%

Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework

多模态生成模糊系统:模糊推理引导的大模型交互式问答框架

Hailong Yang, Jianqi Wang, Guanjin Wang, Zhaohong Deng

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多模态问答的模态偏差、知识不确定性与推理深度不足问题,提出多模态生成模糊系统(MMGFS),通过多模态协同沉思机制与模糊规则多跳推理实现性能提升,在多数据集上优于现有方法。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-18 cs.CV 版本更新 83%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 多模态生成 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14710 2026-08-18 cs.CV cs.AI cs.CL 新提交 82%

Path2ST: Hierarchical Cell-Tissue Grounded Cross-Modal Translation for Spatial Transcriptomics

Path2ST:面向空间转录组学的基于细胞-组织层级的跨模态转换方法

Ruochen Liu, Wei Lou

机构 * University of Liverpool(利物浦大学) Zhejiang Normal University(浙江师范大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Path2ST是一种基于细胞-组织层级的跨模态转换框架,通过融合层级条件机制、尺度自适应生成与全谱损失函数,实现从H&E图像精准预测空间转录组,在三个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00410 2026-08-18 cs.AI cs.CL cs.CV 版本更新 82%

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

歧义去了哪里?探究多模态模型如何解释多义词

Jasin Cekinmez, Addison J. Wu, Raja Marjieh, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究对比17个文本到图像模型和15个文本生成模型,发现多模态模型生成图像的词义多样性低于文本,揭示了基础模型在不同模态间意义表达的迁移 gap。

Comments Oral Presentation, Sci-FM Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16234 2026-08-18 cs.CV 新提交 79%

GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation

GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型

Tianchen Deng, Xuefeng Chen, Shuang Wu, Qu Chen, Jiajun Zhu, Bo Dai, Jianfei Yang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Tsinghua University(清华大学) Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-08-18 cs.RO cs.AI 版本更新 79%

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 25 pages, 8 figures. Project Page: https://baai-humanoid.github.io/DECO-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12592 2026-08-18 cs.LG 版本更新 78%

Represent, Then Generate: Multimodal-Conditioned Time-Series Generation under Irregular Missingness

先表征,再生成:不规则缺失下的多模态条件时间序列生成

Haochen Zhang, Jiaheng Guo, Yu-Chao Huang, Nicholas Konz, Tianlong Chen

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出ReCoGen两阶段框架,将多模态条件表征与生成分离,在三个生理基准的16项任务中超越6种生成器,可合成缺失生理信号以实现低侵入性临床监测。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 73%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15510 2026-08-18 cs.AI 新提交 70%

Who Leads Now? Token-Level Modality Arbitration for Chart-to-Code Generation

当前谁主导?用于图表转代码生成的令牌级模态仲裁

Qinghao Fu, Yarong Wang, Shunlei Ning, Yilin Wang, Shunwen Bai, Xinda Wang, Jiaotuan Wang, Yinan Nie, Wei Zhou

专题命中 多模态生成 :cross-modal(abstract,abstract_cn);分类 cs.AI

AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16765 2026-08-18 cs.CV cs.AI 新提交 62%

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

TRACE-Bench:多参考图像生成的分解与诊断

Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多参考图像生成基准的缺陷,构建TRACE-Bench基准,采用算子分解方法评估9个主流模型,发现解耦与属性绑定是核心瓶颈,最优模型属性保真度仅0.74

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13602 2026-08-18 cs.MM cs.CV cs.SD 版本更新 62%

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Video Avatar Generation

Omni-LiveAvatar:分钟级实时流式视听联动数字人生成

Lunjie Zhu, Xingtong Ge, Fangyu Lin, Yi Zhang, Zhening Liu, Mengfei Li, Yumeng Zhang, Guanglu Song, Yu Liu, Jun Zhang

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-08-18 cs.CV cs.AI 版本更新 62%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10723 2026-08-18 cs.CV cs.AI cs.LG cs.MA 版本更新 62%

AgentMV: A State-Guided Multi-Agent Framework for Budget-Aware Music Video Generation

AllocMV:通过结构化持久状态实现音乐视频生成的最优资源分配

Huimin Wang, Chang Xia, Leilei Ouyang, Yongqi Kang, Yu Fu, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 AllocMV提出了一种分层框架,将音乐视频合成建模为多重选择背包问题,通过动态规划优化资源分配,确保跨镜头一致性并降低生成成本。

Comments ECCV 2026 AI4VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 62%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16745 2026-08-18 cs.CV 新提交 57%

VicEdit: Learning to Edit Videos from Visual In-Context Examples

VicEdit:从视觉上下文示例学习编辑视频

Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 针对文本指令视频编辑难以传达细粒度视觉信息的问题,提出视觉上下文编辑新范式,构建VicEdit-400K数据集,开发VicEdit框架,在VicEditBench上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16717 2026-08-18 cs.CV 新提交 57%

PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation

PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准

Yuji Wang, Yuheng Chen, Teng Hu, Ran Yi, Yijia Hong, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对多镜头视频生成中角色叙事连续性评估的不足,推出PersonaShot基准,设计三类特定评估器,发现先进模型感知质量与跨镜头连续性存在差距,评估器与人类专家判断一致性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 57%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-18 cs.AI 版本更新 57%

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16229 2026-08-18 cs.RO 新提交 50%

Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration

用于协调多智能体探索的规划器条件扩散模型

Marcus Yu Siong Teo, Jeric Lew, Tanishq Duhan, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出规划器条件扩散策略PCDP,通过规划器身份作为条件输入训练多模态单智能体策略,结合局部重排序实现协调,在多智能体探索中提升性能并验证了方法有效性。

Comments Code and models are available at https://github.com/marmotlab/PCDP

详情

展开后加载摘要…

URL PDF HTML 收藏