arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 86 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 10 篇

2608.24010 2026-08-26 cs.CV 新提交 79%

Absorbing Gradient Conflicts: Modeling Semantic Variance via Kent Distributions for Cross-Modal Hashing

吸收梯度冲突:通过 Kent 分布建模语义方差用于跨模态哈希

Hengjie Zhu, Dayan Wu, Zihao Zhang, Xinze Liu, Jingxuan Yu, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对现有跨模态哈希方法因代理为静态点引发的梯度冲突问题,提出 KDPH 框架,将代理建模为 Kent 分布,结合定制损失函数,在基准数据集上性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24823 2026-08-26 cs.LG q-bio.QM 新提交 67%

BioKERN: Biological Kernel Regularization for Histology-to-Transcriptomics Neighborhood Retrieval

BioKERN:用于组织学-转录组学邻域检索的生物核正则化方法

Seungik Cho, Betul Orcan-Ekmekci

机构 * Rice University(莱斯大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract)

AI总结 该研究针对空间解析生物学的组织学-转录组学邻域检索问题,提出BioKERN框架,通过结合转录组相似性与空间邻近性构建生物核实现正则化,在相关数据集上较BLEEP提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24467 2026-08-26 cs.AI 新提交 57%

HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning

HMGCLIP:面向电商表征学习的异构多粒度对比学习

Qiuyu Zhu, Yi Gao, Zhichao Wan, Mingyang Ma

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24176 2026-08-26 cs.IR cs.AI 新提交 57%

Tlow: Flow-based Item Tokenizer for Recommendation

Tlow:用于推荐的基于流的物品分词器

Nian Li, Chonggang Song, Jingtao Ding, Lingling Yi, Yong Li, Qingmin Liao

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 该研究提出基于流的物品分词器Tlow,解决传统推荐模型的参数过多与冷启动问题,经实验验证其能提升推荐性能,在微信多模态检索任务中使全局用户CTR提升10.32%、新物品提升11.64%。

Comments CIKM'26 Applied Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24132 2026-08-26 cs.LG cs.AI 新提交 57%

From Gradient-Boosted Trees to Deep Recommenders: Practical Lessons from Migrating a Production Customer Support Recommender

从梯度提升树到深度推荐器:迁移生产环境客户支持推荐器的实践经验

Sonia Sharma, Jeyendran Balakrishnan, Shreya Rajpal, Swapnil Parekh, Nagaraj Janardhana, Andrew Mattarella-Micke

机构 * Intuit(英图易公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文介绍了将生产环境客户支持推荐系统从梯度提升树迁移到成对二元深度推荐器的实践,通过多种技术优化后,该方法在对话后期的推荐性能优于CatBoost基线。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22785 2026-08-26 cs.CV 版本更新 57%

OmicSync: Reliability-Aware Spatial Multi-Omics Clustering with Evidence-Constrained LLM Reasoning

OmicSync:结合证据约束大语言模型推理的可靠性感知空间多组学聚类

Rabeya Tus Sadia, Qiang Ye, Qiang Cheng

机构 * University of Kentucky(肯塔基大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 OmicSync是结合证据约束LLM推理的可靠性感知空间多组学聚类框架,集成KAN-GCN骨干等功能,在多组学基准测试中表现优异,OmicSync-R进一步提升了人乳腺癌的聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23688 2026-08-26 astro-ph.SR astro-ph.IM 新提交 50%

Agentic Active Learning Meets Visual Embeddings: Finding Anomalies among 370 000 Variable Stars from ASAS-SN

智能体主动学习结合视觉嵌入:从ASAS-SN的370000颗变星中发现异常天体

Milan Pesta, Yuan-Sen Ting

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究提出结合多模态大语言模型智能体的主动学习框架,从ASAS-SN的37万余颗变星中高效发现异常天体,仅用约3小时、约40美元成本便得到含24个新异常的星表,验证了该方法的可行性。

Comments 24 pages, 12 figures, 6 tables. Submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 9 篇

2606.18974 2026-08-26 cs.CV 版本更新 86%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(title);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24688 2026-08-26 cs.LG 新提交 86%

A Multimodal Foundation Model for Longitudinal Patient Representation and Scalable Insight Generation in Oncology

面向肿瘤学纵向患者表示与可扩展洞察生成的多模态基础模型

Eugene Vorontsov, Yi Kan Wang, Alican Bozkurt, Adam Casson, Ludmila Tydlitatova, Michal Zelechowski, Ezra E. W. Cohen, Jyoti D. Patel, Max Banaszak, Caitlin McWilliams, Shane Colley, Kate Sasser, Ryan Fukushima, Eric Lefkofsky, Razik Yousfi, Siqi Liu

机构 * Tempus AI, Inc.(Tempus AI公司)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 本研究推出多模态基础模型oFM,基于167万肿瘤患者数据整合多模态信息,在预后基准及治疗队列中表现优于基线特征,还开发了机制发现框架以解释模型,助力肿瘤学临床与药物开发应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22174 2026-08-26 cs.CV 版本更新 79%

When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?

统一多模态模型中视觉生成何时能助力视觉理解?

Yubo Zhu, Zhehan Kan, Jingyi Yang, Miaolin Chen, Jinbo Xing, Kai Zhu, Zijian Wang, Sheng Zhong, Wei Tong

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出VGAU-Diag评估框架,发现统一多模态模型的视觉生成仅在简单任务上助益理解,瓶颈多在理解侧,有效生成需瞄准理解瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23943 2026-08-26 cs.CV cs.AI cs.GR 新提交 62%

Luce: Relightable Gaussians for 3D Asset Generation

Luce:用于3D资产生成的可重光照高斯模型

Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs

机构 * Apple(苹果公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Luce,一种用于3D资产生成的可重光照高斯模型,通过多模态高斯云结合PBR材质,在Toys4K数据集及自研AI生成图像基准上均实现了优于基线的单图像到3D生成性能,可保留精细细节。

Comments 27 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-26 cs.CV cs.AI 版本更新 62%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Zhengrui Chen, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Yuan Wang, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-08-26 cs.CV cs.MM cs.SD 版本更新 62%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-08-26 cs.CV cs.AI 版本更新 62%

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Zheng Liu, Chonghan Qin, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24121 2026-08-26 cs.CV 新提交 57%

Graph-Supervised Hierarchical Clinical Alignment for Radiology Report Generation with Large Language Models

面向结合大语言模型的放射学报告生成的图监督分层临床对齐

Yingshu Li, Yunyi Liu, Zhanyu Wang, Zailong Chen, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * University of Sydney(悉尼大学) ByteDance(字节跳动) University of Wollongong(伍伦贡大学) University of Adelaide(阿德莱德大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对放射学报告生成中报告级监督与疾病级发现的粒度不匹配问题,提出图监督分层临床对齐方法,在3B模型上超越多个更大参数的现有系统,验证了优化监督结构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23627 2026-08-26 cs.CL 新提交 57%

From Triage to Discharge: A Survey of NLP Tasks, Methods, and Open Challenges in the Emergency Department

从分诊到出院:急诊部门NLP任务、方法与开放挑战综述

Dipankar Srirag, Aditya Joshi, Salil Kanhere, Padmanesan Narasimhan

机构 * University of New South Wales(新南威尔士大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本综述分析46篇论文,梳理急诊部门分诊、诊断、处置阶段的NLP任务与方法,指出模型从特定架构向预训练语言模型转变等趋势,明确泛化能力有限等开放挑战,为相关研究提供方向。

Comments Accepted to the EMNLP 2026 Main Conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 13 篇

2608.23974 2026-08-26 cs.CV cs.MM 新提交 85%

Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis

用于乳腺超声诊断的通才-专家模型协作的引导与反馈框架

Ming Cheng, Hongyu Sun, Zhaolin Chen, Jun Liu, Hossein Rahmani, Qiuhong Ke

机构 * Monash University(莫纳什大学) Renmin University of China(中国人民大学) Lancaster University(兰卡斯特大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 针对乳腺超声诊断中深度学习的可靠性与可解释性难题,提出BooF框架实现MLLM与专家模型协作,经多数据集验证其性能优于现有最优方法。

Comments 5 pages, 2 figures. Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-26 cs.AI cs.CL cs.CV cs.MM 版本更新 83%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-08-26 cs.CV cs.AI cs.CL 版本更新 82%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-08-26 cs.CV 版本更新 79%

Life-Bench: A Benchmark and Knowledge Graph Framework for Multimodal Personalization Beyond Concept Recognition

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05375 2026-08-26 cs.AI cs.LG 版本更新 79%

LEMMA-RCA: A Large Multi-modal Multi-domain Dataset for Root Cause Analysis

LEMMA-RCA:用于根因分析的多模态多领域大型数据集

Lecheng Zheng, Zhengzhang Chen, Dongjie Wang, Chengyuan Deng, Reon Matsuoka, Haifeng Chen

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NEC Laboratories America(NEC美国实验室) University of Kansas(堪萨斯大学) Rutgers University(罗格斯大学) NEC Laboratories Japan(NEC日本实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 针对根因分析领域缺乏大规模开源数据集的问题,本文提出多模态多领域大型数据集LEMMA-RCA,在其上评估六种基线方法,验证其可促进RCA技术的公平评估与发展。

Comments Accepted by CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23803 2026-08-26 cs.CV cs.AI cs.LG 新提交 76%

LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology

LUCAID:用于肺癌精准病理学的智能体多模态AI

Marie-Lisa Eich, Kai Standvoss, Timo Milbich, Alexander Möllers, Miriam Hägele, Philipp Anders, Lars Tharun, Hanna Kontradiuk, Sebastian Kons, Nader Aldoj, Recepcan Adigüzel, Adam Narai, Lukas Hönig, Jonathan Striebel, Binru Yang, Mihnea P. Dragomir, Marvin Sextro, Philipp Keyl, Philipp Jurmeister, Rosemarie Krupar, Evelyn Ramberger, James Wells, Julika Ribbat-Idel, Andreas Kunft, Hussam Shuaib, Christian Grohé, Reinhard Büttner, David Horst, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen, Simon Schallenberg

机构 * Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林夏里特医学院病理学研究所) Freie Universität Berlin(柏林自由大学) Humboldt-Universität zu Berlin(柏林洪堡大学) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林卫生研究所) Aignostics GmbH(Aignostics有限公司) Machine Learning Group, Technical University of Berlin(柏林工业大学机器学习组) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD——柏林学习与数据基础研究所) MVZ HPH Institut für Pathologie und Hämatopathologie GmbH(HPH病理及血液病理诊断中心有限公司)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 该研究开发并临床验证了LUCAID智能体多模态AI系统,其覆盖肺癌病理全流程任务,前瞻性验证中临床决策一致性达93.0%,优于经验丰富的胸病理学家,解决了现有AI工具的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24436 2026-08-26 cs.LG cs.AI q-bio.QM 新提交 57%

Evaluating Deep Multivariate Imputation Models on Wearable Device Data

评估深度多变量插补模型在可穿戴设备数据上的性能

Skye Goodman, Roussel Desmond Nzoyem, Leandro Junges, Peter Kissack, Yasser Qureshi, Amberly Brigden, Jeff Clark, Nawid Keshtmand

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Birmingham(伯明翰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究针对可穿戴设备数据的结构化缺失问题,开发了保留共缺失结构的评估与训练协议,评估BRITS、SAITS等模型性能,发现模型排名依赖评估设计,为改进多传感器可穿戴数据插补策略提供了关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23845 2026-08-26 cs.CV 新提交 57%

Object Counting Across Modalities: Taxonomies, Benchmarks, Applications, and Open Challenges

跨模态物体计数:分类体系、基准、应用及开放挑战

Joana Konadu Owusu, Shivanand Venkanna Sheshappanavar

机构 * University of Wyoming(怀俄明大学) Geometric Intelligence Research Lab.(几何智能研究实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本综述针对跨模态物体计数领域,提出五轴分类体系,梳理应用领域挑战,给出路线图,强调需构建稳健评估基础设施区分开放世界泛化与基准优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-08-26 cs.AI 版本更新 57%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00260 2026-08-26 cs.CV 版本更新 57%

C3VDReg: A Benchmark for Local-to-Local Colonoscopic Registration toward Anatomical Localization

C3VDReg:面向解剖定位的局部-局部结肠镜配准基准

Linzhe Jiang, Jiayuan Huang, Sophia Bano, Matthew J. Clarkson, Zhehua Mao, Mobarak I. Hoque

机构 * UCL Hawkes Institute(UCL哈维斯研究所) University College London, University of London(伦敦大学学院, 伦敦大学) Division of Informatics, Imaging and Data Sciences(信息学、成像与数据科学部门) University of Manchester(曼彻斯特大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出面向局部-局部结肠镜配准的基准C3VDReg,通过构建点云对评估基线模型,发现高几何重叠不足以保证配准精度,重复管状解剖的平移歧义是主要瓶颈,凸显需更强解剖与上下文约束。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12006 2026-08-26 eess.IV cs.CV 版本更新 57%

crossMoDA Challenge: Evolution of Cross-Modality Domain Adaptation Techniques for Vestibular Schwannoma and Cochlea Segmentation from 2021 to 2023

crossMoDA挑战赛:2021至2023年前庭神经鞘瘤与耳蜗分割的跨模态域自适应技术演进

Navodini Wijethilake, Reuben Dorent, Marina Ivory, Aaron Kujawa, Stefan Cornelissen, Patrick Langenhuizen, Mohamed Okasha, Anna Oviedova, Hexin Dong, Bogyeong Kang, Guillaume Sallé, Luyi Han, Ziyuan Zhao, Han Liu, Yubo Fan, Tao Yang, Shahad Hardan, Hussain Alasmawi, Santosh Sanjeev, Yuzhou Zhuang, Satoshi Kondo, Maria Baldeon Calisto, Shaikh Muhammad Uzair Noman, Cancan Chen, Ipek Oguz, Rongguo Zhang, Mina Rezaei, Susana K. Lai-Yuen, Satoshi Kasai, Yunzhi Huang, Chih-Cheng Hung, Mohammad Yaqub, Lisheng Wang, Benoit M. Dawant, Cuntai Guan, Ritse Mann, Vincent Jaouen, Tae-Eui Kam, Li Zhang, Jonathan Shapey, Tom Vercauteren

机构 * School of BMEIS, King's College London, London, United Kingdom(伦敦国王学院生物医学工程与信息科学学院) Harvard University, USA(哈佛大学) Elisabeth-TweeSteden Hospital, Tilburg, Netherlands(蒂尔堡埃利斯贝特-特维德登医院) King's College Hospital, London, United Kingdom(伦敦国王学院医院) Center for Data Science, Peking University, Beijing, China(北京大学数据科学中心) Center for Data Science in Health and Medicine, Peking University, Beijing, China(北京大学健康与医学数据科学中心) Department of Artificial Intelligence, Korea University, Seoul, Republic of Korea(韩国大学人工智能系) Department of Radiology and Nuclear Medicine, Radboud University Medical Center, Geert Grooteplein 10, 6525 GA, Nijmegen, The Netherlands(拉德堡德大学医学中心放射科与核医学科) Department of Radiology, The Netherlands Cancer Institute, Plesmanlaan 121, 1066 CX, Amsterdam, The Netherlands(荷兰癌症研究所放射科) Nanyang Technological University, Singapore(南洋理工大学) Vanderbilt University, USA(范德比尔特大学) Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(阿布扎克穆罕默德·本·扎耶德人工智能大学) School of Computer Science and Technology, Huazhong University of Science and Technology, Wuhan, China(华中科技大学计算机科学与技术学院) Center for Machine Vision and Security Research, Kennesaw State University, Marietta, MA 30060, USA(肯尼斯州立大学机器视觉与安全研究中心) Muroran Institute of Technology, Hokkaido, Japan(北海道Muroran理工学院) Niigata University of Health and Welfare, Niigata, Japan(Niigata健康与福利大学) University of South Florida, Tampa, FL, USA(佛罗里达州立大学) Infervision Advanced Research Institute, Beijing, China(北京Infervision高级研究 institutes) Academy for Multidisciplinary Studies, Capital Normal University, Beijing, China(北京师范大学多学科研究学院) School of Automation, Nanjing University of Information Science and Technology, Nanjing 210044, China(南京信息科学技术大学自动化学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 该研究回顾2021-2023年crossMoDA挑战赛,分析跨模态域自适应技术在VS与耳蜗分割任务中的演进,发现数据规模与异构性提升可改善分割性能,但耳蜗Dice评分2023年下降,提示需更具挑战性的跨模态任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24162 2026-08-26 cs.RO 新提交 50%

Robust Slip Detection and Material Classification via Spatiotemporal Transformers on a Uniformly-Illuminated Visuo-Tactile Sensor

基于均匀照明视觉-触觉传感器的时空Transformer的鲁棒滑移检测与材料分类

Ziyang Ma, Yuhao Sun, Zichen Ai, Xiangyang Ji, Bin Fang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本研究开发了带均匀RGB照明的视觉-触觉传感器与统一感知框架,采用双头部TimeSformer网络和ResNet-50主干,实现高精度滑移检测与物体分类,为机器人操作提供多模态感知基线。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026. 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24513 2026-08-26 cond-mat.mtrl-sci 新提交 50%

Structure-Agnostic Prediction of the Electronic Density of States with a Chemical Language Model

基于化学语言模型的电子态密度的结构无关预测

Ivan D. Rubtsov, Ivan V. Dudakov, Vadim V. Korolev

专题命中 多模态评测 :cross-modal(abstract)

AI总结 该研究提出化学语言模型DOSSIER,无需晶体结构即可直接由元素组成预测电子态密度,在基准测试及合金筛选中表现出良好性能,为未合成化合物的DOS预测提供了结构无关的新方法。

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态Agent 8 篇

2608.14026 2026-08-26 cs.CE 版本更新 85%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏