arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 52 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2608.23880 2026-08-26 cs.CV 新提交 90%

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别

Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出LG-GER框架,通过MLLM生成结构化证据并蒸馏至VLM骨干,无需检测器等即可实现高效群体情绪识别,在GroupEmoW和GAF 3.0数据集上取得了有竞争力或更优的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24325 2026-08-26 cs.AI 新提交 85%

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

SonarLLM:一种用于水下感知的原生声呐-光学多模态大语言模型

Cong Su, longxuan ma, Ling Dong, Guofeng Tang, Weijie Yin, Haohui Chen, Zhengtao Yu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Yunnan Key Laboratory of Artificial Intelligence(云南省人工智能重点实验室)

专题命中 图文多模态 :multimodal(title);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型不适用于水下声呐-光学感知的问题,提出SonarLLM模型,结合专用编码器与分层融合机制,在SonarBench基准上实现了优异的水下感知性能,凸显了声呐的互补价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23570 2026-08-26 cs.CL 新提交 83%

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

驯服视觉忽视:用于多模态上下文学习中自适应注意力的变分信息瓶颈框架

Kaito Tanaka, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(山王大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对多模态上下文学习中视觉上下文时而被利用时而被忽视的问题,提出VIB-ICL框架,通过CMIG量化跨模态信息,推导理论界并经五组基准实验验证,实现准确率提升与演示样本减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24640 2026-08-26 cs.MM 新提交 57%

EVEREST:Endogenous Vision-Language Reinforcement Reasoning Exploration for Urban Socio-Semantic Segmentation

EVEREST:面向城市社会语义分割的内生视觉语言强化推理探索

Qixiu Li, Zhongzhi He, Xiang Zhu, Xiaoyong Li, Jiarun Lin, Weifeng Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.MM

AI总结 针对城市社会语义分割中目标边界划分不准确的问题,提出EVEREST模型,通过以自我为中心的探索策略、伪代码规范执行逻辑及强化学习,在真实数据集上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2608.24209 2026-08-26 cs.MM 新提交 89%

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

面向统一框架内多模态视听学习任务的任务解耦低秩适配方法

Hanyu Xuan, Mengqi Zhang, Junjun Mao, Fei Wang, Kun Li, Guanghui Yue, Zhiliang Wu, Hehe Fan

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出统一框架下的任务解耦低秩适配(LoRA)机制,解决多视听任务联合训练的干扰问题,在多项视听任务上优于现有统一模型及部分任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23759 2026-08-26 eess.AS cs.SD 新提交 80%

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

ISCSLP 2026 真实场景视听语音增强挑战赛

Challenge Organizers

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 该研究介绍ISCSLP 2026真实场景视听语音增强挑战赛,设置含真实混合、合成重混等赛道,公布基线结果与相关资源,以评估视听语音增强在自然场景下的性能。

Comments The First Real-World Audio-Visual Speech Enhancement (AVSE) Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24160 2026-08-26 cs.AI 新提交 79%

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

全能评判者还是全能偏差?通过平衡、解耦的视角诊断多模态评判者

Guangzheng Hu, Ziyue Jiang, Weixu Qiao, Lixin Zhang, Jianye Kang, Yuru Wu, Rong Bao, Niantong Li, Wei Wang, Ziyi Cheng, Xinfa Zhu, HangRui Hu, Ting He, Bing Zhao, Lin Qu, Hu Wei, Jin Xu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究推出平衡解耦的多模态评判者诊断基准D3-Omni,发现全能评判者存在模态相关维度表现差、漏检失败等系统性盲点,为评估多模态模型提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24674 2026-08-26 cs.CV 新提交 70%

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23758 2026-08-26 cs.SD cs.AI 新提交 70%

EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$

EXAM²:扩展多语言与多模态分析中的音频理解能力

Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24579 2026-08-26 eess.AS 新提交 57%

Visually-Guided Spatial Audio Generation for $360^\circ$ In-the-Wild Speech Scenes

面向野外360°语音场景的视觉引导空间音频生成

Qingyu Luo, Peng Zhang, Wenwu Wang, Philip J. B. Jackson

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 针对野外360°语音场景空间音频采集质量受限问题,本文提出视觉引导的FOA语音空间化方法,构建YT-SPEECH数据集,采用Localizer-Renderer框架实现定向FOA信号重建,提升了音频相关性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24707 2026-08-26 cs.CL 新提交 57%

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

迷失在语音中:跨音频与文本的三语语音幻觉检测

Meruyert Aristombayeva, Jason S. Lucas, Chaewan Chun, Dongwon Lee

机构 * Satbayev University(萨塔巴耶夫大学) University of Colorado Boulder(科罗拉多大学博尔德分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对低资源语言语音幻觉检测的空白,构建三语语音幻觉基准,评估多模态检测模型,发现文本检测更优,合成训练检测器在真实数据上迁移性强,还揭示合成基准的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2608.24845 2026-08-26 cs.CV cs.AI cs.LG 新提交 84%

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

LAION-BVD:用于多模态预训练的千万小时级开源视频数据集

Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge

专题命中 视频多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究团队构建了千万小时级开源多模态视频数据集LAION-BVD,经其训练的模型在视频-文本、音频-文本及图像-文本基准上表现出色,为多模态预训练提供了大规模数据支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24340 2026-08-26 cs.CV cs.AI cs.HC cs.LG 新提交 66%

Mind the Student: Behavioral and Contextual Cues for Automated Engagement Prediction in Online Learning

关注学生:在线学习中自动参与度预测的行为与上下文线索

Alperen Kantarci, Visvanathan Ramesh, Gemma Roig

机构 * Goethe University Frankfurt(法兰克福大学) The Hessian Center for Artificial Intelligence(黑森人工智能中心)

专题命中 视频多模态 :multimodal(abstract,comments);分类 cs.CV、cs.AI

AI总结 本研究针对在线学习中自动参与度预测的多维构念与标注主观性等挑战,提出整合多模态特征与不确定性感知预测的Perceiver IO框架,在CASED数据集上取得具竞争力性能且提供校准良好的不确定性指标。

Comments Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy. 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24063 2026-08-26 cs.CV cs.AI 新提交 62%

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法

Lyuke Wang, Zhuo Li, Guangxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24763 2026-08-26 cs.CV cs.LG 新提交 57%

MoTE: Mixture of Task Experts for Multi-Task Video Understanding

MoTE:面向多任务视频理解的任务专家混合模型

Muhammad Asad Ali, Umar Khan, Nadia Robertini, Didier Stricker

机构 * University of Kaiserslautern-Landau (RPTU)(凯泽斯劳滕-兰道大学(RPTU)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对多任务视频理解中现有解码器的任务行为纠缠、能力扩展难等问题,提出MoTE架构,实例化为VideoLLM-MoTE,在COIN基准上表现优于基线,实现了可解释且计算高效的多任务视频-语言学习。

Comments Accepted at BMVC 2026. 32 pages, 4 figures, 15 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24680 2026-08-26 cs.CV 新提交 57%

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Game2World引擎:解锁野外游戏视频用于世界模型训练

Wenxuan Shen, Dongna Jin, Dongping Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对游戏视频界面干扰世界模型训练的问题,提出GameUI-Taxonomy与G2WEngine框架构建Game2World数据集,研发无掩码UI去除模型GameCleaner,提升了世界模型训练效果与UI去除性能。

Comments We are currently building Gaming World Model and data engine that transfers game dynamics to robotics. Feel free to contact Dongping Chen (dongpingchen0612@gmail.com) if you are interested in research collaboration or financial support

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24574 2026-08-26 cs.AI 新提交 57%

PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos

PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验

Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 9 篇

2608.23646 2026-08-26 cs.AI cs.LG 新提交 84%

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

MolEmb:多模态大语言模型可作为强大的分子嵌入模型

Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI;multi-modal(comments)

AI总结 本文提出MolEmb框架,利用多模态大语言模型构建通用分子嵌入模型,在分子性质预测上具竞争力,还提出MolCAR基准验证上下文感知分子嵌入的特性。

Comments Presented at the 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS), ICML 2026. Non-archival workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24053 2026-08-26 cs.CV cs.CL cs.IR 新提交 81%

WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report

WeMM-Embedding:微信多模态嵌入技术报告

Junjie Zhou, Ke Mei, Lei Li, Tianyi Wang, Fengyun Rao, Jing Lyu

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本报告提出WeMM-Embedding多模态嵌入模型家族,含2B、4B、9B变体,经两阶段训练后在公开基准及微信应用中表现优异,已部署并开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23920 2026-08-26 cs.IR cs.CL cs.CV 新提交 81%

Wontopos Tablet 2: Measuring Multilingual and Multimodal Memory Retrieval Without Lexical Matching

Wontopos Tablet 2:无需词汇匹配的多语言多模态记忆检索测量

Sunwoo Kim

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文测量Wontopos Tablet 2的多语言多模态记忆检索性能,其无需词汇匹配,在文本、跨语言及多模态基准上表现优于BM25等方法,但存在低资源语言性能下降等问题。

Comments 42 pages, 8 figures. Harness and per-question records released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24010 2026-08-26 cs.CV 新提交 79%

Absorbing Gradient Conflicts: Modeling Semantic Variance via Kent Distributions for Cross-Modal Hashing

吸收梯度冲突:通过 Kent 分布建模语义方差用于跨模态哈希

Hengjie Zhu, Dayan Wu, Zihao Zhang, Xinze Liu, Jingxuan Yu, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对现有跨模态哈希方法因代理为静态点引发的梯度冲突问题,提出 KDPH 框架,将代理建模为 Kent 分布,结合定制损失函数,在基准数据集上性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24823 2026-08-26 cs.LG q-bio.QM 新提交 67%

BioKERN: Biological Kernel Regularization for Histology-to-Transcriptomics Neighborhood Retrieval

BioKERN:用于组织学-转录组学邻域检索的生物核正则化方法

Seungik Cho, Betul Orcan-Ekmekci

机构 * Rice University(莱斯大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract)

AI总结 该研究针对空间解析生物学的组织学-转录组学邻域检索问题,提出BioKERN框架,通过结合转录组相似性与空间邻近性构建生物核实现正则化,在相关数据集上较BLEEP提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24467 2026-08-26 cs.AI 新提交 57%

HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning

HMGCLIP:面向电商表征学习的异构多粒度对比学习

Qiuyu Zhu, Yi Gao, Zhichao Wan, Mingyang Ma

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24176 2026-08-26 cs.IR cs.AI 新提交 57%

Tlow: Flow-based Item Tokenizer for Recommendation

Tlow:用于推荐的基于流的物品分词器

Nian Li, Chonggang Song, Jingtao Ding, Lingling Yi, Yong Li, Qingmin Liao

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 该研究提出基于流的物品分词器Tlow,解决传统推荐模型的参数过多与冷启动问题,经实验验证其能提升推荐性能,在微信多模态检索任务中使全局用户CTR提升10.32%、新物品提升11.64%。

Comments CIKM'26 Applied Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24132 2026-08-26 cs.LG cs.AI 新提交 57%

From Gradient-Boosted Trees to Deep Recommenders: Practical Lessons from Migrating a Production Customer Support Recommender

从梯度提升树到深度推荐器:迁移生产环境客户支持推荐器的实践经验

Sonia Sharma, Jeyendran Balakrishnan, Shreya Rajpal, Swapnil Parekh, Nagaraj Janardhana, Andrew Mattarella-Micke

机构 * Intuit(英图易公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文介绍了将生产环境客户支持推荐系统从梯度提升树迁移到成对二元深度推荐器的实践,通过多种技术优化后,该方法在对话后期的推荐性能优于CatBoost基线。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23688 2026-08-26 astro-ph.SR astro-ph.IM 新提交 50%

Agentic Active Learning Meets Visual Embeddings: Finding Anomalies among 370 000 Variable Stars from ASAS-SN

智能体主动学习结合视觉嵌入:从ASAS-SN的370000颗变星中发现异常天体

Milan Pesta, Yuan-Sen Ting

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究提出结合多模态大语言模型智能体的主动学习框架,从ASAS-SN的37万余颗变星中高效发现异常天体,仅用约3小时、约40美元成本便得到含24个新异常的星表,验证了该方法的可行性。

Comments 24 pages, 12 figures, 6 tables. Submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2608.24688 2026-08-26 cs.LG 新提交 86%

A Multimodal Foundation Model for Longitudinal Patient Representation and Scalable Insight Generation in Oncology

面向肿瘤学纵向患者表示与可扩展洞察生成的多模态基础模型

Eugene Vorontsov, Yi Kan Wang, Alican Bozkurt, Adam Casson, Ludmila Tydlitatova, Michal Zelechowski, Ezra E. W. Cohen, Jyoti D. Patel, Max Banaszak, Caitlin McWilliams, Shane Colley, Kate Sasser, Ryan Fukushima, Eric Lefkofsky, Razik Yousfi, Siqi Liu

机构 * Tempus AI, Inc.(Tempus AI公司)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 本研究推出多模态基础模型oFM,基于167万肿瘤患者数据整合多模态信息,在预后基准及治疗队列中表现优于基线特征,还开发了机制发现框架以解释模型,助力肿瘤学临床与药物开发应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23943 2026-08-26 cs.CV cs.AI cs.GR 新提交 62%

Luce: Relightable Gaussians for 3D Asset Generation

Luce:用于3D资产生成的可重光照高斯模型

Mayank Singh, Michele Stoppa, Alvise Memo, Rui Yu, Harsha Kalli, Srimanth Gunturi, Muhammad Ahmed Riaz, Behrooz Shahsavari, Waleed Abdulla, David E. Jacobs

机构 * Apple(苹果公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Luce,一种用于3D资产生成的可重光照高斯模型,通过多模态高斯云结合PBR材质,在Toys4K数据集及自研AI生成图像基准上均实现了优于基线的单图像到3D生成性能,可保留精细细节。

Comments 27 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24121 2026-08-26 cs.CV 新提交 57%

Graph-Supervised Hierarchical Clinical Alignment for Radiology Report Generation with Large Language Models

面向结合大语言模型的放射学报告生成的图监督分层临床对齐

Yingshu Li, Yunyi Liu, Zhanyu Wang, Zailong Chen, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * University of Sydney(悉尼大学) ByteDance(字节跳动) University of Wollongong(伍伦贡大学) University of Adelaide(阿德莱德大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对放射学报告生成中报告级监督与疾病级发现的粒度不匹配问题,提出图监督分层临床对齐方法,在3B模型上超越多个更大参数的现有系统,验证了优化监督结构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23627 2026-08-26 cs.CL 新提交 57%

From Triage to Discharge: A Survey of NLP Tasks, Methods, and Open Challenges in the Emergency Department

从分诊到出院:急诊部门NLP任务、方法与开放挑战综述

Dipankar Srirag, Aditya Joshi, Salil Kanhere, Padmanesan Narasimhan

机构 * University of New South Wales(新南威尔士大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本综述分析46篇论文,梳理急诊部门分诊、诊断、处置阶段的NLP任务与方法,指出模型从特定架构向预训练语言模型转变等趋势,明确泛化能力有限等开放挑战,为相关研究提供方向。

Comments Accepted to the EMNLP 2026 Main Conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏