arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-07-14 至 2026-07-14 共收录 9
2607.11533 2026-07-14 cs.CV cs.LG 新提交

Adaptive Routing for Efficient Diffusion Transformer-Based PNI Prediction

基于高效扩散变压器的PNI预测的自适应路由

Youngung Han, Dohyun Kweon, Kyeonghun Kim, Hyunsu Go, Jina Jeong, Suah Park, Induk Um, Junga Kim, Anna Jung, Yului Jeong, Sungha Park, Jinyong Jun, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学) OUTTA Chung-Ang University(Chung-Ang 大学) Seoul National University School of Medicine(首尔国立大学医学院) Samsung Changwon Hospital(三星昌原医院) Samsung Medical Center(三星医疗中心) NVIDIA AI Technology Center(NVIDIA AI 技术中心)

AI总结 针对胆管癌PNI术前MRI预测难题,传统方法有局限。本文将PNI预测设为扩散分类问题,用基于Transformer的表示实现去噪网络,并引入自适应路由提高效率,实验取得了0.731的AUC及257.57 GFLOPs的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10992 2026-07-14 cs.CV cs.AI 新提交

LoSA-Net: A Localized and Scale-Adaptive Network for Boundary-Sensitive Prediction of Perineural Invasion in 3D MRI

LoSA-Net:用于3D MRI中神经周围侵犯边界敏感预测的局部化和尺度自适应网络

Youngung Han, Hyunsu Go, Kyeonghun Kim, Induk Um, Junga Kim, Jaewon Jung, Woo Kyoung Jeong, Won Jae Lee, Pa Hong, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) OUTTA Chung-Ang University(Chung-Ang 大学) Samsung Medical Center, Sungkyunkwan University School of Medicine(三星医疗中心,成均馆大学医学院) Samsung Changwon Hospital(三星昌原医院) NVIDIA AI Technology Center(NVIDIA AI 技术中心)

AI总结 研究针对3D MRI中神经周围侵犯(PNI)预测难题,提出LoSA-Net架构,通过TNA、SAFM和CSRA技术,在168例胆管癌患者的对比增强MRI扫描中,该网络AUC达0.7567,优于卷积和Transformer基线。

Comments Published in the 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI 2026); accepted for oral presentation

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10988 2026-07-14 cs.CV cs.AI 新提交

MMA-Former: Multi-Window Mixture-of-Head Attention Transformer for Adaptive PNI Prediction in 3D MRI

MMA-Former:用于3D MRI中自适应PNI预测的多窗口混合注意力头变压器

Youngung Han, Induk Um, Kyeonghun Kim, Junga Kim, Hyunsu Go, Jaewon Jung, Woo Kyoung Jeong, Won Jae Lee, Pa Hong, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) OUTTA Chung-Ang University(Chung-Ang 大学) Samsung Medical Center, Sungkyunkwan University School of Medicine(三星医疗中心,全北大学医学院) Samsung Changwon Hospital(三星昌原医院) NVIDIA AI Technology Center(NVIDIA AI 技术中心)

AI总结 针对3D MRI无创预测PNI的挑战,提出MMA-Former,采用粗-细变压器结构及窗口特定混合注意力机制,能并行多尺度提取特征,实现空间自适应特征提取,在回顾性数据集上AUC达0.752,优于其他架构。

Comments Published in the 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI 2026); accepted for oral presentation

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10044 2026-07-14 cs.LG 新提交

FlashTrie: A GPU-Accelerated Constrained Beam Search for Generative Retrieval

FlashTrie:用于生成式检索的GPU加速约束束搜索

Dakshitha Anandakumar, Anurag Mukkara, Wenxiang Hu, Jiusheng Chen, M Akash Kumar, Ting Ye, Qiang Lou, Jian Jiao

机构 * Microsoft(微软) Nvidia(英伟达)

AI总结 研究针对生成式检索中约束解码的瓶颈问题,提出FlashTrie方法。通过优化GPU上的约束束搜索,采用整数感知简洁trie布局和协作CUDA内核等技术,显著降低解码延迟、提高吞吐量,在实验中取得良好效果并提升了收入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09739 2026-07-14 cs.AI cs.CL 新提交

Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择

Jihan Yao, Gantavya Bhatt, Arnav Das, Peter Jin, Ke Bao, Qiaolin Yu, Khushi Bhardwaj, Chang Su, Jialei Wang, Yikai Zhu, Sugam Devare, Damon Mosk-Aoyama, Zhen Dong, Venkat Krishna Srinivasan, Yineng Zhang, Oleksii Kuchaiev, Jiantao Jiao, Banghua Zhu, Jeff Bilmes

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Oracle(甲骨文公司) Together AI(Together AI公司) LMSYS NVIDIA(英伟达公司)

AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18601 2026-07-14 cs.CV 版本更新

Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models

Incantation: 自然语言作为多实体视频世界模型的动作接口

Shangwen Zhu, Qianyu Peng, Zhao Pu, Zhilei Shu, Xiangrui Ke, Zhaohu Xing, Zizhao Tong, Zeqing Wang, Xinyu Cui, Zian Zheng, Huangji Wang, Jian Zhao, Yeying Jin, Fan Cheng, Ruili Feng

机构 * SJTU(上海交通大学) NVIDIA Research(英伟达研究) USTC(中国科学技术大学) UCAS(乌兹别克斯坦科学院) NUS(新加坡国立大学) UWaterloo(滑铁卢大学) HKUST(香港理工大学) HKU(香港大学) ZGCA(浙江大学)

AI总结 本研究提出了一种基于自然语言的动作接口,用于多实体视频世界模型,解决了传统接口在细粒度多实体控制和跨实体、跨世界泛化能力上的不足,通过引入自然语言条件化实现了更强大的表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25917 2026-07-14 cs.AI cs.CL cs.LG 版本更新

Recursive Multi-Agent Systems

递归多智能体系统

Jiaru Zou, Rui Pan, Ruizhong Qiu, Pan Lu, Shizhe Diao, Jindong Jiang, Hanghang Tong, Tong Zhang, Markus J. Buehler, Jingrui He, James Zou

机构 * UIUC(伊利诺伊大学香槟分校) Stanford University(斯坦福大学) NVIDIA(英伟达) MIT(麻省理工学院)

AI总结 本文提出递归多智能体框架RecursiveMAS,通过递归计算提升多智能体协作效率,实验证明其在多个基准测试中准确率提升8.3%,推理速度提升1.2-2.4倍,token使用减少34.6%-75.6%。

Comments Project Website: https://recursivemas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14046 2026-07-14 cs.CL cs.SD 版本更新

PRiSM: Benchmarking Phone Realization in Speech Models

PRiSM:语音模型中电话实现的基准测试

Shikhar Bharadwaj, Chin-Jou Li, Yoonjae Kim, Kwanghee Choi, Eunjung Yeo, Ryan Soh-Eun Shim, Hanyu Zhou, Brendon Boldt, Karen Rosero Jacome, Kalvin Chang, Darsh Agrawal, Keer Xu, Chao-Han Huck Yang, Jian Zhu, Shinji Watanabe, David R. Mortensen

机构 * CMU(卡内基梅隆大学) Gwangju Institute of Science and Technology(光州科学技术院) UT Austin(得克萨斯大学奥斯汀分校) LMU Munich(慕尼黑路德维希-马克西米利安大学) UC Berkeley(伯克利加州大学) NVIDIA(英伟达) UBC(不列颠哥伦比亚大学)

AI总结 该研究针对语音模型中电话实现进行基准测试,引入PRiSM开源基准用内在和外在评估揭示语音感知盲点,标准化评估并通过探针评估下游效用,发现训练语言接触对PR性能关键,编码器-CTC模型稳定,专门PR模型优于大型音频语言模型,还发布相关资源推动多语言语音模型发展。

Comments Presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏