Gabriele Conte, Alessio Mattiace, Gianni Carmosino, Potito Aghilar, Giovanni Servedio, Francesco Musicco, Vito Walter Anelli, Tommaso Di Noia, Francesco Maria Donini
机构
*
Politecnico di Bari(巴里理工大学)
;
Università degli Studi della Tuscia(图斯卡大学)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
学习高效视觉-语言导航中的可导航候选检索
Shutian Gu, Chengkai Huang, Ruoyu Wang, Lina Yao
机构
*
University of New South Wales, Sydney, Australia(新南威尔士大学)
;
Macquarie University, Sydney, Australia(麦考瑞大学)
;
Data61, CSIRO, Sydney, Australia(Data61, CSIRO)
;
The School of Computer Science(计算机科学学院)
Commentsv3: Production hardening. Added INT8 quantization (5.6x dot product speedup, 3.1x compression), crash recovery via decoupled WAL (<1% overhead), unlimited text storage via sidecar blob arena with generational GC, and epoch-based reclamation for lock-free reads (P99 750ns under 16-thread contention). Revised for systems engineering clarity
机构
*
National Chengchi University(国立政治大学)
;
National Yang Ming Chiao Tung University(国立阳明交通大学)
;
Can Tho University(庆坚大学)
;
University of Michigan(密歇根大学)
;
Stevens Institute of Technology(史泰文斯理工学院)
;
Far Eastern Memorial Hospital(东方纪念医院)
;
Florida International University(佛罗里达国际大学)
Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation
概念增强的多模态RAG:迈向可解释且准确的放射科报告生成
Marco Salmè, Federico Siciliano, Fabrizio Silvestri, Paolo Soda, Rosa Sicilia, Valerio Guarrasi
机构
*
Department of Engineering(工程系)
;
Research Unit of Artificial Intelligence and Computer Systems(人工智能与计算机系统研究单位)
;
Università Campus Bio-Medico of Roma(罗马大学生物医学校园)
;
Department of Computer, Control and Management Engineering(计算机、控制与管理工程系)
;
Sapienza University of Rome(罗马萨皮恩扎大学)
;
Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入、辐射物理、生物医学工程系)
;
Umeå University(乌梅拉大学)
;
UniCamillus-Saint Camillus International University of Health Sciences(UniCamillus-圣卡米卢斯国际健康科学大学)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
AudioRAG+: 基于反馈的检索增强音频生成与大音频语言模型
Junqi Zhao, Chenxing Li, Jinzheng Zhao, Rilin Chen, Dong Yu, Mark D. Plumbley, Wenwu Wang
机构
*
Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, UK(视觉、语音和信号处理中心(CVSSP),英国萨里大学)
;
Tencent AI Lab, Beijing, China(腾讯人工智能实验室,中国北京)
;
Tencent AI Lab, Seattle, USA(腾讯人工智能实验室,美国西雅图)