A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans
用于CT扫描中可靠且可审计的空间关系验证的模块化智能体
Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf
机构
*
Ulm University(乌尔姆大学)
;
Ulm University Hospital(乌尔姆大学医院)
;
Technical University of Munich (TUM)(慕尼黑工业大学(TUM))
;
TUM University Hospital(慕尼黑工业大学医院)
;
Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)
CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation
CogCanvas: 用于评估多主体参考图像生成的基准
Long-Bao Nguyen, Quang-Khai Le, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le
机构
*
University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学)
;
University of Dayton, Ohio, United States(代顿大学)
;
Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)
机构
*
Peking University(北京大学)
;
Nanyang Technological University(南洋理工大学)
;
National University of Singapore(新加坡国立大学)
;
Sun Yat-Sen University(中山大学)
;
Pingan Technology(平安科技)
专题命中
视觉推理
:multimodal large language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.LG
Volumetric Radiology AI in the Era of Multimodal Large Language Models
多模态大语言模型时代的容积放射学人工智能
Zanting Ye, Shengyuan Liu, Xin Liu, Chenhui Wang, Zhisong Wang, Jiashuai Liu, Zipei Wang, Cheng Wang, Wentao Pan, Mengjie Fang, Di Dong, Mohammad Salmanpour, Arman Rahmim, Yu Gu, Yong Xia, Hongming Shan, Yixuan Yuan, Yefeng Zheng, Lijun Lu
机构
*
Fudan University(复旦大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Xi’an Jiaotong University(西安交通大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Southern Medical University(南方医科大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Microsoft Research(微软研究院)
;
Westlake University(西湖大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.AI
Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
Re³Cap:基于强化学习的图像字幕增强的检索引导优化
Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng
机构
*
Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
机构
*
Nankai University(南开大学)
;
Northwestern Polytechnical University(西北工业大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
NKIARI
专题命中
视觉定位与Grounding
:MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV