Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper
Gehui Chen, Guan'an Wang, Xiaowen Huang, Jitao Sang
机构
*
School of Computer Science
;
Technology, Beijing Jiaotong University Beijing China
;
Beijing Key Laboratory of Traffic Data Mining
;
Key Laboratory of Big Data \& Artificial Intelligence in Transportation, Ministry of Education Beijing China
;
Technology, Beijing Jiaotong University
;
Key Laboratory of Big Data \& Artificial Intelligence in Transportation, Ministry of Education
TPA: Temporal Prompt Alignment for Fetal Congenital Heart Defect Classification
Darya Taratynova, Alya Almsouti, Beknur Kalmakhanbet, Numan Saeed, Mohammad Yaqub
机构
*
Department of Machine Learning Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) Abu Dhabi, UAE(机器学习系,Mohamed bin Zayed人工智能大学(MBZUAI),阿布扎比,阿联酋)
;
Department of Computer Vision Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) Abu Dhabi, UAE(计算机视觉系,Mohamed bin Zayed人工智能大学(MBZUAI),阿布扎比,阿联酋)
COMMET: A System for Human-Induced Conflicts in Mobile Manipulation of Everyday Tasks
Dongping Li, Shaoting Peng, John Pohovey, Katherine Rose Driggs-Campbell
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Department of Electrical and Computer Engineering(电气与计算机工程系)
;
ZJU-UIUC Institute(浙大-伊利诺伊大学联合学院)
机构
*
King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术大学)
;
Lanzhou University(兰州大学)
;
Meta AI
;
The University of Sydney(悉尼大学)
;
IHPC, A*STAR(IHPC,A*STAR)
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
Surformer v2: A Multimodal Classifier for Surface Understanding from Touch and Vision
Manish Kansana, Sindhuja Penchala, Shahram Rahimi, Noorbakhsh Amiri Golilarz
机构
*
Department of Computer Science(计算机科学系)
;
Engineering Mississippi State University Mississippi State, USA(工程学硕士州大学密西西比州)
;
Department of Computer Science The University of Alabama Tuscaloosa, USA(计算机科学系阿拉巴马大学塔斯卡洛osa)
Evaluating Cognitive-Behavioral Fixation via Multimodal User Viewing Patterns on Social Media
Yujie Wang, Yunwei Zhao, Jing Yang, Han Han, Shiguang Shan, Jie Zhang
机构
*
State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
Automatic segmentation of Organs at Risk in Head and Neck cancer patients from CT and MRI scans
Sébastien Quetin, Andrew Heschl, Mauricio Murillo, Rohit Murali, Piotr Pater, George Shenouda, Shirin A. Enger, Farhad Maleki
机构
*
Medical Physics Unit, Department of Oncology, McGill University(麦吉尔大学医学物理单位)
;
Montreal Institute for Learning Algorithms, Mila(蒙特利尔学习算法研究所)
;
Department of Computer Science, University of Calgary(卡尔加里大学计算机科学系)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Division of Radiation Oncology, Department of Oncology, McGill University(麦吉尔大学放射肿瘤学部)
;
McGill University Health Centre(麦吉尔大学健康中心)
;
Lady Davis Institute for Medical Research, Jewish General Hospital(Lady Davis医学研究所,犹太通用医院)
;
Department of Diagnostic Radiology, McGill University(麦吉尔大学诊断放射学部)
;
Department of Radiology, University of Florida(佛罗里达大学放射学部)
Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions
Xinbei Ma, Yiting Wang, Yao Yao, Tongxin Yuan, Aston Zhang, Zhuosheng Zhang, Hai Zhao
机构
*
School of Computer Science(计算机学院)
;
Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering(智能交互与认知工程重点实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(Web3可信数据流通与治理上海市重点实验室)
;
GenAI, Meta(Meta GenAI)
AI-in-the-loop: The future of biomedical visual analytics applications in the era of AI
Katja Bühler, Thomas Höllt, Thomas Schulz, Pere-Pau Vázquez
机构
*
Vienna Research Center for Visual Computing(维也纳视觉计算研究中心)
;
VRVis GmbH(VRVis公司)
;
Delft University of Technology(代尔夫特理工大学)
;
University of Bonn(波恩大学)
;
Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)
;
Universitat Politècnica de Catalunya(巴塞罗那理工大学)
专题命中
多模态Agent
:multi-modal(abstract);分类 cs.AI
CommentsAccepted for publication in IEEE Computer Graphics & Applications
Journal refK. Bühler, T. Hollt, T. Schultz and P. Vazquez, "AI-in-The-Loop: The Future of Biomedical Visual Analytics Applications in the Era of AI" in IEEE Computer Graphics and Applications, vol. 45, no. 02, pp. 90-99, March-April 2025