机构
*
Tencent Jarvis Lab(腾讯 Jarvis实验室)
;
School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
;
National University of Singapore(新加坡国立大学)
;
Westlake University(西湖大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract)
Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models
基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体
Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Guoxu Zhou, Boyu wang, Jian Zhu, Jinyi Long
机构
*
Jinan University, Guangzhou, China
;
Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China
;
Western University, Ontario, Canada
;
Guangdong University of Technology, Guangzhou, China
;
Tsinghua University, Beijing, China
专题命中
评测与基准
:large language model(abstract);language model(abstract)
voice2mode: Phonation Mode Classification in Singing using Self-Supervised Speech Models
voice2mode:基于自监督语音模型的歌唱发声模式分类
Aju Ani Justus, Ruchit Agrawal, Sudarsana Reddy Kadiri, Shrikanth Narayanan
机构
*
University of Birmingham, School of Computer Science, Birmingham, UK(伯明翰大学计算机科学学院)
;
Carnegie Mellon University, Information Systems, Doha, Qatar(卡内基梅隆大学信息系统)
;
University of Southern California, Department of Electrical(南加州大学电气工程系)
CommentsAccepted to the Speech, Music and Mind (SMM26) workshop at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). This is the preprint version of the paper to appear in the proceedings
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
RAVENEA:多模态检索增强视觉文化理解的基准
Jiaang Li, Yifei Yuan, Wenyan Li, Mohammad Aliannejadi, Daniel Hershcovich, Anders Søgaard, Ivan Vulić, Wenxuan Zhang, Paul Pu Liang, Yang Deng, Serge Belongie
机构
*
University of Copenhagen(哥本哈根大学)
;
ETH Zürich(苏黎世联邦理工学院)
;
University of Amsterdam(阿姆斯特丹大学)
;
University of Cambridge(剑桥大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Singapore Management University(新加坡管理大学)
Detecting Brick Kiln Infrastructure at Scale: Graph, Foundation, and Remote Sensing Models for Satellite Imagery Data
大规模检测砖窑基础设施:用于卫星图像数据的图、基础和遥感模型
Usman Nazir, Xidong Chen, Hafiz Muhammad Abubakar, Hadia Abu Bakar, Raahim Arbaz, Fezan Rasool, Bin Chen, Sara Khalid
机构
*
Planetary Health Informatics (PHI) Lab, University of Oxford, Oxford, UK.(行星健康信息学实验室,牛津大学,英国)
;
Sustainable Environment (FUSE) Lab, University of Hong Kong, Hong Kong, China.(可持续环境(FUSE)实验室,香港大学,中国)
;
School of Computer and IT, Beaconhouse National University, Lahore, Pakistan(计算机与信息技术学院,贝肯豪斯国家大学,巴基斯坦)
;
Computer Science Department, Lahore University of Management Sciences, Lahore, Pakistan(管理科学大学计算机科学系,拉合尔,巴基斯坦)
;
Computer Science Department, University of Sarghoda, Sarghoda, Pakistan(计算机科学系,萨尔戈达大学,巴基斯坦)
Designing Multi-Robot Ground Video Sensemaking with Public Safety Professionals
设计多机器人地面视频感知以服务于公共安全专业人员
Puqi Zhou, Ali Asgarov, Aafiya Hussain, Wonjoon Park, Amit Paudyal, Sameep Shrestha, Chia-wei Tang, Michael F. Lighthiser, Michael R. Hieb, Xuesu Xiao, Chris Thomas, Sungsoo Ray Hong
机构
*
George Mason University(乔治·玛森大学)
;
University of Maryland(马里兰大学)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
PRISMM-Bench: 一种基于同行评审的多模态不一致基准
Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin
机构
*
Johannes Kepler University Linz(约翰内斯·开普勒大学林茨分校)
;
Interdisciplinary Transformation University Austria(跨学科转型大学奥地利)
;
MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
;
Stanford University(斯坦福大学)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
Huawei Noah’s Ark Lab (AI Lab), China(华为诺亚实验室(AI实验室))
Resource-Efficient Personal Large Language Models Fine-Tuning with Collaborative Edge Computing
基于协作边缘计算的资源高效个性化大语言模型微调
Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Jingyi Li, Jiangsu Du, Xiaowen Chu, Guoliang Xing, Xu Chen
机构
*
School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
;
Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
;
Shenzhen Institute of Artificial Intelligence and Robotics for Society(社会人工智能与机器人研究所(深圳))
专题命中
效率与部署
:large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
机构
*
University College London(伦敦大学学院)
;
Ulsan National Institute of Science and Technology(釜山国立科学技术研究所)
;
University of Basel(巴塞尔大学)
;
University College London AI Centre(伦敦大学学院人工智能中心)
专题命中
效率与部署
:large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG