Task-Oriented Feature Compression for Multimodal Understanding via Device-Edge Co-Inference
Cheng Yuan, Zhening Liu, Jiashu Lv, Jiawei Shao, Yufei Jiang, Jun Zhang, Xuelong Li
机构
*
Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究所)
;
School of Electronic and Information Engineering, Harbin Institute of Technology(哈尔滨工业大学电子与信息工程学院)
;
Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系)
;
School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)
Multi-refined Feature Enhanced Sentiment Analysis Using Contextual Instruction
Peter Atandoh, Jie Zou, Weikang Guo, Jiwei Wei, Zheng Wang
机构
*
School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学)
;
Southwestern University of Finance and Economics(西南财经大学)
;
Tongji University(同济大学)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
Ziming Wei, Bingqian Lin, Yunshuang Nie, Jiaqi Chen, Shikui Ma, Hang Xu, Xiaodan Liang
机构
*
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
Shanghai Jiao Tong University(上海交通大学)
;
The University of Hong Kong(香港大学)
;
Hunan Artificial Intelligence and Robotics Institute Company Ltd.(湖南人工智能与机器人研究院有限公司)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Peng Cheng Laboratory(鹏城实验室)
When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs
Zhuoran Zhang, Tengyue Wang, Xilin Gong, Yang Shi, Haotian Wang, Di Wang, Lijie Hu
机构
*
Peking University(北京大学)
;
Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能和数据分析实验室)
;
King Abdullah University of Science and Technology(卡布斯大学)
;
South China University of Technology(华南理工大学)
;
Tsinghua University(清华大学)
;
University of Georgia(佐治亚大学)
;
MBZUAI(马克斯·普朗克人工智能研究所)
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.AI
机构
*
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)
;
College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, Hongzhen Wang, Wenjing Yang, Bo Du, Jing Zhang
机构
*
College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院)
;
Beijing University of Posts and Telecommunications, China(北京邮电大学)
;
School of Computer Science, Wuhan University, China(武汉大学计算机学院)
;
Zhongguancun Academy, China(中关村学院)
;
Tsinghua University, China(清华大学)
;
Beihang University, China(北航大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
Jiawei Liu, Enis Berk Çoban, Zarina Schevchenko, Hao Tang, Zhigang Zhu, Michael I Mandel, Johanna Devaney
机构
*
The Graduate Center, CUNY(CUNY研究生中心)
;
Brooklyn College, CUNY(CUNY布鲁克林学院)
;
Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院)
;
The City College of New York, CUNY(CUNY纽约城市学院)
From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit
Valérie Costa, Thomas Fel, Ekdeep Singh Lubana, Bahareh Tolooshams, Demba Ba
机构
*
EPFL(瑞士联邦理工学院)
;
Kempner Institute, Harvard University(哈佛大学凯普纳研究所)
;
CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能CBSTNTT项目)
;
Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(NTT研究公司人工智能物理研究组)
;
University of Alberta(阿尔伯塔大学)
;
Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所)
;
SEAS, Harvard University(哈佛大学工程与应用科学学院)