Jizheng Ma, Xiaofei Zhou, Geyuan Zhang, Yanlong Song, Han Yan
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)
A Multimodal 3D Foundation Model for Light Sheet Fluorescence Microscopy Enables Few-Shot Segmentation, Classification, and Deblurring
一种用于光片荧光显微镜的多模态3D基础模型实现少样本分割、分类和去模糊
Adina Scheinfeld, Haotan Zhang, Shang Mu, Rudolf L. M. van Herten, Lucas Stoffl, Ali Erturk, Zhuhao Wu, Johannes C. Paetzold
机构
*
Tri-Institutional Program in Computational Biology \& Medicine, Weill Cornell Medicine, New York, NY, USA Department of Radiology, Weill Cornell Medicine, New York, NY, USA Helen
;
Robert Appel Alzheimers Disease Research Institute, Feil Family Brain
;
Mind Research Institute, Weill Cornell Medicine, New York, NY, USA Graduate Program in Physiology, Biophysics
;
Systems Biology, Weill Cornell Medicine, New York, NY, USA Cornell Tech, New York, NY, USA Institute for Intelligent Biotechnologies (iBIO), Helmholtz Center Munich, Neuherberg, Germany Institute for Stroke
;
Dementia Research, Klinikum der Universität München, Ludwig-Maximilians University Munich, Munich, Germany
机构
*
Taizhou Institute of Science and Technology, Nanjing University of Science and Technology(泰州科技学院、南京理工大学)
;
Department of Intelligence Science, Xi’an Jiaotong-Liverpool University(智能科学系,西安交通大学利物浦大学)
;
School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学)
;
Department of Statistical Sciences, University of Toronto(统计科学系,多伦多大学)
机构
*
AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Nanyang Technological University(南洋理工大学)
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
Latent Space Guided Scenario Sampling for Multimodal Segmentation Under Missing Modalities
基于潜在空间引导的多模态分割中缺失模态的场景采样
Irem Ulku, Ö. Özgür Tanrıöver, Erdem Akagündüz
机构
*
organization= Department of Computer Engineering, Ankara University, Ankara, T \"u rkiye
;
organization= Department of Modeling
;
Simulation, Graduate School of Informatics, METU, Ankara, T \"u rkiye
How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
多模态语言模型需要多少视觉标记?通过F^3A进行视觉标记剪枝的扩展
YiJie Huang, Yiqun Zhang, Zhuoyue Jia, Xiaocui Yang, Junzhao Huang, Zihan Wang, Shi Feng, Daling Wang, Yifei Zhang, Yongkang Liu
机构
*
School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)
ChatSR: Multimodal Large Language Models for Scientific Formula Discovery
ChatSR:用于科学公式发现的多模态大语言模型
Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning
机构
*
AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国)
;
Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国)
;
College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国)
;
School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
MulTaBench: 基于文本和图像的多模态表格学习基准测试
Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker, Gaël Varoquaux, Frank Hutter, Roi Reichart
机构
*
Technion – Israel Institute of Technology(技术ion – 以色列理工学院)
;
Prior Labs(Prior实验室)
;
NVIDIA
;
SODA Team, INRIA Saclay, Palaiseau(SODA团队,INRIA萨克莱,帕莱索)
;
University of Freiburg(弗赖堡大学)
;
Probabl
;
ELLIS Institute Tübingen(图宾根ELLIS研究所)
机构
*
Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能制造重点实验室,先进工程学院,大湾大学)
;
Chair of Applied Statistics, Technische Universität Dresden(应用统计学教授职位,德累斯顿技术大学)
;
Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据解析与人工智能中心(ScaDS.AI))
;
College of Automation, Guangdong University of Technology(自动化学院,广东技术大学)
机构
*
Tencent Hunyuan(腾讯文言)
;
University of Maryland, College Park(马里兰大学 College Park 分校)
;
University of Virginia(弗吉尼亚大学)
;
University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
OmniParser V2:结构化思维点用于统一的视觉文本解析及其在多模态大语言模型中的通用性
Wenwen Yu, Zhibo Yang, Jianqiang Wan, Sibo Song, Jun Tang, Wenqing Cheng, Yuliang Liu, Xiang Bai
机构
*
School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)
;
School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
;
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)
;
School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)
;
Alibaba Group(阿里巴巴集团)
MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning
MaLoRA:基于关键空间对齐的门控模态LoRA
Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute for Clarity in Documentation(文档清晰研究所)
;
Inria Paris-Rocquencourt(巴黎-鲁维尔研究所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Palmer Research Laboratories(帕勒实验室)
CommentsAccepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026
Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning
通过字形驱动微调增强多模态大语言模型用于古汉字演变分析
Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu
机构
*
College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院)
;
Key Laboratory of Ancient Chinese Script, Culture Relics and Artificial Intelligence, Jilin University, China(吉林大学古文字、文物与人工智能重点实验室)
;
School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院)
;
School of Archaeology, Jilin University, China(吉林大学考古学院)
BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning
BoxTuning:直接注入物体框进行多模态模型微调
Zekun Qian, Ruize Han, Wei Feng
机构
*
School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)
;
Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院)