PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
PixelVLA:推进视觉-语言-动作模型中的像素级理解
Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong
机构
*
University of Trento(特伦托大学)
;
School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院)
;
Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学)
;
Australian National University(澳大利亚国立大学)
CommentsSubmitted to Interspeech 2026; put on arxiv based on requirement from Interspeech: "Interspeech no longer enforces an anonymity period for submissions." and "For authors that prefer to upload their paper online, a note indicating that the paper was submitted for review to Interspeech should be included in the posting."
SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback
SIPDO:通过合成数据反馈实现闭环提示优化
Yaoning Yu, Ye Yu, Peiyan Zhang, Kai Wei, Haojing Luo, Haohan Wang
机构
*
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
University of South Florida(佛罗里达州立大学)
专题命中
预训练与数据
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
在大语言模型、多模态大语言模型及更广泛的领域中进行模型融合:方法、理论、应用与机遇
Enneng Yang, Li Shen, Guibing Guo, Xingwei Wang, Xiaochun Cao, Jie Zhang, Dacheng Tao
机构
*
Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区)
;
Northeastern University China(东北大学)
;
Shenzhen Campus of Sun Yat-sen University China(中山大学深圳校区)
;
Nanyang Technological University Singapore(南洋理工大学)
;
Northeastern University(东北大学)
;
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
Nanyang Technological University(南洋理工大学)
;
Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所)
;
Inria Paris-Rocquencourt Rocquencourt France(巴黎-罗quentourt研究所)
;
Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉贾·甘地大学)
;
Tsinghua University Haidian Qu Beijing Shi China(清华大学)
;
Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心)
;
Institute for Clarity in Documentation(文档清晰研究所)
;
Inria Paris-Rocquencourt(巴黎-罗quentourt研究所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Tsinghua University(清华大学)
;
Palmer Research Laboratories(帕勒研究中心)
专题命中
预训练与数据
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Super Encoding Network: Recursive Association of Multi-Modal Encoders for Video Understanding
超级编码网络:多模态编码器的递归关联用于视频理解
Boyu Chen, Siran Chen, Kunchang Li, Qinglin Xu, Yu Qiao, Yali Wang
机构
*
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Shanghai AI Laboratory(上海人工智能实验室)