DREAM: Domain-aware Reasoning for Efficient Autonomous Underwater Monitoring
DREAM:面向高效自主水下监测的领域感知方法
Zhenqi Wu, Abhinav Modi, Angelos Mavrogiannis, Kaustubh Joshi, Nikhil Chopra, Yiannis Aloimonos, Nare Karapetyan, Ioannis Rekleitis, Xiaomin Lin
机构
*
Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系)
;
Maryland Robotics Center (MRC), University of Maryland(马里兰大学机器人中心)
;
Woods Hole Oceanographic Institution (WHOI)(伍兹霍尔海洋研究所)
;
Mechanical Engineering, University of Delaware(德雷克塞尔大学机械工程系)
专题命中
视觉推理
:vision language model(abstract);VLM(abstract);分类 cs.AI
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Peking University(北京大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
机构
*
School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区))
;
Pengcheng Laboratory(鹏城实验室)
;
School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区))
;
Shenzhen Loop Area Institute(深圳河套学院)
机构
*
School of Automation Science and Engineering, South China University of Technology, Guangzhou, China(自动化科学与工程学院,华南理工大学,广州,中国)
;
Vanderbilt University, Nashville, TN, USA(范德比尔特大学,纳什维尔,田纳西州,美国)
;
The Pennsylvania State University, University Park, PA , USA(宾夕法尼亚州立大学,大学园,宾夕法尼亚州,美国)
;
Peking University, Beijing , China(北京大学,北京,中国)
;
Virginia Commonwealth University, Richmond, VA, USA(弗吉尼亚共同wealth大学,里士满,弗吉尼亚州,美国)
;
University of California San Diego, San Diego, CA, USA(加州大学圣地亚哥分校,圣地亚哥,加利福尼亚州,美国)
Soft Clustering Anchors for Self-Supervised Speech Representation Learning in Joint Embedding Prediction Architectures
用于联合嵌入预测架构中自监督语音表示学习的软聚类锚点
Georgios Ioannides, Adrian Kieback, Judah Goldfeder, Linsey Pang, Aman Chadha, Aaron Elkins, Yann LeCun, Ravid Shwartz-Ziv
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
New York University(纽约大学)
;
James Silberrad Brown Center for AI(詹姆斯·西伯拉德·布朗人工智能中心)
;
Columbia University(哥伦比亚大学)
;
Northeastern University(东北大学)
;
Stanford University(斯坦福大学)
;
Amazon GenAI(亚马逊生成人工智能)
ST4VLA: Spatially Guided Training for Vision-Language-Action Models
ST4VLA:基于空间引导的视觉-语言-动作模型训练
Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Southern University of Science and Technology(南方科技大学)
;
Fudan University(复旦大学)
机构
*
StepFun
;
South China University of Technology(南方科技大学)
;
Peking University(北京大学)
;
Tsinghua University(清华大学)
;
Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)
;
The University of Chicago(芝加哥大学)
;
Nanyang Technological University(南洋理工大学)
RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation
RoboInter: 一种面向机器人操控的综合中间表示套件
Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Beihang University(北航)
;
Nanyang Technological University(南洋理工大学)
;
Zhejiang University(浙江大学)
;
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong(香港中文大学)
SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense
SHIELD:通过偏差和脆弱性防御抑制LVLM编码器中的幻觉
Yiyang Huang, Liang Shi, Yitian Zhang, Yi Xu, Yun Fu
机构
*
Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学)
;
Khoury College of Computer Science, Northeastern University(计算机科学学院,东北大学)
Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions
超越单个词对齐:通过令牌交互蒸馏多模态大语言模型
Lin Chen, Xiaoke Zhao, Kun Ding, Weiwei Feng, Changtao Miao, Zili Wang, Wenxuan Guo, Ying Wang, Kaiyuan Zheng, Bo Zhang, Zhe Li, Shiming Xiang
机构
*
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所信息与智能系统研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Zhejiang University(浙江大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV