机构
*
Arizona State University(亚利桑那州立大学)
;
Clemson University(克莱姆斯大学)
;
Washington University in St.Louis(圣路易斯华盛顿大学)
;
Rice University(Rice 大学)
;
Morgan Stanley(摩根大通)
Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
通过程序化数据合成提升大规模语言模型的空间推理能力
Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan
机构
*
Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)
;
Tsinghua University(清华大学)
;
Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所)
;
Renmin University of China(中国人民大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Central South University(中南大学)
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Baidu Inc.(百度公司)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
基于动态视觉搜索和缩放的自适应聚焦推理方法用于高效VLMs
Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li
机构
*
organization= School of Computer Science \& Technology, Beijing Institute of Technology , city= Beijing , country= China
;
organization= State Key Laboratory of General Artificial Intelligence, BIGAI , city= Beijing , country= China
;
organization= School of Intelligence Science
;
Technology, Peking University , city= Beijing , country= China
;
organization= Guangdong Laboratory of Machine Perception
;
Intelligent Computing, Shenzhen MSU--BIT University , city= Shenzhen , country= China
;
organization= Department of Automation, Tsinghua University , city= Beijing , country= China
专题命中
视觉推理
:vision language model(abstract);visual reasoning(abstract);分类 cs.CV
ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
ASTRIDE:面向智能体AI应用的安全威胁建模平台
Eranga Bandara, Amin Hass, Ross Gore, Sachin Shetty, Ravi Mukkamala, Safdar H. Bouk, Xueping Liang, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan
机构
*
Old Dominion University(老奥布里恩大学)
;
Accenture Technology Labs(埃森哲技术实验室)
;
Florida International University(佛罗里达国际大学)
;
Nanyang Technological University(南洋理工大学)
;
University of Colombo(科伦坡大学)
Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes
Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li
机构
*
Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室)
;
Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室)
;
SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心)
;
Shenzhen University(深圳大学)
;
School of Electronic and Computer Engineering(电子与计算机工程学院)
;
Peking Univerisity(北京大学)
;
Tencent Youtu Lab(腾讯优图实验室)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages
Video-CoM: Interactive Video Reasoning via Chain of Manipulations
Video-CoM:通过操作链进行交互式视频推理
Hanoona Rasheed, Mohammed Zumri, Muhammad Maaz, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan
机构
*
Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学)
;
University of California Merced(加州梅尔 Ced 大学)
;
Google Research(谷歌研究院)
;
Linköping University(林奈大学)
;
Australian National University(澳大利亚国立大学)
专题命中
视觉推理
:visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning
像人类一样适应:具有测试时推理的元认知代理
Yang Li, Zhiyuan He, Yuxuan Huang, Zhuhanling Xiao, Chao Yu, Meng Fang, Kun Shao, Jun Wang
机构
*
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
University of Oxford(牛津大学)
;
Tsinghua University(清华大学)
;
University of Liverpool(利物浦大学)
;
University College London(伦敦大学学院)
SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing
SAMChat:引入链式推理和GRPO以增强小规模遥感遥感小语言模型
Aybora Koksal, A. Aydin Alatan
机构
*
Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中东部技术大学(METU)电子与电气工程系)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
CommentsAccepted to Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) Special Issue on Foundation and Large Vision Models for Remote Sensing. Code and dataset are available at https://github.com/aybora/SAMChat
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
;
Sofia University(索菲亚大学)
;
University of Macau(澳门大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中
视觉推理
:vision language model(abstract);VLM(abstract);分类 cs.CV