Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
响应-G1:面向前瞻性流视频理解的显式场景图建模
Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Liu
机构
*
Northwestern Polytechnical University(北华大学)
;
Tsinghua University(清华大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Harbin Engineering University(哈尔滨工程大学)
Towards Conversational Medical AI with Eyes, Ears and a Voice
面向有眼睛、耳朵和声音的对话式医疗AI
Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno
机构
*
Google DeepMind(谷歌DeepMind)
;
Google Research(谷歌研究)
;
Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院)
;
Stanford University(斯坦福大学)
Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition
提示到保护:多模态大语言模型在建筑危险识别中的比较研究
Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert
机构
*
Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系)
;
Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
LithoBench:用于遥感岩石学解释的大型多模态模型基准测试
Jun Wang, Fengpeng Li, Hang Dong, Tianjin Huang, Wei Han
机构
*
School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机学院)
;
PRADA Lab, King Abdullah University of Science and Technology(科廷大学PRADA实验室)
;
Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Nanjing University(南京大学)
;
Tongji University(同济大学)
;
Wuhan University(武汉大学)
Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition
基于骨架的人体动作识别的概念驱动逻辑推理神经符号框架
Talha Ilyas, Deval Mehta, Zongyuan Ge
机构
*
Department of ECSE, Faculty of Engineering, Monash University, Australia(莫纳什大学工程学院电子与计算机工程系,澳大利亚)
;
AIM for Health Lab, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院健康人工智能实验室,澳大利亚)
;
Department of DSAI, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院数据科学与人工智能系,澳大利亚)
CommentsThis article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
University of California, San Diego(加州大学圣地亚哥分校)
RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design
RosettaSearch:蛋白质序列设计的多目标推理时间搜索
Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio
机构
*
AI for Good, Microsoft Redmond(微软红mond AI for Good)
;
Google DeepMind(谷歌DeepMind)
;
Google Research(谷歌研究)
;
Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学)
;
Microsoft Research New England(微软新英格兰研究)
;
Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)
EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs
EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试
He Hu, Tengjin Weng, Zebang Cheng, Yu Wang, Jiachen Luo, Björn Schuller, Zheng Lian, Laizhong Cui
机构
*
Shenzhen University(深圳大学)
;
Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室)
;
Queen Mary University of London(女王学院伦敦大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Imperial College London(伦敦帝国学院)
;
Tongji University(同济大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Renmin University of China(中国人民大学)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
CommentsAccepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang
机构
*
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
Seeing the Intangible: Survey of Image Classification into High-Level and Abstract Categories
看见无形:图像分类到高级和抽象类别的调查
Delfina Sol Martinez Pandiani, Valentina Presutti
机构
*
University of Bologna(博洛尼亚大学)
;
University of Bologna Department of Computer Science(博洛尼亚大学计算机科学系)
;
University of Bologna Department of Modern Languages, Literatures(博洛尼亚大学现代语言文学系)
;
Centrum Wiskunde en Informatica(数学与信息学研究中心)
;
Institute for Clarity in Documentation(文档清晰研究所)
;
Inria Paris-Rocquencourt(巴黎-罗克奎恩特研究所)
;
Rajiv Gandhi University(拉贾·甘地大学)
;
Tsinghua University(清华大学)
;
Palmer Research Laboratories(帕尔默研究实验室)