机构
*
Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院)
;
Yunnan Key Laboratory of Artificial Intelligence(云南省人工智能重点实验室)
专题命中
视觉问答
:multimodal large language model(title);MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI
VizAnchor: Decoding Manipulation Intent from Tampering Visualizations via Dual-Anchor Reasoning
VizAnchor:通过双锚推理从篡改可视化中解码操纵意图
Xiaotian Zhang, Huayuan Ye, Haiyang Zhang, Chenhui Li, Changbo Wang, Sicheng Song
机构
*
School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)
;
Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域分部)
;
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation
LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别
Ahmed Shehab Khan, Zhiyuan Li, Yan Tong
机构
*
University of South Carolina(南卡罗来纳大学)
专题命中
视觉定位与Grounding
:VLM(summary_cn,abstract);MLLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);multimodal large language model(abstract,abstract_cn)
机构
*
UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所)
;
King’s College London(伦敦国王学院)
;
School of Medicine, Nankai University(南开大学医学院)
;
University of Manchester(曼彻斯特大学)
专题命中
视觉定位与Grounding
:grounding(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI
Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding
超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放
Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen
机构
*
University of Southern California(南加州大学)
;
Pohang University of Science and Technology (POSTECH)(浦项科技大学)
;
Tsinghua University(清华大学)
;
Carnegie Mellon University(卡内基梅隆大学)
PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos
PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验
Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中
视觉定位与Grounding
:VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI
机构
*
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
;
Wuhan AI Research(武汉人工智能研究院)
;
Institute of Automation, University of Chinese Academy of Sciences(中国科学院大学自动化研究所)
;
Institute for Math & AI, Wuhan(武汉数学与人工智能研究院)
Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes