arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-16 至 2025-12-16 共收录 50 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2512.12424 2025-12-16 cs.CV cs.LG 84%

ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics

ViInfographicVQA:单图和多图越南信息图视觉问答基准测试

Tue-Thu Van-Dinh, Hoang-Duy Tran, Truong-Binh Duong, Mai-Hanh Pham, Binh-Nam Le-Nguyen, Quoc-Thai Nguyen

机构 * Neu.edu.vn

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 ViInfographicVQA是首个针对越南信息图VQA的基准测试,通过单图和多图任务评估模型在复杂信息图中的视觉问答能力。

Comments 10 pages, 4 figures, Accepted to AI4Research @ AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12799 2025-12-16 cs.CV 79%

DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning

DrivePI: 基于空间感知的4D MLLM用于统一自动驾驶理解、感知、预测与规划

Zhe Liu, Runhui Huang, Rui Yang, Siming Yan, Zining Wang, Lu Hou, Di Lin, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Yinwang Intelligent Technology Co. Ltd.(英维智能科技有限公司) Tianjin University(天津大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉问答 :MLLM(title,abstract);分类 cs.CV

AI总结 DrivePI是一种基于空间感知的4D MLLM,用于统一自动驾驶的理解、感知、预测和规划,通过端到端优化实现多任务并行,提升性能并减少碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV 70%

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13238 2025-12-16 cs.CV 57%

Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance

Ego-EXTRA:视频语言眼动数据集用于专家-学员协助

Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob Engel, Antonino Furnari, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学) Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构) Meta Reality Labs Research(Meta现实实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 Ego-EXTRA数据集通过专家-学员双向对话评估多模态大语言模型,揭示其在专家级帮助中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12694 2025-12-16 cs.DL cs.CV 57%

Hybrid Retrieval-Augmented Generation for Robust Multilingual Document Question Answering

混合检索增强生成用于鲁棒多语言文档问答

Anthony Mudet, Souhail Bakkali

机构 * Univ Rennes, CNRS, IRISA - UMR 6074(里昂大学、法国国家科学研究中心、IRISA - UMR 6074) L3i-lab, La Rochelle Université(L3i实验室、拉罗谢尔大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 本文提出混合检索增强生成方法,用于在嘈杂的历史文档中实现鲁棒的多语言问答,通过语义查询扩展、生成提示优化和模块化架构提升检索鲁棒性和问答准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2512.12487 2025-12-16 cs.CV 83%

More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models

不止于最终答案:提升视觉提取和逻辑一致性的视觉语言模型

Hoang Anh Just, Yifei Fan, Handong Zhao, Jiuxiang Gu, Ruiyi Zhang, Simon Jenni, Kushal Kafle, Ruoxi Jia, Jing Shi

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究院) Apple(苹果公司)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 PeRL-VL通过解耦框架提升视觉语言模型的视觉提取和推理一致性,实现Pass@1准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04457 2025-12-16 cs.CL 67%

Do MLLMs Really Understand the Charts?

多模态大语言模型真的能理解图表吗?

Xiao Zhang, Dongyuan Li, Liuyu Xiang, Yao Zhang, Cheng Zhong, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) AAITC, CTO Organization, Lenovo(AAITC、CTO组织、联想) Lenovo(联想)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)

AI总结 本文提出 ChartVR-3B/7B 模型,通过 VR-RFT 策略提升图表视觉推理能力,并在 ChartVRBench 上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20164 2025-12-16 cs.CL 67%

Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction

通过视觉抽象思考:通过视觉抽象增强多模态推理

Dairu Liu, Ziyue Wang, Minyuan Ruan, Fuwen Luo, Chi Chen, Peng Li, Yang Liu

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)

AI总结 通过引入视觉抽象思考范式,提升多模态大语言模型在视觉感知和推理任务中的性能,实现更高效的视觉推理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10576 2025-12-16 cs.CV 57%

HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs

HumanSense: 从多模态感知到通过推理的 empathetic 上下文感知响应

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Yi Yuan, Jingdong Chen, Le Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 HumanSense通过多阶段模态渐进强化学习提升MLLMs在多模态感知和交互任务中的性能,强调推理能力对共情反馈的重要性。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12756 2025-12-16 cs.CV 57%

FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning

FysicsWorld: 一个统一的全模态基准用于任意到任意的理解、生成和推理

Yue Jiang, Dingkang Yang, Minghao Han, Jinghang Han, Zizhi Chen, Yizhou Liu, Mingcheng Li, Peng Zhai, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(菲茨智能技术有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 FysicsWorld是一个统一的全模态基准,支持图像、视频、音频和文本之间的双向交互,通过16个主要任务和3,268个样本全面评估理解、生成和推理能力,揭示模型在多模态任务中的性能差异。

Comments The omni-modal benchmark report from Fysics AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12793 2025-12-16 cs.CV 57%

ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution

ViCO: 一种面向语义感知动态高分辨率的训练策略

Long Cui, Weiyun Wang, Jie Shao, Zichen Wen, Gen Luo, Linfeng Zhang, Yanting Zhang, Yu Qiao, Wenhai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 ViCO通过动态调整视觉标记数量以适应图像语义复杂度,有效降低推理成本的同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12967 2025-12-16 cs.CL 50%

QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management

QwenLong-L1.5: 长上下文推理与内存管理的训练配方

Weizhou Shen, Ziyi Yang, Chenliang Li, Zhiyuan Lu, Miao Peng, Huashan Sun, Yingcheng Shi, Shengyi Liao, Shaopeng Lai, Bo Zhang, Dayiheng Liu, Fei Huang, Jingren Zhou, Ming Yan

专题命中 视觉推理 :grounding(abstract)

AI总结 QwenLong-L1.5通过长上下文数据合成、稳定强化学习和内存增强架构,提升长上下文推理能力及超长任务处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2512.12842 2025-12-16 cs.RO cs.AI cs.LG 81%

SAGA: Open-World Mobile Manipulation via Structured Affordance Grounding

SAGA:通过结构化可及性 grounding 实现开放世界移动操作

Kuan Fang, Yuxin Chen, Xinghao Zhu, Farzad Niroui, Lingfeng Sun, Jiuguang Wang

机构 * RAI Institute(RAI研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 SAGA通过结构化可及性接地实现开放世界移动操作,能有效处理多种任务形式并实现零样本执行。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12246 2025-12-16 cs.CV 79%

Moment and Highlight Detection via MLLM Frame Segmentation

通过MLLM帧分割进行时刻和亮点检测

I Putu Andika Bagas Jiwanta, Ayu Purwarianti

机构 * School of Electrical Engineering and Informatics(电气工程与信息学院) Institut Teknologi Bandung(万隆技术大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出通过MLLM帧分割实现视频时刻和亮点检测,利用分割损失与因果LM损失结合,提升检测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02967 2025-12-16 cs.CL cs.AI cs.IR 74%

Grounding Large Language Models in Clinical Evidence: A Retrieval-Augmented Generation System for Querying UK NICE Clinical Guidelines

将大语言模型 grounded 在临床证据中:一种用于查询英国 NICE 临床指南的检索增强生成系统

Matthew Lewis, Samuel Thio, Amy Roberts, Catherine Siju, Whoasif Mukit, Rebecca Kuruvilla, Zhangshu Joshua Jiang, Niko Möller-Grell, Aditya Borakati, Richard JB Dobson, Spiros Denaxas

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) Department of Biostatistics and Health Informatics, King’s College London(生物统计学与健康信息学系,伦敦国王学院) EPSRC DRIVE-Health CDT, London, U.K.(EPSRC DRIVE-Health CDT,伦敦,英国) Imperial College Healthcare NHS Trust(帝国学院医疗 NHS 信托) Black Country Healthcare NHS Foundation Trust(黑斯廷斯地区医疗 NHS 基础信托) Feldon Lane Surgery, The Dudley Group NHS Foundation Trust(费尔顿车道诊所,德比集团 NHS 基础信托) The Cleveland Clinic, London, U.K.(克利夫兰诊所,伦敦,英国) CogStack Limited(CogStack 有限公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文提出一种基于RAG的系统,用于查询英国NICE临床指南,通过检索增强生成技术提升回答的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00858 2025-12-16 cs.RO cs.AI cs.HC 70%

Enhancing Interpretability and Interactivity in Robot Manipulation: A Neurosymbolic Approach

提升机器人操作的可解释性和交互性:一种神经符号方法

Georgios Tziafas, Hamidreza Kasaei

专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出一种神经符号方法,通过结合语言引导的视觉推理与机器人操作,提升可解释性和交互性,实现80.2%的成功率。

Comments Published in International Journal of Robotics Research (IJRR) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12929 2025-12-16 cs.CV cs.AI 62%

MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation

MADTempo: 多事件时间视频检索的交互系统与查询增强

Huu-An Vu, Van-Khanh Mai, Trong-Tam Nguyen, Quang-Duc Dam, Tien-Huy Nguyen, Thanh-Huong Le

机构 * Hanoi University of Science and Technology(河内科技大学) The University of Danang - University of Science and Technology(丹江-科技大学) Vietnam National University(越南国家大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 MADTempo通过结合时序搜索与网络视觉定位,提升多事件视频检索的时序推理和泛化能力,增强对罕见视觉概念的检索鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13632 2025-12-16 cs.LG 57%

StutterFuse: Mitigating Modality Collapse in Stuttering Detection with Jaccard-Weighted Metric Learning and Gated Fusion

StutterFuse: 通过Jaccard加权度量学习和门控融合缓解语塞崩溃

Guransh Singh, Md Shah Fahad

机构 * Department of Computer Science, Birla Institute of Technology, Mesra(计算机科学系,比拉理工学院,梅斯拉)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 StutterFuse通过Jaccard加权度量学习和门控融合策略,有效缓解语塞检测中的模态崩溃问题,实现高精度多标签分类。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13008 2025-12-16 cs.CV 57%

TWLR: Text-Guided Weakly-Supervised Lesion Localization and Severity Regression for Explainable Diabetic Retinopathy Grading

TWLR: 基于文本引导的弱监督病变定位与严重程度回归用于可解释性糖尿病视网膜病变分级

Xi Luo, Shixin Xu, Ying Xie, JianZhong Hu, Yuwei He, Yuhui Deng, Huaxiong Huang

机构 * Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省级交叉学科研究与数据科学应用重点实验室) Department of Statistics and Data Science, Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学统计与数据科学系) Faculty of Science, Hong Kong Baptist University(香港 Baptist大学科学学院) Data Science Research Center, Duke Kunshan University(杜克-昆山大学数据科学研究中心) Shanxi Provincial People’s Hospital(山西人民医院) The Fifth Clinical Medical school of Shanxi Medical University(山西医科大学第五临床医学院) Research Center for Mathematics, Beijing Normal University(北京师范大学数学研究中心) Department of Mathematics and Statistics, York University(约克大学数学与统计学系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 TWLR通过双阶段框架实现糖尿病视网膜病变的可解释性评估,结合视觉语言模型和弱监督分割,实现病变定位与严重程度回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12501 2025-12-16 cs.AI 57%

SafeGen: Embedding Ethical Safeguards in Text-to-Image Generation

SafeGen: 在文本到图像生成中嵌入伦理保障

Dang Phuong Nam, Nguyen Kieu, Pham Thanh Hieu

机构 * Posts and Telecommunications Institute of Technology(电信技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SafeGen通过整合BGE-M3和Hyper-SD,实现文本到图像生成中的伦理保障,有效过滤有害提示并生成高质量图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20991 2025-12-16 cs.CV 57%

MR-COSMO: Visual-Text Memory Recall and Direct CrOSs-MOdal Alignment Method for Query-Driven 3D Segmentation

MR-COSMO:一种用于查询驱动3D分割的视觉-文本记忆召回与直接跨模态对齐方法

Chade Li, Pengju Zhang, Yihong Wu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MR-COSMO通过视觉-文本记忆召回与直接跨模态对齐方法,在查询驱动的3D分割中实现几何与语义特征的精确融合,提升点云分割性能。

Comments Accepted by AAAI 2026. Copyright (c) 2026, Association for the Advancement of Artificial Intelligence (www.aaai.org). All rights reserved

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14642 2025-12-16 cs.CV 57%

Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension

Relation-R1: 逐步认知链式思维引导的强化学习用于统一关系理解

Lin Li, Wei Chen, Jiahui Li, Kwang-Ting Cheng, Long Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Relation-R1通过整合认知链式思维引导的强化学习,实现了对二元和N元关系的统一理解,提升了视觉-语义定位能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12107 2025-12-16 cs.CV 57%

EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography

EchoVLM:基于测量的多模态学习用于超声心动图

Yuheng Li, Yue Zhang, Abdoul Aziz Amadou, Yuxiang Lai, Jike Zhong, Tiziano Passerini, Dorin Comaniciu, Puneet Sharma

机构 * Georgia Institute of Technology(佐治亚理工学院) Siemens Healthineers(西门子医疗) Siemens Healthcare Limited(西门子医疗有限公司) Emory University(埃默里大学) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 EchoVLM通过引入基于测量的多模态学习方法,实现了超声心动图的端到端解读,提升了疾病分类和视图识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21329 2025-12-16 cs.AI physics.soc-ph 57%

Active Inference AI Systems for Scientific Discovery

主动推断AI系统用于科学发现

Karthik Duraisamy

机构 * Michigan Institute for Computational Discovery & Engineering(密歇根计算发现与工程研究所) University of Michigan(密歇根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出主动推断AI系统,通过结合缓慢假设生成与快速验证推理,利用因果和多模态模型促进科学发现,强调人类判断在处理不确定性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11297 2025-12-16 cs.CL 50%

LegalRikai: Open Benchmark -- Benchmark for Complex Japanese Corporate Legal Tasks

LegalRikai:开放基准——复杂日本企业法律任务的基准

Shogo Fujita, Yuji Naraki, Yiqing Zhu, Shinsuke Mori

机构 * LegalOn Technologies, Inc.(LegalOn技术公司) Kyoto University(京都大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LegalRikai基准通过四个复杂任务评估日本企业法律实践,揭示模型在文档编辑中的不足,并提出数据集评估框架以推动法律领域实践研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01948 2025-12-16 cs.CL 50%

How Far Are We from Genuinely Useful Deep Research Agents?

我们距离真正有用的深度研究代理还有多远?

Dingling Zhang, He Zhu, Jincheng Ren, Kangqi Song, Xinran Zhou, Boyu Feng, Shudong Liu, Jiabin Luo, Weihao Xie, Zhaohui Wang, Tianrui Qin, King Zhu, Yuqing Wang, Qianben Chen, Yuchen Eleanor Jiang, Wei Wang, Jiaheng Liu, Wangchunshu Zhou

机构 * OPPO AI Agent Team(OPPO 人工智能代理团队)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出FINDER基准和DEFT分类,揭示当前深度研究代理在证据整合与推理鲁棒性规划方面的不足。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2512.12596 2025-12-16 cs.CV cs.AI 84%

Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models

基于视觉语言模型的双阶段链式思考内容感知广告布局生成

Kei Yoshitake, Kento Hosono, Ken Kobayashi, Kazuhide Nakata

机构 * Institute of Science Tokyo(东京科学研究所) HAKUHODO Technologies Inc.(HAKUHODO技术公司)

专题命中 文档图表理解 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于视觉语言模型的双阶段链式思考方法,用于生成高质量的广告布局,通过分析背景图像内容来提升布局质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 3 篇

2512.12622 2025-12-16 cs.CV cs.RO 83%

D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航

Zihan Wang, Seungjun Lee, Guangzhao Dai, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);VLM(abstract);分类 cs.CV

AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23046 2025-12-16 cs.CL cs.AI cs.CV cs.RO 62%

SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions

SoMi-ToM:评估具身社会互动中的多视角理论之心假设

Xianzhe Fan, Xuhui Zhou, Chuanyang Jin, Kolby Nottingham, Hao Zhu, Maarten Sap

机构 * The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学) Johns Hopkins University(约翰霍普金斯大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SoMi-ToM基准通过多视角评估人类与模型在具身社会互动中的理论之心能力,揭示大型视觉-语言模型在复杂社交场景中的不足。

Comments 24 pages, 6 figures

Journal ref Proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21307 2025-12-16 cs.CV 57%

Towards Physically Executable 3D Gaussian for Embodied Navigation

迈向可物理执行的3D高斯用于具身导航

Bingchen Miao, Rong Wei, Zhiqi Ge, Xiaoquan sun, Shiqi Gao, Jingzhe Zhu, Renhan Wang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li

机构 * Zhejiang University(浙江大学) Manycore Tech Inc(Manycore科技公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 SAGE-3D通过引入语义和物理对齐的3D高斯环境,提升视觉-语言导航任务的可执行性和泛化能力。

Comments Project Page: https://sage-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏