arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2601.19607 2026-01-28 cs.AI 57%

ComAgent: Multi-LLM based Agentic AI Empowered Intelligent Wireless Networks

ComAgent:基于多LLM的代理式AI赋能智能无线网络

Haoyun Li, Ming Xiao, Kezhi Wang, Robert Schober, Dong In Kim, Yong Liang Guan

机构 * IEEE

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 ComAgent通过多LLM代理式AI框架,实现复杂无线网络任务的自动化设计与优化,展现出超越单体LLM的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18076 2026-01-27 cs.LG 57%

Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming

比较需要有效的测量:重新思考AI红队中的攻击成功率比较

Alexandra Chouldechova, A. Feder Cooper, Solon Barocas, Abhinav Palia, Dan Vann, Hanna Wallach

机构 * Microsoft Research(微软研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文重新审视AI红队中攻击成功率的比较,指出其有效性问题并提出测量理论和统计学方法以评估比较的合理性。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17435 2026-01-27 cs.SE cs.AI 57%

Towards a Declarative Agentic Layer for Intelligent Agents in MCP-Based Server Ecosystems

迈向基于MCP服务器生态系统的声明性代理层

Maria Jesus Rodriguez-Sanchez, Manuel Noguera, Angel Ruiz-Zafra, Kawtar Benghazi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种声明性代理层,旨在解决基于MCP服务器生态系统中代理工作流的可靠性问题,通过明确的架构结构提升任务执行的可验证性和可重复性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08710 2026-01-27 cs.CV 57%

SceneSplat++: A Large Dataset and Comprehensive Benchmark for Language Gaussian Splatting

SceneSplat++: 一个大规模数据集和全面的基准用于语言高斯点云

Mengjiao Ma, Qi Ma, Yue Li, Jiahuan Cheng, Runyi Yang, Bin Ren, Nikola Popovic, Mingqiang Wei, Nicu Sebe, Luc Van Gool, Theo Gevers, Martin R. Oswald, Danda Pani Paudel

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ETH Zürich(苏黎世联邦理工学院) University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University(约翰·霍普金斯大学) University of Pisa(比萨大学) University of Trento(特伦托大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SceneSplat++提出一个大规模数据集和基准,评估语言高斯点云方法,展示可推广方法在3D理解中的优势。

Comments 15 pages, codes, data and benchmark are released at https://scenesplatpp.gaussianworld.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16519 2026-01-26 cs.LG 57%

DANCE: Dynamic, Available, Neighbor-gated Condensation for Federated Text-Attributed Graphs

DANCE: 动态、可用、邻居门控的联邦文本属性图压缩

Zekai Chen, Haodong Lu, Xunkai Li, Henan Sun, Jia Li, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Department of Computer Science, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学系) The Hong Kong University of Science and Technology (GZ), Guangzhou, China(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 DANCE通过动态、可用、邻居门控的图压缩方法,提升联邦文本属性图学习的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16344 2026-01-26 cs.AI 57%

DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

DSGym: 一个全面的框架用于评估和训练数据科学代理

Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou

机构 * Stanford University(斯坦福大学) Together AI Duke University(杜克大学) Harvard University(哈佛大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02979 2026-01-26 cs.HC cs.AI 57%

Systematizing LLM Persona Design: A Four-Quadrant Technical Taxonomy for AI Companion Applications

对LLM人设设计的系统化:面向AI陪伴应用的四象限技术分类

Esther Sun, Zichu Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出四象限技术分类系统,系统化LLM人设设计,涵盖虚拟与具身、情感与功能增强,分析不同应用场景的技术挑战与核心问题。

Comments Accepted to Neurips 2025 workshop: LLM Persona Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10931 2026-01-26 cs.AI 57%

Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents

证明-使用:减轻深度研究代理中的工具调用黑客行为

SHengjie Ma, Chenlong Deng, Jiaxin Mao, Jiadeng Huang, Teng Wang, Junjie Wu, Changwang Zhang, Jun wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 证明-使用通过优化证据依赖关系,减轻深度研究代理中的工具调用黑客行为,并展现出适应性强的工具使用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15652 2026-01-23 cs.AI cs.CR cs.ET 57%

Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models

预测编码与信息瓶颈用于大语言模型中的幻觉检测

Manish Bhatt

机构 * AI Offensive Security Researcher, OWASP(AI攻击防御安全研究员,OWASP)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出了一种结合预测编码和信息瓶颈的轻量级框架,用于高效检测大语言模型中的幻觉,实现了比传统方法更高的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15487 2026-01-23 cs.AI cs.CL cs.MA 57%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15453 2026-01-23 cs.CV 57%

DevPrompt: Deviation-Based Prompt Learning for One-Normal ShotImage Anomaly Detection

DevPrompt: 基于偏差的提示学习用于单正常样本图像异常检测

Morteza Poudineh, Marc Lalonde

机构 * Department of Electrical and Computer Engineering, Concordia University(电气与计算机工程系,康科迪亚大学) Computer Research Institute of Montreal (CRIM)(蒙特利尔计算机研究 institute)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DevPrompt通过结合视觉语言模型的语义能力和基于偏差的评分机制,提升单正常样本图像异常检测的性能和可解释性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24909 2026-01-22 cs.MA cs.AI cs.CY cs.SE 57%

Computational Foundations for Strategic Coopetition: Formalizing Trust and Reputation Dynamics

战略合作者竞争的计算基础:形式化信任与声誉动态

Vik Pant, Eric Yu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种双层信任模型,结合博弈论与动态信任演变,通过实验验证其在合作者竞争中的有效性。

Comments 57 pages, 20 figures. Second technical report in research program; should be read with foundational companion arXiv:2510.18802. Adapts and extends trustworthiness and reputation material from Pant (2021) doctoral dissertation, University of Toronto. Validation source code: https://github.com/vikpant/strategic-coopetition/tree/master/TR_validation/TR2_trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14265 2026-01-22 cs.CY cs.AI cs.CL 57%

From Textbook to Talkbot: A Case Study of a Greek-Language RAG-Based Chatbot in Higher Education

从教材到谈bot:面向高等教育的希腊语基于检索增强生成的聊天机器人案例研究

Maria Eleni Koutsiaki, Marina Delianidi, Chaido Mizeli, Konstantinos Diamantaras, Iraklis Grigoropoulos, Nikolaos Koutlianos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究开发了一个基于RAG框架的希腊语AI聊天机器人,用于高等教育中的教学支持,旨在提升教育实践和AI技术在语言教育中的应用。

Comments 11 pages, 5 figures, 6th Barcelona Conference on Education (BCE2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13809 2026-01-22 cs.RO cs.AI 57%

DroneVLA: VLA based Aerial Manipulation

DroneVLA:基于VLA的空中操控

Fawad Mehboob, Monijesu James, Amir Habel, Jeffrin Sam, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skoltech(斯克里普金科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DroneVLA通过结合VLA模型和定制无人机,实现基于自然语言指令的空中物体抓取与递送,展示了在定位和导航中的高精度表现。

Comments This paper has been accepted for publication at LBR of HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18817 2026-01-21 cs.CV 57%

Disc3D: Automatic Curation of High-Quality 3D Dialog Data via Discriminative Object Referring

Disc3D:通过判别性对象指称自动校准高质量3D对话数据

Siyuan Wei, Chunjie Wang, Xiao Liu, Xiaosheng Yan, Zhishan Zhou, Rui Huang

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Disc3D通过自动化流程生成高质量3D对话数据,解决视角和对象指称模糊性问题,提升多模态大语言模型性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-01-21 cs.CV 57%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Zijian Chen, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12939 2026-01-21 cs.RO cs.AI eess.SP 57%

Active Inference-Driven World Modeling for Adaptive UAV Swarm Trajectory Design

基于主动推断的世界建模用于自适应无人机蜂群轨迹设计

Kaleem Arshid, Ali Krayani, Lucio Marcenaro, David Martin Gomez, Carlo Regazzoni

机构 * University of Genoa(热那亚大学) Carlos III University Madrid(马德里卡洛斯三世大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于主动推断的世界建模框架,用于自适应无人机蜂群轨迹设计,通过整合概率推理和自我学习实现动态环境下的适应性响应。

Comments This paper has been accepted for presentation at the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (IEEE ICASSP 2026) Workshop: 'Multi-Modal Signal Processing and AI for Communications and Sensing in 6G and Beyond (MuSiC-6GB)'

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12839 2026-01-21 cs.LG q-fin.RM 57%

Knowledge-Integrated Representation Learning for Crypto Anomaly Detection under Extreme Label Scarcity; Relational Domain-Logic Integration with Retrieval-Grounded Context and Path-Level Explanations

基于知识整合的表示学习用于在极端标签稀缺下的加密异常检测;关系领域逻辑整合与检索基础的上下文和路径级解释

Gyuyeon Na, Minjung Park, Soyoun Kim, Jungbin Shin, Sangmi Chai

机构 * AI and Business Analytics, Ewha Womans University, Seoul, Republic of Korea(爱媛女子大学人工智能与商务分析系) Department of Business Administration, Kumoh National Institute of Technology, Gumi, Republic of Korea(Kumoh国立技术大学商业管理系) Coretrustlink, Seoul, Republic of Korea(Coretrustlink)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出RDLI框架,通过整合领域逻辑与检索上下文,提升加密异常检测在极端标签稀缺下的准确性和可解释性。

Comments Gyuyeon Na, Minjung Park, Soyoun Kim contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12468 2026-01-21 cs.CV 57%

DCAC: Dynamic Class-Aware Cache Creates Stronger Out-of-Distribution Detectors

DCAC: 动态类感知缓存创建更强的分布外检测器

Yanqi Wu, Qichao Chen, Runhe Lai, Xinhua Lu, Jia-Xin Zhuang, Zhilin Zhao, Wei-Shi Zheng, Ruixuan Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 DCAC通过动态类感知缓存提升分布外检测性能,减少误报率

Comments 9 pages, 9 figures, Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12346 2026-01-21 cs.CV 57%

MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents

MMDeepResearch-Bench: 一个多模态深度研究代理的基准

Peizhou Huang, Zixuan Zhong, Zhongwei Wan, Donghao Zhou, Samiul Alam, Xin Wang, Zexin Li, Zhihao Dou, Li Zhu, Jing Xiong, Chaofan Tao, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * OSU(俄亥俄州立大学) Amazon(亚马逊公司) UMich(密歇根大学) UCL(伦敦大学学院) CUHK(香港中文大学) UCR(加州大学尔湾分校) CWRU(克里夫兰医学中心) HKU(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10369 2026-01-21 cs.CV 57%

Fine-Grained Human Pose Editing Assessment via Layer-Selective MLLMs

通过层选择性MLLMs实现细粒度人体姿态编辑评估

Ningyu Sun, Zhaolin Cai, Zitong Xu, Peihang Chen, Huiyu Duan, Yichao Yan, Xiongkuo Min, Xiaokang Yang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出HPE-Bench基准和基于层选择性MLLMs的统一框架,用于细粒度评估人体姿态编辑的真实性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12227 2026-01-21 cs.LG 57%

Learning Longitudinal Health Representations from EHR and Wearable Data

从电子健康记录和可穿戴数据中学习纵向健康表示

Yuanyun Zhang, Han Zhou, Li Feng, Yilin Hong, Shi Li

机构 * University of the Chinese Academy of Sciences, Columbia University(中国科学院大学,哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出一种多模态基础模型,通过联合表示电子健康记录和可穿戴数据,提升纵向健康预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12010 2026-01-21 cs.CV 57%

SMc2f: Robust Scenario Mining for Robotic Autonomy from Coarse to Fine

SMc2f: 从粗到细的机器人自主性鲁棒场景挖掘

Yifei Chen, Ross Greer

机构 * Department of Computer Science at Xi’an University of Technology(西安理工大学计算机科学系) department of Computer Science & Engineering at the University of California, Merced(加州大学默塞德分校计算机科学与工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SMc2f通过从粗到细的流程,利用视觉语言模型和文本-轨迹对比学习提升机器人场景挖掘的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10360 2026-01-21 cs.CV 57%

FaceXBench: Evaluating Multimodal LLMs on Face Understanding

FaceXBench: 评估多模态大语言模型在面部理解上的能力

Kartik Narayan, Vibashan VS, Vishal M. Patel

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。

Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23044 2026-01-19 cs.CV 57%

Video-Browser: Towards Agentic Open-web Video Browsing

Video-Browser: 向具有代理能力的开放网页视频浏览迈进

Zhengyang Liang, Yan Shu, Xiangrui Liu, Minghao Qin, Kaixin Liang, Nicu Sebe, Zheng Liu, Lizi Liao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Video-Browser通过金字塔感知技术,在开放式网络视频浏览中实现37.5%的相对提升,同时减少58.3%的token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10535 2026-01-16 cs.CV 57%

SVII-3D: Advancing Roadside Infrastructure Inventory with Decimeter-level 3D Localization and Comprehension from Sparse Street Imagery

SVII-3D:利用厘米级3D定位与稀疏街道影像的综合理解,推进道路基础设施库存建设

Chong Liu, Luxuan Fu, Yang Jia, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, Wuhan 430079, China(信息工程测绘遥感国家重点实验室(LIESMARS),武汉大学) Research Institute Ltd, Chengdu 610000, China(四川省公路规划设计研究有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SVII-3D通过厘米级3D定位与稀疏影像综合理解,提升道路基础设施库存的自动化创建与细粒度状态诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08847 2026-01-16 cs.CL cs.AI 57%

Scalable and Reliable Evaluation of AI Knowledge Retrieval Systems: RIKER and the Coherent Simulated Universe

可扩展且可靠的AI知识检索系统评估:RIKER和一致性模拟宇宙

JV Roig

机构 * Kamiwaza AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 RIKER通过生成文档而非提取地面真实,提供了一种可扩展且抗污染的AI知识检索系统评估方法,揭示了上下文长度、跨文档聚合和事实基础能力等关键问题。

Comments 26 pages, 17 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09663 2026-01-15 cs.CV 57%

Self-Supervised Animal Identification for Long Videos

长时间视频中的自监督动物识别

Xuyang Fang, Sion Hannuna, Edwin Simpson, Neill Campbell

机构 * University of Bristol(布里斯托大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09661 2026-01-15 cs.CV 57%

LiteEmbed: Adapting CLIP to Rare Classes

LiteEmbed: 适应CLIP的稀有类别

Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi

机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad, India(印度海得拉巴IIIT大学计算机视觉研究所、Kohli智能系统中心) Adobe Research, Bengaluru, India(印度班加罗尔Adobe研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 LiteEmbed通过子空间优化和双目标方法,实现CLIP在稀有类别上的少样本个性化,提升分类和检索任务的性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09575 2026-01-15 cs.CV 57%

OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding

OpenVoxel: 一种无需训练的稀疏体素分组与标注算法用于开放词汇3D场景理解

Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang, Cheng Sun

机构 * NVIDIA National Taiwan University(国立台湾大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 OpenVoxel通过无需训练的多模态大语言模型实现稀疏体素的分组与标注,提升开放词汇3D场景理解的性能。

Comments project page: https://peterjohnsonhuang.github.io/openvoxel-pages/

详情

展开后加载摘要…

URL PDF HTML 收藏