arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 313 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2511.23092 2025-12-02 cs.AI 79%

Does Self-Evaluation Enable Wireheading in Language Models?

自我评估是否能导致语言模型中的wireheading?

David Demitri Africa, Hans Ethan Ting

机构 * Ateneo de Manila University(马尼拉大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究探讨自我评估与奖励信号结合是否导致语言模型wireheading,发现评分通胀现象,但解耦后仍存在过度自信,提示需更谨慎的机制设计。

Comments Accepted (oral) to Foundations of Agentic Systems Theory at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23689 2025-12-02 cs.CL 79%

Child-Directed Language Does Not Consistently Boost Syntax Learning in Language Models

儿童导向语言并不总是能提升语言模型的语法学习

Francesca Padovani, Jaap Jumelet, Yevgen Matusevych, Arianna Bisazza

机构 * Center for Language and Cognition (CLCG) University of Groningen(语言与认知中心(CLCG)格罗宁根大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 该研究发现儿童导向语言在提升语言模型语法学习方面效果不一致,且维基百科数据表现更优,提出FIT-CLAMS方法以更公平评估语法能力。

Comments 21 pages, 4 figures, 4 tables

Journal ref Proceedings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01419 2025-12-02 cs.CV cs.AI 79%

Rice-VL: Evaluating Vision-Language Models for Cultural Understanding Across ASEAN Countries

Rice-VL:评估跨东盟国家的视觉语言模型的文化理解能力

Tushar Pranav, Eshan Pandey, Austria Lyka Diane Bala, Aman Chadha, Indriyati Atmosukarto, Donny Soh Cheng Lock

机构 * Singapore Institute of Technology(新加坡理工学院) Amazon GenAI(亚马逊人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 RICE-VL通过评估视觉语言模型在11个东盟国家的文化理解能力,揭示了模型在文化多样性地区存在的偏见和局限性,强调了开发更具包容性的模型的重要性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01232 2025-12-02 cs.SE cs.AI 79%

LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost

基于LLM的判别器用于可扩展的测试覆盖率评估:准确性、操作可靠性与成本

Donghao Huang, Shila Chew, Anna Dutkiewicz, Zhaoxia Wang

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学) Research and Development(研发)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 LLM-as-a-Judge通过低成本高可靠性的测试覆盖率评估方法,显著降低评估成本并提升准确性。

Comments 7 pages, accepted by the AAAI 2026 Workshop on Next Gen Code Development with Collaborative AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24616 2025-12-02 cs.CL cs.AI 79%

Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX

Judgment Eye: 解剖俄罗斯语LLM评估的POLLUX

Nikita Martynov, Anastasia Mordasheva, Dmitriy Gorbetskiy, Danil Astafurov, Ulyana Isaeva, Elina Basyrova, Sergey Skachkov, Victoria Berestova, Nikolay Ivanov, Valeriia Zanina, Alena Fenogenova

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 POLLUX通过细粒度任务分类和LLM评估器,提供可解释的俄语生成模型评估方法。

Comments short version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01179 2025-12-02 cs.IR cs.AI cs.LG 79%

Toward a benchmark for CTR prediction in online advertising: datasets, evaluation protocols and perspectives

面向在线广告CTR预测的基准测试:数据集、评估协议和展望

Shan Gao, Yanwu Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Bench-CTR平台,通过比较不同模型在公开和合成数据集上的表现,评估CTR预测模型的性能及发展趋势。

Comments 64 pages, 8 figures, 11 tables

Journal ref Electronic Commerce Research, forthcoming (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00163 2025-12-02 cs.LG cs.CL 79%

Measuring What LLMs Think They Do: SHAP Faithfulness and Deployability on Financial Tabular Classification

测量大语言模型认为它们能做什么:SHAP忠实性与金融表格分类中的部署性

Saeed AlMarri, Mathieu Ravaut, Kristof Juhasz, Gautier Marti, Hamdan Al Ahbabi, Ibrahim Elfadel

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究评估了LLMs在金融表格分类中的SHAP值,发现其自我解释与SHAP值存在分歧,指出LLMs在结构化金融建模中的局限性,但认为改进的可解释性机制可提升其在风险敏感领域的应用潜力。

Comments 7 pages, 3 figures, 3 tables, AAAI 2026 Deployable AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00046 2025-12-02 cs.CL cs.AI 79%

Text Annotation via Inductive Coding: Comparing Human Experts to LLMs in Qualitative Data Analysis

通过归纳编码进行文本标注:在定性数据分析中比较人类专家与大语言模型

Angelina Parfenova, Andreas Marfurt, Alexander Denzler, Juergen Pfeffer

机构 * Lucerne University of Applied Sciences and Arts(卢塞恩应用科学大学) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了人类专家与大语言模型在定性数据分析中的表现,发现人类在处理复杂句子时表现优异,而LLMs在简单句子上表现更佳。

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01048 2025-12-02 cs.CV 78%

TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models

TRoVe: 发现时间视觉-语言模型中的错误引发静态特征偏差

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学) HOPPR

专题命中 评测与基准 :language model(title,abstract)

AI总结 TRoVe通过识别时间视觉-语言模型中的错误引发静态特征偏差,提升模型在下游任务中的表现。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01735 2025-12-02 cs.LG 77%

Automating modeling in mechanics: LLMs as designers of physics-constrained neural networks for constitutive modeling of materials

力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Christian Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01603 2025-12-02 cs.CL cs.MM 77%

MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark

MAC-SLU:多意图汽车舱语音理解基准

Yuezhang Peng, Chonghao Cai, Ziang Liu, Shuai Fan, Sheng Jiang, Hua Xu, Yuxin Liu, Qiguang Chen, Kele Xu, Yao Li, Sheng Wang, Libo Qin, Xie Chen

机构 * School of Computer Science, MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(计算机学院、人工智能教育部重点实验室、上海交通大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院、中南大学) AISpeech Co., Ltd.(AISpeech公司) National University of Defense Technology(国防科技大学) Shanghai Aviation Electric Co., Ltd(上海航空电子有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 MAC-SLU是一个多意图汽车舱语音理解数据集,用于评估LLMs和LALMs在SLU任务中的性能,揭示了上下文学习与SFT方法的差异以及E2E方法的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00991 2025-12-02 cs.CL 77%

Advancing Academic Chatbots: Evaluation of Non Traditional Outputs

推进学术聊天机器人:非传统输出的评估

Nicole Favero, Francesca Salute, Daniel Hardt

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究评估了非传统学术输出生成,比较了两种检索策略并测试了LLMs在幻灯片和播客脚本生成中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00556 2025-12-02 cs.SE cs.CL 77%

Bias Testing and Mitigation in Black Box LLMs using Metamorphic Relations

在黑盒大语言模型中利用元关系进行偏见测试与缓解

Sina Salimian, Gias Uddin, Sumon Biswas, Henry Leung

机构 * University of Calgary(卡尔加里大学) York University(约克大学) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用元关系检测和缓解大语言模型中的偏见,通过生成对抗性样本提高模型公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01571 2025-12-02 cs.NI 75%

Velocity-Adaptive Access Scheme for Semantic-Aware Vehicular Networks: Joint Fairness and AoI Optimization

面向语义感知车联网的自适应接入方案:公平性与信息年龄优化的联合优化

Xiao Xu, Qiong Wu, Pingyi Fan, Kezhi Wang, Nan Cheng, Wen Chen, Khaled B. Letaief

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种面向语义感知车联网的自适应接入方案,通过联合优化公平性与信息年龄,利用顺序凸近似和大语言模型算法提升通信效率与安全性。

Comments This paper has been submitted to IEEE transactions on moblie computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01373 2025-12-02 cs.CV 75%

SRAM: Shape-Realism Alignment Metric for No Reference 3D Shape Evaluation

SRAM:无参考3D形状评估的形状现实对齐度量

Sheng Liu, Tianyu Luan, Phani Nuney, Xuelu Feng, Junsong Yuan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SRAM提出了一种基于大型语言模型的无参考3D形状评估度量,通过网格编码和现实感解码器实现与人类感知的对齐,优于现有方法并具有良好的泛化能力。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01274 2025-12-02 cs.CL cs.AI cs.LG 75%

SUPERChem: A Multimodal Reasoning Benchmark in Chemistry

SUPERChem:化学领域的多模态推理基准

Zehua Zhao, Zhixian Huang, Junren Li, Siyu Lin, Junting Zhou, Fengqi Cao, Kun Zhou, Rui Ge, Tingting Long, Yuexiang Zhu, Yan Liu, Jie Zheng, Junnian Wei, Rong Zhu, Peng Zou, Wenyu Li, Zekai Cheng, Tian Ding, Yaxuan Wang, Yizhao Yan, Tingru Wei, Haowei Ming, Weijie Mao, Chen Sun, Yiming Liu, Zichen Wang, Zuo Zhang, Tong Yang, Hao Ma, Zhen Gao, Jian Pei

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SUPERChem通过多模态推理基准测试,评估LLMs在化学领域的能力,揭示模型对视觉信息的依赖,并区分高保真推理与启发式推理。

Comments 35 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00773 2025-12-02 cs.CV 75%

DEJIMA: A Novel Large-scale Japanese Dataset for Image Captioning and Visual Question Answering

DEJIMA:一种新的大规模日语数据集用于图像描述和视觉问答

Toshiki Katsube, Taiga Fukuhara, Kenichiro Ando, Yusuke Mukuta, Kohei Uehara, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN(日本资源技术研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DEJIMA是首个大规模日语图像描述与视觉问答数据集,通过整合网络收集、目标检测和大语言模型优化,提升了日语语言和文化表现力,显著优于现有翻译或人工标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17220 2025-12-02 cs.CL cs.AI cs.CE cs.LG 75%

PARROT: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs

PARROT:输出真实性的说服与同意鲁棒性评级——面向大语言模型的共情鲁棒性基准

Yusuf Çelebi, Özay Ezerceli, Mahmoud El Hussieni

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PARROT提出了一种评估大语言模型在权威压力下鲁棒性的基准,发现先进模型表现稳健,而旧模型易出现知识崩溃,强调需将抗过度拟合压力作为安全部署的关键目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16596 2025-12-02 cs.HC cs.SI 75%

Using Generative AI to Uncover What Drives Player Enjoyment in PC and VR Games

利用生成式AI揭示驱动PC和VR游戏玩家愉悦的因素

Hisham Abdelqader

专题命中 评测与基准 :language model(abstract);small language model(abstract);SLM(abstract)

AI总结 本研究利用生成式AI和机器学习分析PC和VR游戏评论,揭示影响玩家愉悦的关键因素,为游戏开发提供优化建议。

Comments The Steam dataset used in this study can be accessed at: https://data.mendeley.com/datasets/jxy85cr3th/2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01852 2025-12-02 cs.CL cs.AI cs.ET 73%

BHRAM-IL: A Benchmark for Hallucination Recognition and Assessment in Multiple Indian Languages

BHRAM-IL:多印度语言中的幻觉识别与评估基准

Hrishikesh Terdalkar, Kirtan Bhojani, Aryan Dongare, Omm Aditya Behera

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BHRAM-IL是一个用于多印度语言中幻觉识别与评估的基准,通过评估14种多语言LLM在多个任务上的表现,揭示了幻觉检测的跨语言和事实性问题。

Comments Accepted at BHASHA Workshop @ IJCNLP/AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01507 2025-12-02 cs.AI cs.LG 73%

SynthStrategy: Extracting and Formalizing Latent Strategic Insights from LLMs in Organic Chemistry

SynthStrategy: 从有机化学中提取并形式化大语言模型中的潜在战略洞察

Daniel Armstrong, Zlatko Jončev, Andres M Bran, Philippe Schwaller

机构 * \'Ecole Polytechnique F\' e d\' e rale de Lausanne (EPFL)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SynthStrategy通过将大语言模型中的合成策略转化为可验证代码,实现了基于自然语言的路线检索,并在基准测试中达到75%的Top-3准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07931 2025-12-02 cs.SD cs.AI cs.CL 73%

SpeechJudge: Towards Human-Level Judgment for Speech Naturalness

SpeechJudge: 向人类水平的语音自然度判断迈进

Xueyao Zhang, Chaoren Wang, Huan Liao, Ziniu Li, Yuancheng Wang, Li Wang, Dongya Jia, Yuanzhe Chen, Xiulin Li, Zhuo Chen, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 SpeechJudge通过构建大规模人类反馈数据集和生成奖励模型,提升语音自然度判断的准确性,显著优于现有方法。

Comments Dataset, Model, and Code: https://github.com/AmphionTeam/SpeechJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12286 2025-12-02 cs.AI cs.SE 70%

The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason

SWE-Bench 的错觉:当最先进的大语言模型记住而不是推理

Shanchao Liang, Spandan Garg, Roshanak Zilouchian Moghaddam

机构 * Purdue University(普渡大学) Microsoft(微软)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出,SWE-Bench 的高表现可能源于记忆而非推理,通过两个诊断任务揭示模型在软件工程任务中的能力限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01077 2025-12-02 cs.CL cs.HC 70%

ELR-1000: A Community-Generated Dataset for Endangered Indic Indigenous Languages

ELR-1000:一个社区生成的濒危印度-原住民语言数据集

Neha Joshi, Pamir Gogoi, Aasim Mirza, Aayush Jansari, Aditya Yadavalli, Ayushi Pandey, Arunima Shukla, Deepthi Sudharsan, Kalika Bali, Vivek Seshadri

机构 * Karya UC San Diego Microsoft Corporation(微软公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ELR-1000数据集通过众包方式收集10种濒危印度-原住民语言的传统食谱,评估LLMs翻译表现,发现提供文化背景信息可显著提升翻译质量,推动公平的文化敏感语言技术发展。

Comments Accepted at AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00725 2025-12-02 cs.LG 70%

ESMC: MLLM-Based Embedding Selection for Explainable Multiple Clustering

ESMC: 基于多模态大语言模型的可解释多聚类嵌入选择

Xinyue Wang, Yuheng Jia, Hui Liu, Junhui Hou

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ESMC利用多模态大语言模型实现用户驱动的可解释多聚类,通过嵌入选择和伪标签学习提升聚类准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14972 2025-12-02 cs.HC cs.AI 70%

Harmful Traits of AI Companions

AI伴侣的有害特性

W. Bradley Knox, Katie Bradford, Samanta Varela Castro, Desmond C. Ong, Sean Williams, Jacob Romanow, Carly Nations, Peter Stone, Samuel Baker

机构 * UT Austin — Department of Computer Science(德克萨斯大学奥斯汀分校计算机科学系) UT Austin — Department of Communication Studies(德克萨斯大学奥斯汀分校传播学系) UT Austin — Technology & Information Policy Institute(德克萨斯大学奥斯汀分校科技与信息政策研究所) UT Austin — Department of Psychology(德克萨斯大学奥斯汀分校心理学系) UT School of Law(德克萨斯大学法学院) UT Austin — Department of English(德克萨斯大学奥斯汀分校英语系) El Colegio Mexiquense, A.C. — Seminario de Instituciones, Sociedad Civil y Políticas Públicas(墨西哥埃尔科尔西奥学院,A.C. — 社会与公共政策研讨会) Sony AI(索尼人工智能)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了AI伴侣可能带来的有害特性,分析了其潜在负面影响及因果路径,并提出减轻风险的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07993 2025-12-02 cs.CV cs.AI eess.IV q-bio.NC 70%

Multigranular Evaluation for Brain Visual Decoding

多粒度评估用于脑视觉解码

Weihao Xia, Cengiz Oztireli

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出BASIC框架,通过多粒度评估方法提升脑视觉解码的评估精度与解释性。

Comments AAAI 2026 (Oral). Code: https://github.com/weihaox/BASIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13671 2025-12-02 cs.CL 70%

HEALTH-PARIKSHA: Assessing RAG Models for Health Chatbots in Real-World Multilingual Settings

HEALTH-PARIKSHA: 评估医疗聊天机器人在真实多语言环境中的RAG模型

Varun Gumma, Ananditha Raghunath, Mohit Jain, Sunayana Sitaram

机构 * Microsoft(微软)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HEALTH-PARIKSHA研究评估了24个LLMs在真实多语言环境中的表现,发现印地语模型在印地语查询中表现不一,且事实准确性低于英语查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00287 2025-12-02 cs.RO cs.AI cs.CV 70%

RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals

RealAppliance: 让高保真家电资产可控且可操作,如对齐的现实手册

Yuzheng Gao, Yuxing Long, Lei Kang, Yuchong Guo, Ziyan Yu, Shangqing Mao, Jiyao Zhang, Ruihai Wu, Dongjiang Li, Hui Shen, Hao Dong

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RealAppliance通过高保真家电资产和对齐手册的基准测试,推动家电操控技术的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00226 2025-12-02 cs.CV cs.AI 70%

DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation

DenseScan: 通过2D密集标注提升3D场景理解

Zirui Wang, Tao Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DenseScan通过2D密集标注提升3D场景理解,结合多视角图像和多模态大语言模型生成丰富语义标注,拓展下游任务应用。

Comments Workshop on Space in Vision, Language, and Embodied AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏