arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-29 至 2025-12-29 共收录 127 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 8 篇

2410.23066 2025-12-29 cs.CL cs.LG 84%

Don't Pay Attention, PLANT It: Pretraining Attention via Learning-to-Rank

不要关注,PLANT它:通过学习排序进行预训练注意力

Debjyoti Saha Roy, Byron C. Wallace, Javed A. Aslam

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学克劳利计算机科学学院)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PLANT通过学习排序模型预训练注意力,提升多标签文本分类性能,尤其在少样本和稀有标签任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21933 2025-12-29 cs.CL 77%

Broken Words, Broken Performance: Effect of Tokenization on Performance of LLMs

破碎的词,破碎的性能:分词对大语言模型性能的影响

Sachin Pawar, Manoj Apte, Kshitij Jadhav, Girish Keshav Palshikar, Nitin Ramrakhiyani

机构 * TCS Research(塔塔咨询服务研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了分词对大语言模型性能的影响,提出惩罚函数量化分词质量,并验证其在多个NLP任务上的统计显著性。

Comments International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics (IJCNLP-AACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21440 2025-12-29 cs.SE cs.LG 77%

Fuzzwise: Intelligent Initial Corpus Generation for Fuzzing

Fuzzwise: 用于模糊测试的智能初始语料生成

Hridya Dhulipala, Xiaokai Rong, Aashish Yadavally, Tien N. Nguyen

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FuzzWise通过基于LLM的多代理框架,高效生成初始语料,提升模糊测试的代码覆盖和错误触发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03814 2025-12-29 cs.LG cs.AI cs.CL 75%

Recursive Training Loops in LLMs: How training data properties modulate distribution shift in generated data?

LLMs中的递归训练循环:训练数据属性如何调节生成数据中的分布偏移

Grgur Kovač, Jérémy Perez, Rémy Portelas, Peter Ford Dominey, Pierre-Yves Oudeyer

机构 * Flowers TEAM, INRIA(INRIA Flowers TEAM) Ubisoft La Forge INSERM UMR 1093-CAPS Robot Cognition Laboratory, Institute Marey(Institute Marey Robot Cognition Laboratory)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了LLMs中递归训练循环中训练数据属性对生成数据分布偏移的影响,发现词汇多样性放大偏移,而语义多样性和数据质量减轻偏移,并揭示了不同领域数据之间的模块化影响。

Comments Accepted to EMNLP 2025 (Oral), Source Code: https://github.com/flowersteam/ce_llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21515 2025-12-29 cs.LG cs.CL 73%

Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training

感知度意识的数据扩展定律:感知度景观预测持续预训练的表现

Lei Liu, Hao Zhu, Yue Shen, Zhixuan Chu, Jian Wang, Jinjie Gu, Kui Ren

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出感知度意识的数据扩展定律,通过感知度景观预测持续预训练的表现,有效提升数据利用效率和训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21913 2025-12-29 cs.LG 57%

GQ-VAE: A gated quantized VAE for learning variable length tokens

GQ-VAE:一种门控量化变分自编码器,用于学习可变长度令牌

Theo Datta, Kayla Huang, Sham Kakade, David Brandfonbrener

机构 * Kempner Institute, Harvard University(哈佛大学凯姆纳研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 GQ-VAE通过门控量化变分自编码器实现可变长度令牌学习,提升了压缩和语言建模性能,并在下游语言模型学习中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13030 2025-12-29 cs.CV cs.LG cs.RO 57%

Motus: A Unified Latent Action World Model

Motus:一个统一的潜在动作世界模型

Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Peking University(北京大学) Horizon Robotics

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03606 2025-12-29 cs.RO cs.CV 50%

VTAO-BiManip: Masked Visual-Tactile-Action Pre-training with Object Understanding for Bimanual Dexterous Manipulation

VTAO-BiManip: 带物体理解的遮蔽视觉-触觉-动作预训练用于双臂灵巧操作

Zhengnan Sun, Zhaotai Shi, Jiayin Chen, Qingtao Liu, Yu Cui, Qi Ye, Jiming Chen

机构 * College of Control Science and Engineering, Zhejiang University, Hangzhou, 310027, China(浙江大学控制科学与工程学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 VTAO-BiManip通过结合视觉-触觉-动作预训练与物体理解,提升双臂灵巧操作的课程强化学习效果,实现超过现有方法20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 3 篇

2512.21529 2025-12-29 cs.CV cs.AI 83%

Hierarchy-Aware Fine-Tuning of Vision-Language Models

层级感知的视觉-语言模型微调

Jiayu Li, Rajesh Gangireddy, Samet Akcay, Wei Cheng, Juhua Hu

机构 * University of Washington(华盛顿大学) Intel(英特尔)

专题命中 指令微调 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06157 2025-12-29 cs.CV cs.AI 83%

UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces

UrbanVideo-Bench: 基于城市空间视频数据评估视觉-语言模型的具身智能

Baining Zhao, Jianjie Fang, Zichao Dai, Ziyou Wang, Jirong Zha, Weichen Zhang, Chen Gao, Yue Wang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 UrbanVideo-Bench通过城市空间视频数据评估视频大语言模型的具身智能,揭示其在城市环境中感知、推理和导航能力的局限性,并验证了Sim-to-Real迁移的潜力。

Comments 22 pages

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 32400-32423, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21709 2025-12-29 cs.CL cs.AI 73%

Detecting AI-Generated Paraphrases in Bengali: A Comparative Study of Zero-Shot and Fine-Tuned Transformers

检测孟加拉语生成的改写文本:零样本和微调变换器的比较研究

Md. Rakibul Islam, Most. Sharmin Sultana Samu, Md. Zahid Hossain, Farhad Uz Zaman, Md. Kamrozzaman Bhuiyan

机构 * Department of CSE, Ahsanullah University of Science and Technology, Bangladesh(阿沙努拉科技大学计算机科学与工程系) Department of CSE, BRAC University, Bangladesh(布拉克大学计算机科学与工程系) Department of CSE, Southeast University, Bangladesh(东南大学计算机科学与工程系) Enosis Solutions, Bangladesh(恩osis解决方案)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了零样本和微调变换器模型在检测孟加拉语AI生成文本中的性能,发现微调显著提升检测准确率,其中XLM-RoBERTa、mDeBERTa和MultilingualBERT表现最佳。

Comments Accepted for publication in 2025 28th International Conference on Computer and Information Technology (ICCIT)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 7 篇

2512.21828 2025-12-29 eess.AS 85%

Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning

基于上下文偏置的LLM语音识别中的热点词检索与强化学习

YuXiang Kong, JunFeng Hou, Jian Tang, Bingqing Zhu, Jicheng Zhang, Shaofei Xue

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于热点词检索与强化学习的LLM语音识别框架,通过增强数据增强和模糊匹配提高热点词识别准确性,从而降低关键词错误率并保持整体转录准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21506 2025-12-29 cs.LG cs.AI cs.CL cs.HC 83%

MotionTeller: Multi-modal Integration of Wearable Time-Series with LLMs for Health and Behavioral Understanding

MotionTeller: 多模态整合可穿戴时间序列与大语言模型用于健康和行为理解

Aiwei Zhang, Arvind Pillai, Andrew Campbell, Nicholas C. Jacobson

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 MotionTeller通过整合可穿戴时间序列与大语言模型,实现高精度的自然语言行为摘要生成,提升健康和行为理解的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02950 2025-12-29 eess.AS cs.SD 82%

Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech

细粒度偏好优化提升零样本文本到语音

Jixun Yao, Yuguang Yang, Yu Pan, Yuan Feng, Ziqian Ning, Jianhao Ye, Hongbin Zhou, Lei Xie

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

AI总结 细粒度偏好优化方法通过解决生成样本中的局部问题,提升零样本文本到语音系统的鲁棒性和可懂度。

Comments Accepted By IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21915 2025-12-29 cs.LG cs.DB 81%

Exploring the Heterogeneity of Tabular Data: A Diversity-aware Data Generator via LLMs

探索表格数据的异质性:通过LLMs的多样性感知数据生成器

Yafeng Tang, Xiaoou Ding, Jianzhuo Du, Zishuo Yan, Zhuang Ma, Zheng Liang, Zekai Qian, Hongzhi Wang

机构 * Hongzhi Wang(王 Hongzhi)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 DATE通过LLMs生成多样化且高质量的表格数据,有效提升机器学习模型的性能与推理能力。

Comments This manuscript has been submitted to IEEE Transactions on Knowledge and Data Engineering (TKDE) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 67%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21921 2025-12-29 cs.CV cs.IR cs.LG 57%

AutoPP: Towards Automated Product Poster Generation and Optimization

AutoPP:迈向自动化产品海报生成与优化

Jiahao Fan, Yuxin Qin, Wei Feng, Yanyin Chen, Yaoyu Li, Ao Ma, Yixiu Li, Li Zhuang, Haoyi Bian, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law

机构 * Project Leader and Corresponding Author(项目负责人及通讯作者)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 AutoPP 通过自动化流程生成和优化产品海报,利用统一设计模块和元素渲染模块,结合在线反馈提升点击通过率,实现高质量的海报生成与优化。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21351 2025-12-29 cs.SE cs.AI cs.NE 57%

CosmoCore-Evo: Evolutionary Dream-Replay Reinforcement Learning for Adaptive Code Generation

CosmoCore-Evo: 基于进化梦回的强化学习用于自适应代码生成

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 CosmoCore-Evo通过进化算法提升代码生成的适应性和新颖性,实现更高性能和更快适应。

Comments 10 pages, 2 figures; Code for Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 9 篇

2412.20166 2025-12-29 cs.AR cs.AI 85%

PIMphony: Overcoming Bandwidth and Capacity Inefficiency in PIM-based Long-Context LLM Inference System

PIMphony: 逾越基于PIM的长上下文LLM推理系统的带宽和容量低效问题

Hyucksung Kwon, Kyungmo Koo, Janghyeon Kim, Woongkyu Lee, Minjae Lee, Gyeonggeun Jung, Hyungdeok Lee, Yousub Jung, Jaehan Park, Yosub Song, Byeongsu Yang, Haerang Choi, Guhyun Kim, Jongsoon Won, Woojae Shin, Changhyun Kim, Gyeongcheol Shin, Yongkee Kwon, Ilkon Kim, Euicheol Lim, John Kim, Jungwook Choi

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PIMphony通过三种协同设计技术解决基于PIM的长上下文LLM推理系统的带宽和容量低效问题,显著提升吞吐量和效率。

Comments 21 pages, 20 figures, Accepted to 2026 IEEE International Symposium on High-Performance Computer Architecture

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12712 2025-12-29 cs.CL cs.AI 84%

Adaptive Focus Memory for Language Models

自适应聚焦记忆用于语言模型

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 自适应聚焦记忆通过动态分配保真度级别,实现多轮对话中有效约束保持,无需修改模型权重或外部检索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21567 2025-12-29 cs.CL 77%

Beyond Heuristics: A Decision-Theoretic Framework for Agent Memory Management

超越启发法:一个决策理论框架用于智能体记忆管理

Changzhi Sun, Xiangyu Chen, Jixiang Luo, Dell Zhang, Xuelong Li

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DAM框架,通过决策理论方法解决智能体记忆管理问题,强调长期效用与风险评估,为不确定性下的记忆系统研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21354 2025-12-29 cs.CR cs.AI cs.SE 77%

Reflection-Driven Control for Trustworthy Code Agents

基于反射的可信代码代理控制

Bin Wang, Jiazheng Quan, Xingrui Yu, Hansen Hu, Yuhao, Ivor Tsang

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出反射驱动控制方法,通过内部反思循环提升代码生成的安全性和合规性,实现自主、安全且可审计的AI代码代理。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22082 2025-12-29 cs.CY 75%

Agent-based simulation of online social networks and disinformation

基于代理的在线社交网络与虚假信息模拟

Alejandro Buitrago López, Alberto Ortega Pastor, David Montoro Aguilera, Mario Fernández Tárraga, Jesús Verdú Chacón, Javier Pastor-Galindo, José A. Ruipérez-Valiente

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于代理的社交网络模拟框架,结合生成模块和红色模块,用于研究虚假信息传播的动态及影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22087 2025-12-29 cs.CL 70%

Context as a Tool: Context Management for Long-Horizon SWE-Agents

上下文作为工具:长周期SWE代理的上下文管理

Shukai Liu, Jian Yang, Bo Jiang, Yizhi Li, Jinyang Guo, Xianglong Liu, Bryan Dai

机构 * Beihang University(北航大学) Manchester(曼彻斯特) Ubiquant

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CAT通过整合上下文管理工具,提升SWE代理的长周期推理能力,实验表明其在SWE-Bench-Verified上达到57.6%的解决率,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00741 2025-12-29 cond-mat.mtrl-sci 67%

Accelerated Inorganic Materials Design with Generative AI Agents

利用生成式AI代理加速无机材料设计

Izumi Takahara, Teruyasu Mizoguchi, Bang Liu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 MatAgent通过结合生成模型和预测模型,利用大语言模型的推理能力,实现高效、可解释的无机材料设计与发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21616 2025-12-29 cs.CV 67%

TAMEing Long Contexts in Personalization: Towards Training-Free and State-Aware MLLM Personalized Assistant

在个性化中延长上下文:迈向无训练和状态感知的MLLM个性化助手

Rongpei Hong, Jian Lang, Ting Zhong, Yong Wang, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Aiwen Technology Co., Ltd.(Aiwen科技有限公司) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出TAME框架,通过双记忆和RA2G范式实现无训练、状态感知的MLLM个性化,提升长上下文对话能力。

Comments Accepted by KDD 2026 research track. Code and data are available at https://github.com/ronpay/TAME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21220 2025-12-29 cs.AI cs.CV cs.RO 57%

RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic

RoboSafe: 通过可执行的安全逻辑保障具身智能体

Le Wang, Zonghao Ying, Xiao Yang, Quanchen Zou, Zhenfei Yin, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) AI Security Lab(360AI安全实验室) The University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 RoboSafe通过可执行的安全逻辑保障具身智能体,减少危险行为并保持任务性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 27 篇

2512.21902 2025-12-29 cs.CL 89%

Explainable Statute Prediction via Attention-based Model and LLM Prompting

基于注意力模型和大语言模型提示的可解释法规预测

Sachin Pawar, Girish Keshav Palshikar, Anindita Sinha Banerjee, Nitin Ramrakhiyani, Basit Ali

机构 * TCS Research(TCS研究)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于注意力模型和大语言模型提示的法规预测方法,通过生成可解释的预测结果提升法律AI系统的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21837 2025-12-29 cs.CL 89%

Knowledge Reasoning of Large Language Models Integrating Graph-Structured Information for Pest and Disease Control in Tobacco

基于图结构信息的大型语言模型知识推理用于烟草害虫和疾病控制

Siyu Li, Chenwei Song, Wan Zhou, Xinyi Liu

机构 * School of Information Science and Engineering(信息科学与工程学院) Chongqing Jiaotong University(重庆交通大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出一种整合图结构信息的大型语言模型,用于提升烟草害虫和疾病控制的知识推理能力,通过构建领域知识图并结合图神经网络实现更准确的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18033 2025-12-29 cs.RO cs.AI 88%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏