arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2607.09665 2026-07-14 cs.AI cs.CL cs.LG 新提交 78%

Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking

格式敏感性指数:大语言模型基准测试中令牌控制的提示包装器稳健性与模式合规性

Deep Pankajbhai Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提示包装器格式差异对模型分数的影响,引入格式敏感性指数(FSI)和可解析性敏感性指数(PSI),通过大量实验发现平均FSI在不同模型间变化超30倍,且可解析性是准确性有力预测指标,指出不考虑包装器差异和合规性报告准确性不可靠并给出建议。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08968 2026-07-13 eess.SP 新提交 78%

Every Sample Counts: Supervised Fine-Tuning of Language Models with Pointwise Constraints

每个样本都很重要:基于逐点约束的语言模型监督微调

Ignacio Hounie, Ignacio Boero, Alejandro Ribeiro

专题命中 指令微调 :language model(title,abstract)

AI总结 研究语言模型微调中逐点约束问题,提出新对齐框架,通过逐样本约束最小化平均损失,引入学习松弛方法并开发增广拉格朗日方法,在多任务和约束下实例化,减少约束违反且保留模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09577 2026-07-13 stat.ME stat.ML 新提交 78%

A censoring-aware target interface for tabular foundation models in survival prediction

生存预测中用于表格基础模型的删失感知目标接口

Yue Lyu, Steven H. Lin, Xuelin Huang, Ziyi Li

专题命中 指令微调 :foundation model(title,abstract)

AI总结 研究针对表格患者数据事件发生时间预测中右删失问题,提出SurvFM-RMST框架,将生存结果转换为伪观察目标用于RMST回归,在模拟和多数据集测试中表现良好,支持其作为删失生存数据与表格基础模型预测的接口。

Comments 33 pages, 5 figures. Supplementary Information included as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07403 2026-07-09 cs.MA cs.RO 新提交 78%

Multi-Agent Robotic Control with Onboard Vision-Language Models

基于机载视觉语言模型的多智能体机器人控制

Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 研究针对视觉语言模型用于机器人控制的挑战,提出多智能体系统架构,在机载硬件部署智能体,用紧凑型VLMs并经微调及新型编排智能体,经硬件在环模拟验证,证明该机载架构可行高效,有实际应用潜力且模拟环境已开源。

Comments 6 pages, 2 figures, accepted to 24th International Conference on Practical applications of Agents and Multi-Agent Systems (PAAMS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06185 2026-07-08 cs.CV 新提交 78%

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

用于细粒度图像识别的视觉语言模型中的结构化压缩提示调优

Xinda Liu, Qinyu Zhang, Weiqing Min, Guohua Geng, Shuqiang Jiang

机构 * School of Information Science and Technology, Northwest University(西北大学信息科学与技术学院) Laboratory of Intelligent Information Processing, Institute of Computing Technology(中国科学院计算技术研究所智能信息处理重点实验室)

专题命中 指令微调 :language model(title,abstract)

AI总结 针对细粒度图像识别中视觉语言模型捕捉细微差别能力有限的问题,提出结构化压缩提示调优(SCPT),通过语义关系编码和语义压缩损失增强语义结构建模,在多基准实验中有效减轻语义模糊性,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05655 2026-07-08 cs.HC 新提交 78%

GeoXplain: On-the-Fly Visual Explanations for Weather Foundation Models

GeoXplain:天气基础模型的实时可视化解释

Clemens Walter Koprolin, Leonardo Trentini, Benedikt Soja, Mennatallah El-Assady, Christina Humer

专题命中 指令微调 :foundation model(title,abstract)

AI总结 研究天气和气候基础模型预测关系难察问题,提出GeoXplain交互式可视化工具包及Aurora Adapter计算后端,支持多种解释方法,可在笔记本或浏览器呈现地理空间归因图,方便探索,代码开源可安装。

Comments 9 pages, 6 figures. Submitted to VISxClimate at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05582 2026-07-08 cs.IR 新提交 78%

Prompting Beats Fine-Tuning: Generative Expected Value Scoring for Statutory Term Retrieval

提示优于微调:用于法定术语检索的生成期望值评分

Alvin Wang, Jaromir Savelka

专题命中 指令微调 :prompting(title,abstract)

AI总结 研究法规中模糊法律概念检索任务,比较仅编码器模型微调与仅解码器模型零样本提示两类方法,发现提示仅解码器模型总体效果最佳,最佳系统超越此前所有最先进结果。

Comments Accepted to the ASAIL Workshop at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 78%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 指令微调 :language model(title,abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02711 2026-07-07 cs.CV 新提交 78%

RayTun3R: Online Camera Adaptation in 3D Foundation Models

RayTun3R:3D基础模型中的在线相机适配

Daniil Sinitsyn, Nikita Araslanov, Daniel Cremers

机构 * TU Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 研究3D基础模型在鱼眼相机下表现不佳的问题,提出RayTun3R方法,通过学习参数高效的残差校正等,在保持预训练网络不变的情况下适配相机,减少旋转误差且参数少、无需多视图推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24182 2026-07-07 cs.RO 版本更新 78%

$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills

$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力

Siyao Xiao, Yuhong Zhang, Zhifang Liu, Zihan Gao, Jingye Zhang, Sinwai Choo, Dake Zhong, Mengzhe Wang, Xiao Lin, Xianfeng Zhou, Jia Jia, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) Synapath

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12116 2026-07-07 cs.LG cs.AI cs.CL 版本更新 78%

DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections

DynamixSFT:指令微调集合的动态混合优化

Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Hyunwoo Yoo, Qi Chen, Yeyun Gong

机构 * University of Michigan(密歇根大学) Microsoft Research(微软研究院) KAIST AI(韩国科学技术院人工智能研究所) Drexel University(德雷塞尔大学)

专题命中 指令微调 :instruction tuning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对不断涌现的指令微调数据集,提出DynamixSFT动态自动优化方法。将问题转化为多臂老虎机设置,采用Prior-scaled Boltzmann Exploration和1-Step Look-ahead Reward更新采样概率,有效优化数据集并减少计算开销。

Comments ACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 39590-39603

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02025 2026-07-03 cs.CV 新提交 78%

Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition

评估视觉语言模型作为尼日利亚车牌识别的零样本学习替代方案:对比YOLO与光学字符识别

Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu

专题命中 指令微调 :language model(title,abstract)

AI总结 研究探索视觉语言模型作为尼日利亚车牌识别的统一零样本解决方案,在88张真实图像上评估5种VLM,发现Gemini和Qwen在字符错误率上显著优于YOLO+OCR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01908 2026-07-03 cs.CV 新提交 78%

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

迈向真实世界超声理解:基于多图像检查与长文本报告的大规模视觉语言模型

Bingcong Yan, Chunlei Li, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI科技(无锡)有限公司) Technical University of Munich(慕尼黑工业大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 通过构建150万次真实超声检查的大规模数据集(含1770万图像和多器官覆盖),采用标准视觉语言模型结合低秩适配微调,无需复杂架构即实现多任务超声理解性能领先。

Comments Project Page: https://medai-t.github.io/LUMI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01079 2026-07-02 cs.RO 新提交 78%

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位

Suraj Borate, Aarav Shah, Madhu Vadali

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)

专题命中 指令微调 :language model(title,abstract)

AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17916 2026-06-26 cs.CV 版本更新 78%

EndoUFM: Utilizing Foundation Models for Monocular depth estimation of endoscopic images

EndoUFM:利用基础模型进行内窥镜图像的单目深度估计

Xinning Yao, Bo Liu, Bojian Li, Jingjing Wang, Jinghua Yue, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20553 2026-06-19 cs.CR 新提交 78%

From Efficiency to Leakage -- Privacy Backdoor in Federated Language Model Fine-Tuning

从效率到泄露——联邦语言模型微调中的隐私后门

Shanghao Shi, Chaoyu Zhang, Heng Jin, Yang Xiao, Yevgeniy Vorobeychik, William Yeoh, Ning Zhang, Y. Thomas Hou, Wenjing Lou

专题命中 指令微调 :language model(title,abstract)

AI总结 提出NeuroImprint攻击,恶意参数服务器在参数高效微调中植入隐私后门,通过为每个样本分配独立神经元并限制单次更新,实现高保真重建训练文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17229 2026-06-17 cs.LG cs.AI cs.CL 新提交 78%

Rift: A Conflict Signature for Deception in Language Models

Rift: 语言模型中欺骗行为的冲突特征

Petr Nyoma

机构 * Harmonic Labs

专题命中 指令微调 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过对比知情欺骗与无知错误,发现欺骗性前向传递具有高残差秩的冲突特征,能以100%准确率无标签识别谎言,并跨模型、语言和架构迁移。

Comments 13 pages, 4 figures. Code and experiment logs: https://github.com/Omibranch/Rift

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00591 2026-06-16 cs.CV 版本更新 78%

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

视觉语言模型中标签噪声提示调优的内在梯度抑制

Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 提出双Softmax提示调优(DSPT),通过内在梯度抑制机制自适应压制高错误噪声样本的梯度,实现标签噪声下的鲁棒提示调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12586 2026-06-12 cs.CR 新提交 78%

Beyond Attack Success Rate: Examining Trigger Leakage in Vision-Language Agentic Systems

超越攻击成功率:视觉-语言智能系统中的触发器泄漏研究

Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

专题命中 指令微调 :language agent(title,abstract)

AI总结 本文提出“触发器泄漏”概念,量化视觉-语言智能系统中后门触发器在视觉或语义相近输入下意外激活隐藏行为的风险,并引入邻域泄漏率(NLR)指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09966 2026-06-10 cs.SD 新提交 78%

RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

RespiraMFM:一种用于呼吸道疾病识别的对比音频-语言对齐多模态基础模型

Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang, Shrikanth Narayanan, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Southern California(南加州大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 提出RespiraMFM多模态基础模型,通过对比音频-文本对齐策略整合呼吸音与临床信息,在监督和零样本任务中分别提升AUROC 9.15%和20.98%。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06239 2026-06-05 eess.SP 78%

Foundation Models for Wireless Communications: From PHY Intelligence to Network Autonomy

无线通信的基础模型:从物理层智能到网络自治

Le Liang, Jiajia Guo, Jun Zhang, Chan-Byoung Chae, Lu Lu, Shugong Xu, Octavia A. Dobre, Shi Jin, Geoffrey Ye Li

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文综述了基础模型在无线通信中的应用,从适配预训练模型、构建无线原生模型到智能体模型,推动物理层处理和资源管理向网络自治演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05852 2026-06-03 cs.CV 78%

Interpretable Modeling of Driver Attention Shifts with a Vision-Language Model

基于视觉-语言模型的驾驶员注意力转移可解释建模

Kaiser Hamid, Khandakar Ashrafi Akbar, Peihang Li, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Towson University(托森大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本研究通过少量人工监督微调视觉-语言模型,生成可解释的驾驶员注意力转移描述,以补充传统注视热图,提升人因分析、监控和态势感知支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29969 2026-05-29 cond-mat.mtrl-sci cond-mat.dis-nn 78%

Prototype-Guided Latent Alignment for Data-Efficient Fine-Tuning of Molecular Foundation Models

原型引导的潜在对齐用于分子基础模型的数据高效微调

Rushikesh Pawar, Harshit Rawat, Ayush Kumar, Phani Motamarri

专题命中 指令微调 :foundation model(title,abstract)

AI总结 提出基于原型的对齐方法,通过将目标域原子的能量贡献对齐到源域原型,实现分子基础模型在低数据下的高效微调,在rMD17和SPICE数据集上能量MAE降低高达18%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27893 2026-05-28 cs.CV 78%

SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation

SIGMA:弥合视觉基础模型适应的结构与分布差距

Lingyu Xiong, Jinjin Shi, Xuran Xu, Cong Luo, Runyu Shi, Ying Huang

机构 * Xiaomi Corporation(小米公司)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 提出SIGMA方法,通过尺度自适应融合和语义调制模块,以1.72%可训练参数实现视觉基础模型在密集预测任务上的高效微调,性能优于现有PEFT方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10095 2026-05-27 cs.CV 78%

Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models

挖掘属性子空间以实现3D基础模型的高效微调

Yu Jiang, Hanwen Jiang, Ahmed Abdelkader, Wen-Sheng Chu, Brandon Y. Feng, Zhangyang Wang, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Adobe Research(Adobe研究) Google Research(谷歌研究)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文通过生成合成数据并提取与纹理、几何、相机运动和光照变化相关的LoRA子空间,发现这些子空间近似解耦,集成后形成降维子空间,从而提高下游任务微调的效率和预测精度。

Comments 10 pages, 8 figures. Code here: https://github.com/jpppppppppppppppppppppppp/Subspaces-Mining-for-VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25495 2026-05-26 cs.RO cs.CV 78%

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation

RepSAM: 通过表示引导的适应连接基础模型与机器人视觉

Wenhui Chu

机构 * Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学阿马尔科分校)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 针对基础模型在非结构化机器人视觉场景中性能下降的问题,提出RepSAM框架,通过CKA引导的秩分配策略和多模态融合模块实现参数高效微调,在减少158倍可训练参数的同时达到全微调97.9%的性能。

Comments Accepted to IJCAI-ECAI 2026 (Special Track on AI and Robotics). 8 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25479 2026-05-26 cs.CV 78%

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

MAIL++: 视觉语言模型的多模态双向智能体层

Kaixiang Chen, Pengfei Fang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国)

专题命中 指令微调 :language model(title,abstract)

AI总结 提出MAIL/MAIL++方法,通过将跨模态耦合嵌入VLM内在计算模块并引入双向桥接,实现参数高效微调,在少样本分类和跨域检索中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22607 2026-05-22 cs.CV 78%

Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following

增强视觉基础模型中的眼动推理以实现眼动跟随

Shijing Wang, Yaping Huang, Chaoqun Cui, David Wong, Yihua Cheng, Alexandros Neophytou, Hyung Jin Chang

机构 * Beijing Jiaotong University(北京交通大学) University of Birmingham(英国伯明翰大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Microsoft, UK(微软公司(英国))

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出了一种新的训练机制,通过局部LoRA和锥外惩罚来增强视觉基础模型中的眼动推理,以提升眼动跟随任务的性能,特别是在目标不显著时表现更优。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19956 2026-05-20 cs.CV 78%

Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models

迈向细粒度鲁棒性:面向视觉-语言模型的注意力引导测试时提示调优

Jia-Wei Hai, Yijun Wang, Xiu-Shen Wei

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications(新一代人工智能技术及其交叉应用重点实验室) Southeast University(东南大学) School of Intelligence Science and Engineering(智能科学与工程学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出了一种注意力引导的测试时提示调优方法(A-TPT),旨在解决视觉-语言模型在对抗攻击下的鲁棒性问题,通过改进的梯度注意力机制和空间变化的增强强度来提升模型在细粒度场景下的表现。

Comments Accepted by ICML 2026, Project Page: this https, URL Code URL: this https URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19690 2026-05-20 cs.RO 78%

D-CLING: Prior-Preserving Depth-Conditioned Fine-Tuning for Navigation Foundation Models

D-CLING: 保留先验知识的深度条件细调方法用于导航基础模型

Shintaro Nakaoka, Takayuki Kanai, Kazuhito Tanaka

机构 * Frontier Research Center, Toyota Motor Corporation(丰田电机公司前沿研究中心)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出了一种新的细调方法,通过利用大规模预训练同时高效学习新环境或相机配置等新设置,从而在保留预训练知识的同时提升导航模型的鲁棒性和准确性。

Comments This paper has been accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026), which will be held in Vienna, Austria, from June 1 to 5, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏