arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-15 至 2026-01-15 共收录 173 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2601.09066 2026-01-15 cs.CL cs.AI 86%

Mi:dm 2.0 Korea-centric Bilingual Language Models

Mi:dm 2.0 韩国中心双语语言模型

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

机构 * Tech. Innovation Group(技术创新组)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 Mi:dm 2.0是一款专为韩国中心AI设计的双语大语言模型,通过整合韩国社会价值观和常识知识,提升文化适应性和生成能力,支持多任务和多场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09039 2026-01-15 cs.IT math.IT 85%

An Information-Theoretic Perspective on LLM Tokenizers

从信息论角度审视大语言模型分词器

Mete Erdogan, Abhiram Gorle, Shubham Chandak, Mert Pilanci, Tsachy Weissman

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 从信息论角度研究大语言模型分词器,揭示分词训练规模对熵分布的影响,提出压缩感知BPE变种,并分析分词器在不同领域下的鲁棒性与压缩效率的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13433 2026-01-15 cs.SD eess.AS 85%

MATS: An Audio Language Model under Text-only Supervision

MATS: 一种基于纯文本监督的音频语言模型

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 MATS通过纯文本监督训练,实现音频理解能力,无需依赖音频数据,展现出与大规模音频-语言对训练模型相当的性能。

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08840 2026-01-15 cs.CL cs.AI 84%

Consistency-Aware Editing for Entity-level Unlearning in Language Models

面向实体级去学习的一致性感知编辑

Xiaoqi Han, Víctor Gutiérrez-Basulto, Ru Li, Xiaoli Li, Jiye Liang, Jeff Z. Pan

机构 * Shanxi University, China(山西大学) Cardiff University, UK(卡地夫大学) Singapore University of Technology and Design, Singapore(新加坡科技设计大学) ILCC, School of Informatics, University of Edinburgh, Edinburgh, UK(爱丁堡大学信息学院ILCC)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一致性感知编辑框架,用于高效实体级去学习,通过聚合多样化提示并学习低秩更新,提升遗忘准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00040 2026-01-15 cs.CV cs.AI 83%

Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models

揭示内在能力:一种用于视觉-语言模型数据整理的范式

Junjie Li, Ziao Wang, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist大学) City University of Hong Kong, China(香港城市大学)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);分类 cs.AI

AI总结 CADC通过揭示视觉-语言模型的内在能力,提供了一种基于能力分析的数据整理范式,以提升指令微调的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03646 2026-01-15 cs.LG cs.NI 83%

Lens: A Knowledge-Guided Foundation Model for Network Traffic

Lens: 一种基于知识的网络流量基础模型

Xiaochang Li, Chen Qian, Qineng Wang, Jiangtao Kong, Yuchen Wang, Ziyu Yao, Bo Ji, Long Cheng, Gang Zhou, Huajie Shao

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Lens提出了一种基于知识的网络流量基础模型,通过知识引导的预训练和上下文感知微调,在分类和生成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16148 2026-01-15 cs.CV 78%

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

频率才是关键:在文本遮蔽时考虑词频有助于视觉-语言模型预训练

Mingliang Liang, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所) Radboud University(拉德堡德大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出CLIPF方法,通过考虑词频提升视觉-语言模型预训练效果,实验显示其在减少输入token时表现更优。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09119 2026-01-15 cs.CL econ.GN q-fin.EC 77%

Contrastive Bi-Encoder Models for Multi-Label Skill Extraction: Enhancing ESCO Ontology Matching with BERT and Attention Mechanisms

基于对比的双编码模型用于多标签技能提取:利用BERT和注意力机制增强ESCO本体匹配

Yongming Sun

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于BERT和注意力机制的对比双编码模型,用于多标签技能提取,提升ESCO本体匹配的零样本检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05699 2026-01-15 cs.CL 77%

Afri-MCQA: Multimodal Cultural Question Answering for African Languages

Afri-MCQA:面向非洲语言的多模态文化问答

Atnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin A. Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio

机构 * MBZUAI AI4Bharat Indian Institute of Technology, Madras(印度理工学院马德拉斯分校) Saarland University(萨尔兰大学) Aston University(阿斯顿大学) Addis Ababa University(亚的斯亚贝巴大学) Lesan AI Friedrich-Alexander University(弗里德里希-亚历山大大学) University of Pretoria(比勒陀利亚大学) University of Minneosta -Twin Cities(明尼苏达大学-双城分校) Lelapa AI Tshwane University of Technology(茨瓦内技术大学) Digital Umuganda University of Botswana(博茨瓦纳大学) Mila, McGill University & Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 Afri-MCQA是首个针对非洲语言的多模态文化问答基准,揭示了本地语言在语音和文本任务中与英语的显著性能差距,强调了文化扎根预训练和跨语言文化转移的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21324 2026-01-15 cs.CL cs.AI cs.LG 75%

Mathematical Derivation Graphs: A Relation Extraction Task in STEM Manuscripts

数学推导图:STEM论文中的关系提取任务

Vishesh Prasad, Brian Kim, Nickvash Kani

机构 * Electrical and Computer Engineering University of Illinois at Urbana-Champaign(电气与计算机工程学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数学推导图数据集,旨在通过关系提取任务分析STEM论文中数学表达式间的依赖关系,并评估不同模型的识别能力。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09130 2026-01-15 eess.IV cs.AI cs.CV 70%

Equi-ViT: Rotational Equivariant Vision Transformer for Robust Histopathology Analysis

Equi-ViT:用于鲁棒病理学分析的旋转等变视觉变换器

Fuyao Chen, Yuexi Du, Elèonore V. Lieffrig, Nicha C. Dvornek, John A. Onofrey

机构 * Yale University(耶鲁大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 Equi-ViT通过引入等变卷积核提升ViT在病理学图像中的旋转鲁棒性和数据效率。

Comments Accepted by IEEE ISBI 2026 4-page paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03727 2026-01-15 cs.CL 70%

Stuttering-Aware Automatic Speech Recognition for Indonesian Language

针对印尼语的 stuttering 意识自动语音识别

Fadhil Muhammad, Alwin Djuliansah, Adrian Aryaputra Hamzah, Kurniawati Azizah

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种针对印尼语口吃语音识别的数据增强方法,通过合成数据提升模型对不流畅语音的识别性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09661 2026-01-15 cs.CV 67%

LiteEmbed: Adapting CLIP to Rare Classes

LiteEmbed: 适应CLIP的稀有类别

Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi

机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad, India(印度海得拉巴IIIT大学计算机视觉研究所、Kohli智能系统中心) Adobe Research, Bengaluru, India(印度班加罗尔Adobe研究)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 LiteEmbed通过子空间优化和双目标方法,实现CLIP在稀有类别上的少样本个性化,提升分类和检索任务的性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14037 2026-01-15 cs.CL cs.AI cs.LG 67%

DiffSampling: Enhancing Diversity and Accuracy in Neural Text Generation

DiffSampling:提升神经文本生成的多样性和准确性

Giorgio Franceschelli, Mirco Musolesi

机构 * Alma Mater Studiorum Università di Bologna(博洛尼亚大学) University College London(伦敦大学学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiffSampling通过分析令牌概率分布,提升神经文本生成的多样性和准确性,实验表明其在质量上与现有方法相当。

Comments Published in Transactions on Machine Learning Research (2025), see https://tmlr.infinite-conf.org/paper_pages/kXjHbMvdIi.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15801 2026-01-15 cs.CL cs.AI cs.HC cs.LG 67%

LingVarBench: Benchmarking LLMs on Entity Recognitions and Linguistic Verbalization Patterns in Phone-Call Transcripts

LingVarBench:在电话通话记录中对LLM进行实体识别和语言表达模式的基准测试

Seyedali Mohammadi, Manas Paldhe, Amit Chhabra, Youngseo Son, Vishal Seshagiri

机构 * Infinitus Systems, Inc.(Infinitus系统公司)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LingVarBench通过生成语言变化的训练数据,提升LLM在电话记录中提取结构化实体和主观问卷项目的能力,优化提示工程并提高鲁棒性。

Comments Accepted to EACL 2026 (Industry Track); to appear in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05966 2026-01-15 cs.CV cs.AI 57%

VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction

VideoAR: 通过下一帧与尺度预测实现自回归视频生成

Longbin Ji, Xiaoxiong Liu, Junyuan Shang, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 VideoAR通过多尺度下一帧预测与自回归建模,实现高效、一致的视频生成,提升性能并减少计算成本。

Comments Project page: https://ernie-research.github.io/VideoAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16233 2026-01-15 astro-ph.GA cs.LG 57%

Can AI Dream of Unseen Galaxies? Conditional Diffusion Model for Galaxy Morphology Augmentation

AI能否梦见未见的星系?面向星系形态增强的条件扩散模型

Chenrui Ma, Zechang Sun, Tao Jing, Zheng Cai, Yuan-Sen Ting, Song Huang, Mingyu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen China(清华大学深圳国际研究生院,清华大学,深圳中国) Department of Strategic and Advanced Interdisciplinary Research, Pengcheng Laboratory, Shenzhen China(战略与先进跨学科研究部,鹏城实验室,深圳中国) Department of Astronomy, Tsinghua University, Beijing China(天文学系,清华大学,北京中国) School of Mathematics and Physics, Qinghai University, Xining China(数学物理学院,青海大学,西宁中国) Department of Astronomy, The Ohio State University, Columbus, OH 43210, USA(天文学系,俄亥俄州立大学,哥伦布,OH 43210,美国) Center for Cosmology and AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA(宇宙学与天体粒子物理中心(CCAPP),俄亥俄州立大学,哥伦布,OH 43210,美国)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本研究提出条件扩散模型GalaxySD,通过合成逼真的星系图像增强ML训练数据,提升标准形态分类性能,并有效提高罕见星系检测的实例数量。

Comments 29 pages, 17 figures, accepted version for ApJS. Comments welcome. See another independent work for further reference, Category-based Galaxy Image Generation via Diffusion Models (Fan, Tang et al.)

Journal ref The Astrophysical Journal Supplement Series, 282, 25 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09216 2026-01-15 cs.DB 50%

Honesty-Aware Multi-Agent Framework for High-Fidelity Synthetic Data Generation in Digital Psychiatric Intake Doctor-Patient Interactions

面向数字精神科问诊医生-患者交互的诚实意识多智能体框架:高保真合成数据生成

Xinyuan Zhang, Zijian Wang, Chang Dao, Juexiao Zhou

专题命中 预训练与数据 :LLM(abstract)

AI总结 本研究提出一种多智能体框架,通过建模患者欺骗行为生成高保真合成数据,用于研究精神科评估中的诚实意识及训练适应性对话代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08587 2026-01-15 cs.CV 50%

MoCha:End-to-End Video Character Replacement without Structural Guidance

MoCha:端到端视频人物替换无需结构引导

Zhengbo Xu, Jie Ma, Ziheng Wang, Zhan Peng, Jun Liang, Jing Li

专题命中 预训练与数据 :post-training(abstract)

AI总结 MoCha提出了一种无需结构引导的端到端视频人物替换方法,通过单帧掩码实现高效替换,并设计了三种数据集以克服数据稀缺问题。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2601.09035 2026-01-15 cs.CR cs.AI 88%

A Decompilation-Driven Framework for Malware Detection with Large Language Models

基于大语言模型的反恶意软件检测解编驱动框架

Aniesh Chawla, Udbhav Prasad

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的反恶意软件检测框架,通过解编和微调提升恶意软件检测效果,但需持续更新以应对新型威胁。

Comments 6 pages, published in 2025 IEMCON

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06475 2026-01-15 cs.CL 85%

HapticLLaMA: A Multimodal Sensory Language Model for Haptic Captioning

HapticLLaMA:一种多模态感官语言模型用于触觉描述

Guimin Hu, Daniel Hershcovich, Hasti Seifi

机构 * University of Copenhagen(哥本哈根大学) Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 HapticLLaMA是一种多模态感官语言模型,通过触觉信号生成描述,利用两种分词器和强化学习提升触觉感知描述能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09654 2026-01-15 cs.LG 83%

Exploring Fine-Tuning for Tabular Foundation Models

探索表格基础模型的微调

Aditya Tanna, Pratinav Seth, Mohamed Bouadi, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract);分类 cs.LG

AI总结 本文研究了表格基础模型在不同数据集上的微调效果,发现零样本性能已较强,而微调效果依赖于模型和数据特性,提出了基于不同方法的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09116 2026-01-15 cs.CV cs.AI 79%

LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models

LP-LLM:基于大多模态模型的端到端真实世界退化车牌文本识别

Haoyan Gong, Hongbin Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 指令微调 :LLM(title);language model(abstract);分类 cs.AI

AI总结 LP-LLM通过端到端结构感知多模态推理框架,结合字符感知模块和LoRA微调策略,提升真实世界退化车牌文本识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01741 2026-01-15 cs.CV 78%

Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models

模拟集成攻击:在微调视觉-语言模型之间转移劫持

Ruofan Wang, Xin Wang, Yang Yao, Juncheng Li, Xuan Tong, Xingjun Ma

机构 * Fudan University, Shanghai, China(复旦大学) The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出SEA框架,通过模拟微调过程中的参数变化,实现跨不同微调变体的高效劫持攻击,揭示了微调导致的局部参数位移对攻击有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09185 2026-01-15 cs.CL 77%

OrthoGeoLoRA: Geometric Parameter-Efficient Fine-Tuning for Structured Social Science Concept Retrieval on theWeb

OrthoGeoLoRA:用于Web上结构化社会科学概念检索的几何参数高效微调

Zeqiang Wang, Xinyue Wu, Chenxi Li, Zixi Chen, Nishanth Sastry, Jon Johnson, Suparna De

机构 * University of Surrey(萨里大学) Washington State University(华盛顿州立大学) University of Oxford(牛津大学) New York University Shanghai(纽约大学上海分校) University College London(伦敦大学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 OrthoGeoLoRA通过几何约束改进低秩适应,实现更高效的参数微调,提升社会科学概念检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09684 2026-01-15 cs.LG cs.AI cs.CL 75%

Disentangling Task Conflicts in Multi-Task LoRA via Orthogonal Gradient Projection

通过正交梯度投影解耦多任务LoRA中的任务冲突

Ziyu Yang, Guibin Chen, Yuxin Yang, Aoxiong Zeng, Xiangquan Yang

机构 * Shanghai University(上海大学) East China Normal University(东华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Ortho-LoRA通过正交梯度投影方法有效缓解多任务LoRA中的任务冲突问题,提升模型性能并减少计算开销。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10337 2026-01-15 cs.AI cs.LG 73%

A Curriculum Learning Approach to Reinforcement Learning: Leveraging RAG for Multimodal Question Answering

一种基于RAG的强化学习课程学习方法:用于多模态问答

Chenliang Zhang, Lin Wang, Yuanyuan Lu, Yusheng Qi, Kexin Wang, Peixu Hou, Wenshi Chen

机构 * Meituan(美团)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合课程学习与强化学习的方法,用于多模态问答任务,通过检索增强生成系统在挑战中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03731 2026-01-15 cs.LG cs.CL 73%

Optimizing Fine-Tuning through Advanced Initialization Strategies for Low-Rank Adaptation

通过先进的初始化策略优化低秩适应的微调

Yongfu Xue

机构 * Tongji University(同济大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 IniLoRA通过优化低秩矩阵初始化策略,提升大型语言模型微调效果,优于LoRA并在多种任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19789 2026-01-15 cs.LG 70%

What Can RL Bring to VLA Generalization? An Empirical Study

RL能为VLA泛化带来什么?一项实证研究

Jijia Liu, Feng Gao, Bingwen Wei, Xinlei Chen, Qingmin Liao, Yi Wu, Chao Yu, Yu Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.LG

AI总结 本研究通过实证分析发现,PPO在提升VLA的语义理解和执行鲁棒性方面优于SFT,同时保持视觉鲁棒性,为VLA泛化提供了有效的方法。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17218 2026-01-15 cs.CV 67%

Prototypical Contrastive Learning-based CLIP Fine-tuning for Object Re-identification

基于原型对比学习的CLIP微调用于物体重识别

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University, China(信息科学与电子工程学院,浙江大学)

专题命中 指令微调 :language model(abstract);pretraining(abstract)

AI总结 本文提出基于原型对比学习的CLIP微调方法,用于提升物体重识别性能,无需提示学习并实现优于CLIP-ReID的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏