arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-24 至 2026-02-24 共收录 36 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 36 篇

2502.05795 2026-02-24 cs.LG cs.AI 90%

The Curse of Depth in Large Language Models

深度在大语言模型中的诅咒

Wenfang Sun, Xinyuan Song, Pengxiang Li, Lu Yin, Yefeng Zheng, Shiwei Liu

机构 * Westlake University(西湖大学) Emory University(埃默里大学) Dalian University of Technology(大连理工大学) University of Surrey(萨里大学) University of Oxford(牛津大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LayerNorm Scaling方法,通过缩放输出方差缓解深度诅咒,提升大语言模型的预训练和微调性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19403 2026-02-24 cs.CL stat.AP 89%

Personalized Prediction of Perceived Message Effectiveness Using Large Language Model Based Digital Twins

基于大型语言模型的数字孪生个性化预测感知信息有效性

Jasmin Han, Janardan Devkota, Joseph Waring, Amanda Luken, Felix Naughton, Roger Vilardaga, Jonathan Bricker, Carl Latkin, Meghan Moran, Yiqun Chen, Johannes Thrul

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究利用LLM基于数字孪生方法提升戒烟信息个性化预测效果,实现更精准的mHealth干预内容定制。

Comments 31 pages, 5 figures, submitted to Journal of the American Medical Informatics Association (JAMIA). Drs. Chen and Thrul share last authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18721 2026-02-24 cs.CL eess.AS 89%

ReHear: Iterative Pseudo-Label Refinement for Semi-Supervised Speech Recognition via Audio Large Language Models

ReHear:基于音频大语言模型的迭代伪标签细化方法用于半监督语音识别

Zefang Liu, Chenyang Zhu, Sangwoo Cho, Shi-Xiong Zhang

机构 * Capital One, USA(Capital One公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 ReHear通过整合音频感知大语言模型实现伪标签迭代细化,有效缓解半监督语音识别中的误差传播问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03817 2026-02-24 cs.LG stat.ML 88%

TROLL: Trust Regions improve Reinforcement Learning for Large Language Models

TROLL:通过信任区域改进大型语言模型的强化学习

Philipp Becker, Niklas Freymuth, Serge Thilges, Fabian Otto, Gerhard Neumann

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 TROLL通过引入基于信任区域的离散可微投影,改进了大型语言模型的强化学习训练,提升了训练速度、稳定性和最终成功率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19505 2026-02-24 cs.CV 88%

Test-Time Computing for Referring Multimodal Large Language Models

测试时计算用于指代多模态大语言模型

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) Tsinghua University(清华大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。

Comments arXiv admin note: substantial text overlap with arXiv:2407.21534

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18966 2026-02-24 cs.CL 85%

Whisper: Courtside Edition Enhancing ASR Performance Through LLM-Driven Context Generation

Whisper:球场版通过LLM驱动的上下文生成提升ASR性能

Yonathan Ron, Shiri Gilboa, Tammuz Dubnov

机构 * Reichman University(里奇曼大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Whisper:球场版通过LLM驱动的上下文生成提升ASR性能,实现17%的词错误率降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19111 2026-02-24 cs.CL 84%

Astra: Activation-Space Tail-Eigenvector Low-Rank Adaptation of Large Language Models

Astra: 大语言模型激活空间尾特征值低秩适应

Kainan Liu, Yong Zhang, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL

AI总结 Astra通过利用模型输出激活的尾特征向量构建低秩适配器,实现了更高效的参数高效微调,提升了下游任务性能。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17052 2026-02-24 cs.AI 84%

ViLBias: Detecting and Reasoning about Bias in Multimodal Content

ViLBias:检测和推理解多模态内容中的偏见

Shaina Raza, Caesar Saleh, Azib Farooq, Emrul Hasan, Franklin Ogidi, Haad Zahid, Maximus Powers, Marcelo Lotif, Anam Zahid, Karanpal Sekhon, Veronica Chatrath, Roya Javedi, Vahid Reza Khazaie, Zhenyu Yu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 ViLBias通过多模态基准检测新闻中的偏见,利用LLM和VLMs提升推理准确率和忠实度,参数高效方法能恢复大部分微调性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17842 2026-02-24 cs.CL 81%

Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning

Shop-R1: 通过强化学习奖励大语言模型模拟在线购物中的人类行为

Yimeng Zhang, Tian Wang, Jiri Gesi, Ziyi Wang, Yuxuan Lu, Jiacheng Lin, Sinong Zhan, Vianne Gao, Ruochen Jiao, Junze Liu, Kun Qian, Yuxin Tang, Ran Xue, Houyu Zhang, Qingjun Cui, Yufan Guo, Dakuo Wang

机构 * Michigan State University(密歇根州立大学) Amazon(亚马逊) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Shop-R1通过强化学习框架提升大语言模型在在线购物场景中模拟人类行为的推理能力,实现65%以上的性能提升。

Comments Accepted by ICLR 2026. The project page is available at https://damon-demon.github.io/shop-r1.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04373 2026-02-24 cs.AI 81%

JEF-Hinter: Leveraging Offline Knowledge for Improving Web Agents Adaptation

利用离线知识提升网络代理适应性的JEF-Hinter

Hadi Nekoei, Aman Jaiswal, Patrice Bechard, Oleh Shliazhko, Orlando Marquez Ayala, Mathieu Reymond, Massimo Caccia, Alexandre Drouin, Sarath Chandar, Alexandre Lacoste

机构 * ServiceNow AI Research(ServiceNow AI研究机构) Chandar Research Lab(Chandar研究实验室) Mila -- Quebec AI Institute(魁北克人工智能研究院) Dalhousie University(达尔豪斯大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 JEF-Hinter通过提炼离线轨迹生成上下文感知提示,提升网络代理在陌生领域的适应能力,实验显示其优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23479 2026-02-24 cs.CV 80%

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22387 2026-02-24 cs.LG cs.AI cs.GT 79%

SpinGPT: A Large-Language-Model Approach to Playing Poker Correctly

SpinGPT:一种用于正确玩扑克的大型语言模型方法

Narada Maugin, Tristan Cazenave

机构 * LAMSADE, Université Paris Dauphine - PSL, CNRS, Paris, France(LAMSADE,巴黎政治经济大学-PSL,国家科学研究中心,法国)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SpinGPT是一种针对三人在线扑克格式Spin & Go量身定制的大型语言模型,通过监督微调和强化学习在扑克比赛中表现出色。

Comments Accepted at Advances in Computer Games (ACG) 2025, LNCS (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19024 2026-02-24 cs.CV 78%

Towards Calibrating Prompt Tuning of Vision-Language Models

面向视觉-语言模型提示微调的校准

Ashshak Sharifdeen, Fahad Shamshad, Muhammad Akhtar Munir, Abhishek Basu, Mohamed Insaf Ismithdeen, Jeyapriyan Jeyamohan, Chathurika Sewwandi Silva, Karthik Nandakumar, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(Mohamed bin Zayed人工智能大学) University of Colombo(科伦坡大学) Michigan State University(密歇根州立大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出一种校准框架,通过引入均值-方差边际惩罚和文本矩匹配损失,提升视觉-语言模型提示微调的预测可靠性与置信度校准。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18766 2026-02-24 cs.CV 78%

Initialization matters in few-shot adaptation of vision-language models for histopathological image classification

初始化在视觉-语言模型少量样本适应中的重要性

Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech)(人类中心技术研究所) Universitat Politécnica de Valencia(巴塞罗那理工大学) Valencian Graduate School and Research Network for Artificial Intelligence (valgrAI)(瓦伦西亚人工智能研究生院和研究网络)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出ZS-MIL方法,通过利用视觉-语言模型的类级嵌入优化分类器初始化,提升少量样本场景下的病理图像分类性能。

Comments Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19041 2026-02-24 cs.LG 77%

Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning

回到Blackwell:在多目标偏好微调中闭合循环

Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MaxEntBW和PROSPER算法,解决多目标偏好微调中的非传递性问题,通过直接处理多目标提升LLM微调效果。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18633 2026-02-24 cs.CL 77%

DP-RFT: Learning to Generate Synthetic Text via Differentially Private Reinforcement Fine-Tuning

DP-RFT: 通过差分隐私强化微调学习生成合成文本

Fangyuan Xu, Sihao Chen, Zinan Lin, Taiwei Shi, Sydney Graham, Pei Zhou, Mengting Wan, Alex Stein, Virginia Estellers, Charles Chen, Morris Sharp, Richard Speyer, Tadas Baltrusaitis, Jennifer Neville, Eunsol Choi, Longqi Yang

机构 * New York University(纽约大学) Microsoft(微软) University of Southern California(南加州大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DP-RFT通过差分隐私强化微调方法,在不直接接触隐私数据的情况下生成高质量合成文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16789 2026-02-24 cs.CL cs.AI cs.LG 75%

Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguards

意外漏洞:影响微调的因子

Punya Syon Pandey, Samuel Simko, Kellin Pelrine, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) ETH Zürich(苏黎世联邦理工学院) FAR AI(FAR人工智能公司) McGill University(麦吉尔大学) MILA(蒙特利尔人工智能研究院) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究意外漏洞,揭示微调数据集特征对模型安全性和对抗鲁棒性的影响

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18915 2026-02-24 q-bio.QM cs.AI cs.CL cs.LG 75%

AAVGen: Precision Engineering of Adeno-associated Viral Capsids for Renal Selective Targeting

AAVGen:用于肾脏选择性靶向的腺相关病毒衣壳的精准工程

Mohammadreza Ghaffarzadeh-Esfahani, Yousof Gheisari

机构 * Regenerative Medicine Research Center Isfahan University of Medical Sciences(伊斯法罕医科大学再生医学研究中心) Department of Genetics and Molecular Biology Isfahan University of Medical Sciences(伊斯法罕医科大学遗传学与分子生物学系)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AAVGen通过生成式人工智能框架设计新型AAV衣壳,提升肾脏靶向性和生产效率,实现多目标优化。

Comments 22 pages, 6 figures, and 5 supplementary files. Corresponding author: ygheisari@med.mui.ac.ir, Kaggle notebook is available at https://www.kaggle.com/code/mohammadgh009/aavgen

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16985 2026-02-24 cs.CL cs.AI cs.LG 75%

Parameter-Efficient Fine-Tuning for Low-Resource Languages: A Comparative Study of LLMs for Bengali Hate Speech Detection

低资源语言参数高效微调:一种用于孟加拉语仇恨言论检测LLMs的比较研究

Akif Islam, Mohd Ruhul Ameen

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Rajshahi(拉贾沙希大学) College of Engineering and Computer Sciences(工程与计算机科学学院) Marshall University(马歇尔大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过参数高效微调方法,在孟加拉语仇恨言论检测中实现了高精度的F1分数,展示了低资源语言模型的有效性。

Comments Accepted to IEEE COMPAS 2025. 6 pages, 3 figures, 6 tables

Journal ref 2025 IEEE International Conference on Computing, Applications and Systems (COMPAS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12779 2026-02-24 cs.LG cs.AI 73%

Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation

可扩展的多目标与元强化学习通过梯度估计

Zhenshuo Zhang, Minxuan Duan, Youran Ye, Hongyang R. Zhang

专题命中 指令微调 :language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PolicyGradEx算法,通过梯度估计实现多目标强化学习的高效优化,实验表明其在机器人控制和Meta-World基准测试中优于现有方法,效率提升达26倍。

Comments 25 pages. Appeared in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27623 2026-02-24 cs.AI cs.CL cs.CV 73%

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

BEAT:通过对比触发学习对基于VLM的具身代理进行视觉后门攻击

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 BEAT通过对比触发学习在基于VLM的具身代理中实现视觉后门攻击,提升后门激活精度至39%。

Comments ICLR 2026. Project Page: https://zqs1943.github.io/BEAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10917 2026-02-24 cs.LG cs.AI 73%

Towards A Universal Graph Structural Encoder

迈向通用图结构编码器

Jialin Chen, Haolan Zuo, Haoyu Peter Wang, Siqi Miao, Pan Li, Rex Ying

机构 * Yale University(耶鲁大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GFSE是一种通用预训练图编码器,通过多目标自监督学习实现跨领域图结构的可转移编码,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18628 2026-02-24 cs.LG cs.AI 73%

Non-Interfering Weight Fields: Treating Model Parameters as a Continuously Extensible Function

非干扰权重场:将模型参数视为可扩展的连续函数

Sarim Chaudhry

机构 * Purdue University(普渡大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非干扰权重场(NIWF)框架,通过将模型参数视为可扩展的连续函数,解决大型语言模型中的灾难性遗忘问题,实现能力的版本控制与灵活管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19458 2026-02-24 cs.AI cs.HC 70%

ComplLLM: Fine-tuning LLMs to Discover Complementary Signals for Decision-making

ComplLLM:通过微调LLM发现互补信号以支持决策

Ziyang Guo, Yifan Wu, Jason Hartline, Kenneth Holstein, Jessica Hullman

机构 * Northwestern University(西北大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract);post-training(abstract);分类 cs.AI

AI总结 ComplLLM通过微调LLM利用互补信息提升决策支持,有效恢复互补信号并生成合理解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19212 2026-02-24 cs.CL 70%

Retrieval Augmented Enhanced Dual Co-Attention Framework for Target Aware Multimodal Bengali Hateful Meme Detection

基于检索增强的增强双注意力框架的目标感知多模态孟加拉语仇恨表情识别

Raihan Tanvir, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学) Department of Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程系,Ahsanullah科技大学)

专题命中 指令微调 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出基于检索增强的增强双注意力框架,用于目标感知多模态孟加拉语仇恨表情识别,通过语义对齐提升类别平衡和多样性,实验表明xDORA和RAG-Fused DORA在识别和检测任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18884 2026-02-24 cs.AI 70%

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

TPRU: 推动大型多模态模型中的时序与过程理解

Zhenkun Gao, Xuhong Wang, Xin Tan, Yuan Xie

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TPRU通过引入大规模多模态数据集和强化学习微调方法,显著提升大型模型在时序和过程理解上的表现,达到当前最先进的准确率。

Comments Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18437 2026-02-24 cs.IR cs.AI 70%

FineRef: Fine-Grained Error Reflection and Correction for Long-Form Generation with Citations

FineRef: 长形式生成中基于细粒度的错误反射与纠正方法

Yixing Peng, Licheng Zhang, Shancheng Fang, Yi Liu, Peijian Gu, Quan Wang

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FineRef通过细粒度错误反射与纠正框架,提升长形式生成中引用准确性与回答质量,实验显示其在多个指标上优于现有模型。

Comments 9 pages, 4figures, AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12268 2026-02-24 cs.AI 70%

CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use

CM2:基于检查清单奖励的多轮多步代理工具使用的强化学习

Zhen Zhang, Kaiqiang Song, Xun Wang, Yebowen Hu, Weixiang Yan, Chenyang Zhao, Henry Peng Zou, Haoyun Deng, Sathish Reddy Indurthi, Shujian Liu, Simin Ma, Xiaoyang Wang, Xin Eric Wang, Song Wang

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 CM2通过检查清单奖励提升多轮多步骤代理工具使用的强化学习效果,实现比监督微调更优的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23979 2026-02-24 cs.CL 70%

TaP: A Taxonomy-Guided Framework for Automated and Scalable Preference Data Generation

TaP: 一种基于分类引导的自动化和可扩展的偏好数据生成框架

Renren Jin, Tianhao Shen, Xinwei Wu, Dan Shi, Haoran Sun, Yuqi Ren, Wuwei Huang, Quandong Wang, Wei Liu, Jian Luan, Bin Wang, Deyi Xiong

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Xiaomi AI Lab(小米AI实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TaP框架通过结构化分类体系实现跨语言的自动化偏好数据生成,使LLM在指令遵循和价值观对齐方面表现优于现有开源数据集。

Comments 33 pages, 16 tables, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19063 2026-02-24 cs.CV 67%

Direction-aware 3D Large Multimodal Models

具有方向感知的3D大多模态模型

Quan Liu, Weihao Xuan, Junjue Wang, Naoto Yokoya, Ling Shao, Shijian Lu

专题命中 指令微调 :LLM(abstract);instruction tuning(abstract)

AI总结 本文提出方向感知的3D大多模态模型,通过补充自身姿态并改进点云数据对齐,提升3D多模态模型的性能和通用性。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏