arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2605.17458 2026-05-19 cs.LG 77%

ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks

ClaHF:一种基于人类反馈的强化学习框架,用于改进分类任务

Tianxiang Xu, Xiaoyan Zhu, Xin Lai, Jiayin Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文提出ClaHF,一种基于人类反馈的强化学习框架,用于改进文本分类任务,通过整合偏好建模和强化学习优化,无需额外人工标注,在分类流程中提升分类性能和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23352 2026-05-18 cs.CV cs.AI 77%

Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling

动态树RPO:通过结构化采样打破独立轨迹瓶颈

Xiaolong Fu, Lichen Ma, Zipeng Guo, ShiPing Dong, Lan Yang, Tan Lit Sin, Gaojing Zhou, Yu He, Jingling Fu, Shizhe Zhou, Junshi Huang, Jason Li

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 本文提出动态树RPO,通过树状结构采样策略和动态噪声强度,提升文本到图像生成的质量与效率,同时结合层调优强化学习方法,在多个基准测试中表现出色。

Comments Fig.3 updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14967 2026-05-15 cs.LG stat.ML 77%

InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting

InfoSFT: 通过信息感知的标记加权学习更多并忘记更少

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);分类 cs.LG

AI总结 InfoSFT通过信息感知的标记加权方案改进监督微调,提升泛化能力并保留原有能力,适用于数学、代码和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04152 2026-05-14 cs.CL cs.CY cs.HC 77%

SocialLM: Social Signal Processing of Patient-Provider Communication using LLMs and Contextual Aggregation

SocialLM:利用LLMs和上下文聚合进行患者-提供者沟通的社会信号处理

Manas Satish Bedmutha, Feng Chen, Andrea Hartzler, Trevor Cohen, Nadir Weibel

机构 * University of Washington(华盛顿大学) UC San Diego(圣地亚哥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文探讨了LLMs在无需微调的情况下能否有效跟踪临床转录中的20种社会行为,并通过群体一致性模式提升检测准确性与稳定性。

Comments To be presented at CHIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 77%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10318 2026-05-12 cs.CL 77%

Extending Confidence-Based Text2Cypher with Grammar and Schema Aware Filtering

基于语法和模式意识的文本到Cypher扩展

Makbule Gulcin Ozsoy

机构 * Neo4j(Neo4j公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究如何在文本到Cypher推理中利用结构约束提高查询正确性,通过扩展置信度框架加入序列过滤过程,结合置信度评分、语法验证和模式约束,提升生成查询的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08769 2026-05-12 cs.AI 77%

EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

EvoMAS:学习执行时间的多智能体系统工作流

Chengdong Xu, Kaiqiang Ke, Ziheng Liu, Jiaqi Wei, Zibo Shao, Weile Guo, Chao Yu

机构 * Sun Yat-Sen University(中山大学) Zhejiang University(浙江大学) ShanghaiTech University(上海理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EvoMAS通过动态构建执行时间工作流,改进多智能体系统的协作策略,实验证明其在复杂任务中优于单智能体基线和现有自动化方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08560 2026-05-12 cs.CV cs.AI 77%

ZAYA1-VL-8B Technical Report

ZAYA1-VL-8B 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * Zyphra

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 ZAYA1-VL-8B 是基于内部语言模型 ZAYA1-8B 构建的紧凑多专家视觉语言模型,在多个图像理解、推理和计数基准上超越了 Qwen2.5-VL-3B、PLM-3B 和 MolmoE-1B 等模型。

Comments 20 pages, 7 figures, 3 appendices (with 31 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06524 2026-05-12 cs.AI 77%

Process Matters more than Output for Distinguishing Humans from Machines

过程比输出更能区分人类与机器

Milena Rmus, Mathew D. Hardy, Thomas L. Griffiths, Mayank Agrawal

机构 * Roundtable Technologies Inc.(Roundtable技术公司) Princeton University(普林斯顿大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出CogCAPTCHA30测试人类与机器的行为过程差异,发现过程特征比性能指标更有效区分两者,但任务特定过程监督在跨任务迁移时效果下降,凸显过程定义的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08158 2026-05-12 cs.CV cs.AI 77%

HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

HY-Himmel技术报告:分层交错多流运动编码用于长视频理解

Haopeng Jin, Hongzhu Yi, Wenlong Zhao, Jinwen Luo, Shani Ye, Zhenyu Guan, Shiquan Dong, Tiankun Yang, Tao Yu

机构 * Tencent(腾讯) University of Chinese Academy of Sciences(中国科学院大学) Beijing Forestry University(北京林业大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 HY-Himmel通过分层视频语言框架解决长视频理解中多模态语言模型的三个瓶颈问题,采用轻量级压缩域三流适配器编码密集帧,提升运动感知能力,实验证明其在Video-MME上性能优于32帧基准。

Comments 59 pages, 42 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01208 2026-05-05 cs.AI 77%

Faithful Mobile GUI Agents with Guided Advantage Estimator

忠实的移动GUI代理与引导优势估计器

Haowen Hu, Pengzhou Cheng, Zheng Wu, Lingzhong Dong, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出Faithful-Agent框架,通过两阶段流程提升GUI交互的证据基础性和一致性,引入引导优势估计器GuAE,有效提升任务成功率并保持指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00631 2026-05-04 cs.CL cs.IR 77%

H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations

H-RAG在SemEval-2026任务8中的应用:多轮RAG对话中的层次父-子检索

Passant Elchafei, Hossam Emam, Mohamed Alansary, Monorama Swain, Markus Schedl

机构 * Johannes Kepler University Linz(约翰尼斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Artificial Intelligence Lab(人工智能实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 H-RAG通过层次化父-子检索方法提升多轮RAG对话性能,结合密集-稀疏搜索与上下文重构,实现检索与生成的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00371 2026-05-04 cs.SD cs.AI 77%

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解

Zuyao You, Zhesong Yu, Mingyu Liu, Bilei Zhu, Yuan Wan, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20211 2026-04-29 cs.CV cs.AI 77%

OmniAlpha: Aligning Transparency-Aware Generation via Multi-Task Unified Reinforcement Learning

OmniAlpha:通过多任务统一强化学习对透明度感知生成进行对齐

Hao Yu, Jinglin Wang, Jiabo Zhan, Rui Chen, Zile Wang, Huaisong Zhang, Hongyu Li, Xinrui Chen, Yongxian Wei, Chun Yuan

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 OmniAlpha通过多任务统一强化学习框架,解决透明度感知生成中RGB外观、alpha透明度和跨层合成的建模问题,提升RGBA生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16396 2026-04-21 cs.CL 77%

QU-NLP at QIAS 2026: Multi-Stage QLoRA Fine-Tuning for Arabic Islamic Inheritance Reasoning

QU-NLP在QIAS 2026中的表现:针对阿拉伯伊斯兰继承推理的多阶段QLoRA微调

Mohammad AL-Smadi

机构 * Qatar University(卡塔尔大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文提出通过多阶段QLoRA微调策略提升阿拉伯伊斯兰继承推理能力,利用领域适应和任务特定训练,在低资源下实现高精度推理。

Comments Accepted for publication, The 7th Workshop on Open-Source Arabic Corpora and Processing Tools, LREC26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25843 2026-04-15 cs.AI 77%

ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack

ASGuard:激活-缩放防护:缓解针对性劫持攻击

Yein Park, Jungwoo Park, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASGuard框架,通过电路分析识别与针对性劫持相关的注意力头,训练通道缩放向量重新校准激活,结合预防性微调提升模型拒绝能力,有效降低攻击成功率并保持模型性能。

Comments ICLR 2026, 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11801 2026-04-14 cs.CL 77%

CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation

CLSGen:一种用于联合概率分类和 verbalized 解释的双头微调框架

WonJin Yoon, Kangyu Zhu, Ian Bulovic, Autumn Sehy, Yanjun Gao, Dmitriy Dligach, Majid Afshar, Timothy A. Miller

机构 * Boston Children’s Hospital(波士顿儿童医院) Harvard Medical School(哈佛医学院) University of Colorado Anschutz Medical Campus(科罗拉多大学安施图茨医学院) Loyola University Chicago(芝加哥洛约拉大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CLSGen 提出了一种双头微调框架,通过新的架构和方法实现概率估计与解释生成的平衡,实验表明其在分类和解释质量上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11136 2026-04-14 cs.CV cs.AI 77%

BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning

BoxTuning:直接注入物体框进行多模态模型微调

Zekun Qian, Ruize Han, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 BoxTuning通过将物体空间时间信息直接注入视觉模态,解决多模态大语言模型在视频问答中物体细粒度定位的不足,显著降低token成本并保持时间分辨率,实验表明其在空间导向任务中优于文本坐标方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07061 2026-04-14 cs.AI 77%

Do LLMs Feel? Teaching Emotion Recognition with Prompts, Retrieval, and Curriculum Learning

LLMs能否感知情绪?通过提示、检索和课程学习进行情绪识别

Xinran Li, Yu Liu, Jiaqi Qiao, Xiujuan Xu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PRC-Emo框架,结合提示工程、示范检索和课程学习,探索LLM在对话中感知情绪的能力,实验表明在IEMOCAP和MELD数据集上达到新的SOTA性能。

Comments Accepted at AAAI 2026

Journal ref Proc. AAAI Conf. on Artificial Intelligence, Vol. 40, No. 38, pp. 31778-31786 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00413 2026-04-14 cs.LG 77%

Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse

树训练:通过共享前缀重用加速代理LLM训练

Jinghui Wang, Shaojie Wang, Yinghan Cui, Xuxing Chen, Chao Wang, Liang Huang, Xiaojiang Zhang, Junyi Peng, Li Wan, Haotian Zhang, Bin Chen

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Tree Training框架,通过DFS序列化和树分区策略,高效处理树状token轨迹,实现LLM训练速度提升6.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04501 2026-04-14 cs.CL 77%

Ultra-Low-Dimensional Prompt Tuning via Random Projection

超低维提示调优

Zijun Wu, Yongchang Hao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(阿尔伯塔大学计算机科学系与阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能讲席)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出超低维提示调优方法,通过在低维空间优化提示并在冻结随机矩阵上进行上投影,实现训练参数减少98%且保持性能,适用于大规模LLM定制。

Comments Accepted by EACL 2026 (Main Conference, Long Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10326 2026-04-14 cs.CR cs.AI 77%

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

矩阵劫持:用于受控模型反制的空域操控

Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

机构 * Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 本文提出HMNS方法,通过识别并抑制注意力头,注入受限于正交补集的扰动,实现对模型的受控反制,展示了新的安全防御范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10297 2026-04-14 cs.CV cs.AI 77%

FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data

FashionMV:基于多视角时尚数据的产品级复合图像检索

Peng Yuan, Bingyin Mei, Hui Zhang

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出FashionMV,首个大规模多视角时尚数据集,用于产品级复合图像检索。通过构建包含127K产品、472K多视角图像和220K三元组的数据集,结合ProCIR框架,采用多阶段对话、标题对齐和思维链引导等机制,提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04736 2026-04-13 cs.AI cs.AR cs.PL 77%

ChipSeek: Optimizing Verilog Generation via EDA-Integrated Reinforcement Learning

ChipSeek: 通过集成EDA的强化学习优化Verilog生成

Zhirong Chen, Kaiyan Chang, Zhuolin Li, Cangyuan Li, Xinyang He, Chujie Chen, Mengdi Wang, Haobo Xu, Yinhe Han, Huawei Li, Ying Wang

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所智能计算机研究中心) University of Chinese Academy of Sciences(中国科学院大学) University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChipSeek通过集成EDA的强化学习框架,优化RTL代码生成,提升功能正确性和PPA指标。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07487 2026-04-10 cs.AI 77%

CLEAR: Context Augmentation from Contrastive Learning of Experience via Agentic Reflection

CLEAR:通过代理反思进行经验对比学习的上下文增强

Linbo Liu, Guande Wu, Han Ding, Yawei Wang, Qiang Zhou, Yuzhe Lu, Zhichao Xu, Huan Song, Panpan Xu, Lin Lee Cheong

机构 * AWS AI Labs(亚马逊云科技人工智能实验室)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CLEAR通过对比学习经验的代理反思生成上下文,提升任务完成率和奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06385 2026-04-09 cs.CL 77%

Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning

通过强化学习和监督微调驱动的开源大语言模型教学知识优化

Navan Preet Singh, Xiaokun Wang, Anurag Garikipati, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * East China Normal University, Shanghai, China(华东师范大学) Incept Labs, Houston, TX(Incept Labs)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 本文提出结合强化学习和监督微调的多阶段优化策略,通过EduQwen 32B-RL1、EduQwen 32B-SFT及EduQwen 32B-SFT-RL2等模型,提升大语言模型的教学知识能力,实现跨领域教学知识基准的新状态-of-the-art结果。

Comments * These authors contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05839 2026-04-08 cs.AI 77%

Vision-Guided Iterative Refinement for Frontend Code Generation

基于视觉引导的前端代码生成迭代精修

Hannah Sansford, Derek H. C. Law, Wei Liu, Abhishek Tripathi, Niresh Agarwal, Gerrit J. J. van den Burg

机构 * School of Mathematics, University of Bristol, UK(英国布里斯托大学数学学院) Amazon AGI(亚马逊AGI)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种全自动的批评者循环框架,利用视觉语言模型提供结构化反馈以指导代码生成的迭代优化,实验证明其在前端开发中能显著提升代码质量。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05522 2026-04-08 cs.CL 77%

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

跨模态指代对齐:在全模态大语言模型中实现可靠信息传输

Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 研究提出跨模态指代对齐问题,通过CrossOmni数据集和两种方法提升全模态推理能力,揭示指代意识缺失是跨模态推理弱化的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17697 2026-04-08 cs.AI 77%

Beyond Syntax: Action Semantics Learning for App Agents

超越语法:面向应用代理的动作语义学习

Bohan Tang, Dezhao Luo, Jianheng Liu, Jingxuan Chen, Shaogang Gong, Jianye Hao, Jun Wang, Kun Shao

机构 * University of Oxford(牛津大学) Queen Mary University of London(伦敦玛丽女王大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) University College London(伦敦大学学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出动作语义学习框架ASL,通过捕捉地面真实动作的语义来提升应用代理的准确性和泛化能力,克服了传统语法学习在分布外鲁棒性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03388 2026-04-07 cs.LG stat.ML 77%

Scalable Variational Bayesian Fine-Tuning of LLMs via Orthogonalized Low-Rank Adapters

通过正交化低秩适配器实现大规模语言模型的可扩展变分贝叶斯微调

Haotian Xiang, Bingcong Li, Qin Lu

机构 * School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PoLAR-VBLL框架,通过正交化低秩适配器与变分推断结合,实现大规模语言模型的可扩展贝叶斯微调,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏