arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-25 至 2025-11-25 共收录 375 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 28 篇

2511.18854 2025-11-25 cs.SE cs.AI 83%

Time Travel: LLM-Assisted Semantic Behavior Localization with Git Bisect

时间旅行:借助Git Bisect的LLM辅助语义行为定位

Yujing Wang, Weize Hong

机构 * University of Waterloo(滑铁卢大学) Brock University(布罗克大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM和Git Bisect进行语义行为定位,通过结构化推理链提升故障定位准确率,实验显示成功率提升6.4个百分点,平均bisect时间减少2倍。

Comments submitted to Git Bisect SCALCOM 2025 Calgary (to be published)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16887 2025-11-25 cs.CR cs.AI cs.LG cs.SE 81%

Revisiting Pre-trained Language Models for Vulnerability Detection

重新审视预训练语言模型用于漏洞检测

Youpeng Li, Weiliang Qi, Xuyu Wang, Fuxun Yu, Xinda Wang

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Florida International University(佛罗里达国际大学) Microsoft(微软公司)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文重新审视预训练语言模型在漏洞检测中的应用,发现特定设计的模型在性能上更优,但面临现实场景中的挑战,如复杂依赖检测和标注错误问题。

Comments Accepted by the 21st ACM ASIA Conference on Computer and Communications Security (AsiaCCS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16216 2025-11-25 cs.LG cs.AI cs.CL 80%

GMoE: Empowering LLMs Fine-Tuning via MoE Graph Collaboration

GMoE:通过MoE图协作增强LLM微调

Ting Bai, Yue Yu, Le Huang, Zenan Xu, Chuan Shi

机构 * Beijing University of Posts and Telecommunication(北京邮电大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GMoE通过图协作策略提升LLM微调的稳定性与效率

Comments 9 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18306 2025-11-25 cs.CL 79%

Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning

利用视觉语言模型和领域特定微调进行建筑规范中的表格理解

Mohammad Aqib, Mohd Hamza, Ying Hei Chui, Qipei Mei

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了利用视觉语言模型和领域特定微调提取建筑规范中表格信息的方法,发现直接输入方法在准确性上优于间接输入方法,且微调后模型性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17982 2025-11-25 cs.CR cs.AI 79%

Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation Models

面向图基础模型的高效、隐蔽和持久后门攻击

Jiayi Luo, Qingyun Sun, Lingjuan Lyu, Ziwei Zhang, Haonan Yuan, Xingcheng Fu, Jianxin Li

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出GFM-BA,一种针对图基础模型的高效、隐蔽和持久后门攻击方法,通过无标签触发关联模块、节点自适应触发生成器和持久后门锚定模块解决后门攻击的三大挑战。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19325 2025-11-25 cs.IR cs.AI cs.CL 79%

Generative Query Expansion with Multilingual LLMs for Cross-Lingual Information Retrieval

基于多语言大语言模型的生成式查询扩展用于跨语言信息检索

Olivia Macmillan-Scott, Roksana Goworek, Eda B. Özyiğit

机构 * The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Queen Mary University of London(伦敦女王学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了多语言大语言模型在跨语言信息检索中的生成式查询扩展效果,发现查询长度和提示技术对性能影响显著,且不同语言间存在显著的检索性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV 78%

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18709 2025-11-25 cs.RO 78%

Autonomous Surface Selection For Manipulator-Based UV Disinfection In Hospitals Using Foundation Models

基于基础模型的医院机器人紫外线消毒表面自主选择

Xueyan Oh, Jonathan Her, Zhixiang Ong, Brandon Koh, Yun Hann Tan, U-Xuan Tan

机构 * Engineering Product Development Pillar, Singapore University of Technology and Design, Singapore(新加坡科技设计大学工程产品开发部门) Centre for Healthcare Assistive & Robotics Technology, Singapore(新加坡医疗辅助与机器人技术中心) National Centre for Infectious Diseases, Singapore(新加坡传染病国家中心)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本研究提出基于基础模型的机器人紫外线消毒表面自主选择方法,通过视觉语言模型辅助分割细化,提高消毒效率并减少误判,实验证明其在实际应用中的有效性。

Comments 7 pages, 7 figures; This paper has been accepted by IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17927 2025-11-25 cs.CV cs.AI 77%

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

PA-FAS: 向可解释和通用的多模态人脸反伪装迈进:通过路径增强强化学习

Yingjie Ma, Xun Lin, Yong Xu, Weicheng Xie, Zitong Yu

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 PA-FAS通过路径增强强化学习提升多模态人脸反伪装的可解释性和泛化能力。

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07523 2025-11-25 cs.CL cs.AI cs.LG 75%

DemoShapley: Valuation of Demonstrations for In-Context Learning

DemoShapley:为上下文学习评估演示

Shan Xie, Man Luo, Chadly Daniel Stern, Mengnan Du, Lu Cheng

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Eindhoven University of Technology(埃因霍温理工大学) Intel Lab(英特尔实验室) Department of Psychology(心理学系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Data Science(数据科学系) New Jersey Institute of Technology(新泽西理工学院) Department of Computer Science(计算机科学系) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DemoShapley通过Shapley值评估演示贡献,Beta-DemoShapley优化低样本场景,提升ICL演示评估的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12609 2025-11-25 cs.CL cs.AI cs.CV 73%

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data

Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型

Yunxin Li, Xinyu Chen, Shenyuan Jiang, Haoyuan Shi, Zhenyu Liu, Xuanyu Zhang, Nanhao Deng, Zhenran Xu, Yicheng Ma, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。

Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18039 2025-11-25 cs.LG 70%

Curvature-Aware Safety Restoration In LLMs Fine-Tuning

曲率感知的LLM微调安全恢复

Thong Bach, Thanh Nguyen-Tang, Dung Nguyen, Thao Minh Le, Truyen Tran

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出曲率感知对齐恢复方法,通过影响函数和二阶优化,在保持任务性能的同时减少有害输出,提升LLM的安全性和实用性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17413 2025-11-25 cs.CL 70%

Conversations: Love Them, Hate Them, Steer Them

对话:喜欢它们,讨厌它们,引导它们

Niranjan Chebrolu, Gerard Christopher Yeo, Kokil Jaidka

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过激活工程引导LLaMA 3.1-8B增强情感表达,提升对话AI的共情能力。

Comments We have created a new arXiv submission with a more up to date version of this paper at arXiv:2511.12832

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07189 2025-11-25 cs.SE 67%

Secure-Instruct: An Automated Pipeline for Synthesizing Instruction-Tuning Datasets Using LLMs for Secure Code Generation

Secure-Instruct: 一种利用LLM合成指令微调数据集的自动化流程,用于安全代码生成

Junjie Li, Fazle Rabbi, Bo Yang, Song Wang, Jinqiu Yang

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 Secure-Instruct通过自动化合成安全代码示例和指令微调LLM,提升代码生成的安全性和功能性正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22390 2025-11-25 cs.SE 67%

What Characteristics Make ChatGPT Effective for Software Issue Resolution? An Empirical Study of Task, Project, and Conversational Signals in GitHub Issues

哪些特征使ChatGPT在软件问题解决中有效?对GitHub问题中任务、项目和对话信号的实证研究

Ramtin Ehsani, Sakshi Pathak, Esteban Parra, Sonia Haiduc, Preetha Chatterjee

专题命中 指令微调 :LLM(abstract);language model(abstract)

AI总结 本文研究了ChatGPT在软件问题解决中的有效性特征,发现其在代码生成和工具推荐方面表现较好,但代码解释能力较弱,且更受欢迎的项目和经验丰富的开发者从中受益更多。

Comments Accepted for publication in Empirical Software Engineering (EMSE), 2025

Journal ref Empirical Software Engineering, 31, 22 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13093 2025-11-25 cs.CV cs.AI 57%

Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension

Video-RAG: 基于视觉对齐的检索增强长视频理解

Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Nanjing University(南京大学) University of Rochester(罗切斯特大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。

Comments Accepted at NeurIPS 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19268 2025-11-25 cs.CV 50%

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

BideDPO:基于文本和条件对齐的同时图像生成

Dewei Zhou, Mingwei Li, Zongxin Yang, Yu Lu, Yunqiu Xu, Zhizhong Wang, Zeyi Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Huawei Technologies Ltd., China(华为技术有限公司)

专题命中 指令微调 :preference optimization(abstract)

AI总结 BideDPO通过双向解耦的DPO框架解决文本与条件间的冲突,提升图像生成的准确性和一致性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18976 2025-11-25 cs.CV 50%

Peregrine: One-Shot Fine-Tuning for FHE Inference of General Deep CNNs

Peregrine: 为通用深度CNN的FHE推理实现一次微调

Huaming Ling, Ying Wang, Si Chen, Junfeng Fan

机构 * Cipherflow Shenzhen, China(Cipherflow深圳分公司) Open Security Research Shenzhen, China(开放安全研究深圳分公司)

专题命中 指令微调 :SFT(abstract)

AI总结 Peregrine通过单阶段微调策略和通用交错打包方案,实现了通用深度CNN的高效FHE推理,支持高分辨率图像处理并首次展示了YOLO架构的FHE推理应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18131 2025-11-25 cs.CV 50%

Video4Edit: Viewing Image Editing as a Degenerate Temporal Process

Video4Edit: 将图像编辑视为一种退化的时间过程

Xiaofan Li, Yanpeng Sun, Chenming Wu, Fan Duan, YuAn Wang, Weihao Bo, Yumeng Zhang, Dingkang Liang

机构 * Baidu Inc.(百度公司)

专题命中 指令微调 :foundation model(abstract)

AI总结 Video4Edit通过将图像编辑视为退化的时间过程,利用视频预训练的单帧演化先验,实现高效的数据微调,从而在性能上与主流模型相当,但仅需1%的监督数据。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 15 篇

2502.00313 2025-11-25 cs.GT cs.AI cs.CL cs.MA 91%

Distributive Fairness in Large Language Models: Evaluating Alignment with Human Values

大语言模型中的分配公平性:评估与人类价值观的对齐

Hadi Hosseini, Samarth Khanna

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大语言模型在分配公平性方面的表现,发现其与人类价值观存在偏差,并探讨了提升对齐性的策略。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17579 2025-11-25 cs.LG cs.AI 82%

Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation

通过价值去相关与外推实现大语言模型的多值对齐

Hefei Xu, Le Wu, Chen Cheng, Hao Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 本文提出多值对齐框架MVA,通过价值去相关与外推策略,有效解决多价值观对齐中的稳定性与冲突处理问题,实验表明其在多值对齐任务中表现优于现有方法。

Comments accepted by AAAI26 oral; 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18397 2025-11-25 cs.AI cs.SE 81%

Natural Emergent Misalignment from Reward Hacking in Production RL

生产强化学习中奖励黑客导致的自然涌现偏差

Monte MacDiarmid, Benjamin Wright, Jonathan Uesato, Joe Benton, Jon Kutasov, Sara Price, Naia Bouscal, Sam Bowman, Trenton Bricken, Alex Cloud, Carson Denison, Johannes Gasteiger, Ryan Greenblatt, Jan Leike, Jack Lindsey, Vlad Mikulik, Ethan Perez, Alex Rodrigues, Drake Thomas, Albert Webson, Daniel Ziegler, Evan Hubinger

机构 * Anthropic

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);prompting(abstract)

AI总结 研究发现大型语言模型在生产强化学习环境中学习奖励黑客会导致严重偏差,提出三种缓解措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18630 2025-11-25 cs.LG cs.AI cs.CL stat.ME stat.ML 80%

Majority of the Bests: Improving Best-of-N via Bootstrapping

多数最佳:通过Bootstrap改进最佳-N

Amin Rakhsha, Kanika Madan, Tianyu Zhang, Amir-massoud Farahmand, Amir Khasahmadi

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Autodesk(Autodesk公司) Polytechnique Montréal(蒙特利尔理工学院) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MoB方法,通过Bootstrap估计最佳-N的输出分布并选择其模式,以提高在不完美奖励下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11500 2025-11-25 cs.LG 79%

Honesty over Accuracy: Trustworthy Language Models through Reinforced Hesitation

诚实胜过准确:通过强化犹豫实现可信语言模型

Mohamad Amin Mohamadi, Tianhao Wang, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

AI总结 通过强化犹豫方法,将回避作为核心训练目标,使语言模型在风险可控下提升可信度,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI 79%

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19169 2025-11-25 cs.CV 78%

Test-Time Preference Optimization for Image Restoration

测试时偏好优化用于图像恢复

Bingchen Li, Xin Li, Jiaqi Xu, Jiaming Guo, Wenbo Li, Renjing Pei, Zhibo Chen

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出测试时偏好优化方法,通过生成偏好数据和自动指标,提升图像恢复质量并适应多种任务。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17937 2025-11-25 cs.AI 77%

Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria

对齐欺骗 - 训练到部署的不对称性:通过博弈论视角的贝叶斯-斯克尔伯格均衡

Kartik Garg, Shourya Mishra, Kartikeya Sinha, Ojaswi Pratap Singh, Ayush Chopra, Kanishk Rai, Ammar Sheikh, Raghav Maheshwari, Aman Chadha, Vinija Jain, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa学院) Apple, USA(苹果公司) Google, USA(谷歌公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 通过博弈论视角研究AI对齐欺骗现象,分析不同偏好优化方法在安全、无害和有用性方面的表现,揭示其成因及发生条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17265 2025-11-25 cs.CL cs.CV 70%

Systematic Reward Gap Optimization for Mitigating VLM Hallucinations

系统性奖励缺口优化以缓解视觉语言模型的幻觉

Lehan He, Zeren Chen, Zhelun Shi, Tianyu Yu, Jing Shao, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 TPR通过主题级偏好重写系统优化奖励缺口配置,显著减少VLM幻觉并提升对齐效果。

Comments 34 pages, 12 figures, Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21953 2025-11-25 cs.CV 67%

MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment

MultiCrafter: 通过解耦注意力和身份感知偏好对齐实现高保真的多主体生成

Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Huawei Technologies Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 MultiCrafter通过解耦注意力和身份感知偏好对齐,提升多主体生成的保真度和人类偏好对齐能力。

Comments Project Page: https://wutao-cs.github.io/MultiCrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18919 2025-11-25 cs.CV cs.AI 57%

Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation

学习信任什么:基于贝叶斯先验引导的视觉生成优化

Ruiying Liu, Yuanzhi Liang, Haibin Huang, Tianshu Yu, Chi Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出贝叶斯先验引导优化方法,通过建模奖励不确定性提升视觉生成模型的语义对齐和感知保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏