AI-Powered Annotation Pipelines for Stabilizing Large Language Models: A Human-AI Synergy Approach
基于AI的标注流程用于稳定大语言模型:一种人机协同方法
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI
AI总结 本文提出了一种基于AI的标注流程,通过人机协同方法系统识别并修复大语言模型的不稳定性,提升模型的可靠性和鲁棒性。
Comments 16 Pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基于AI的标注流程用于稳定大语言模型:一种人机协同方法
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI
AI总结 本文提出了一种基于AI的标注流程,通过人机协同方法系统识别并修复大语言模型的不稳定性,提升模型的可靠性和鲁棒性。
Comments 16 Pages
通过文本可控的图像到3D进行前馈编辑
机构 * California Institute of Technology(加州理工学院)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI
AI总结 Steer3D通过文本可控的图像到3D生成方法,实现高效且准确的3D资产编辑,速度提升显著。
SUMFORU: 一种基于LLM的个性化购买决策支持的评论摘要框架
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 SUMFORU通过可调节的多元对齐方法,实现个性化购买决策支持,结合高质量数据管道和两阶段对齐流程,提升摘要的一致性、基础性和偏好对齐性能。
Comments Code available at https://github.com/Harry20030331/SumForU
RoleRMBench & RoleRM:迈向基于角色扮演的对话系统奖励建模
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Saarland University(萨尔兰州大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 RoleRMBench与RoleRM旨在通过连续隐式偏好训练提升角色扮演对话系统中奖励建模的准确性与连贯性。
PathMind: 一种基于大语言模型的知识图谱推理检索-优先-推理框架
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 PathMind通过检索-优先-推理框架,提升大语言模型在知识图谱推理中的准确性和可解释性,尤其在复杂推理任务中表现优异。
Comments AAAI 2026, Long Paper, Oral
QiMeng-SALV:面向Verilog代码生成的信号感知学习
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 偏好对齐 :DPO(abstract);分类 cs.LG
AI总结 QiMeng-SALV通过信号感知学习提升Verilog代码生成的准确性与性能,采用信号级优化解决功能奖励不足问题。
Comments Accepted to NeurIPS 2025
弥合相关性与推理:检索增强生成中的推理蒸馏
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 RADIO通过推理提取和基于推理的对齐方法,弥合检索增强生成中重排器与生成器之间的相关性差距。
Comments Accepted to ACL 25 Findings
大型语言模型在模拟调查用户响应中的分析
机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心) ; New York University(纽约大学)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
AI总结 本文分析了大型语言模型在模拟调查用户响应中的表现,提出CLAIMSIM方法以提高响应多样性,但发现模型在处理不同人口特征时存在固有偏见和推理限制。
Comments Accepted to IJCNLP-AACL 2025 (Main Conference)
Nanbeige4-3B 技术报告:探索小型语言模型的前沿
机构 * Nanbeige LLM Lab(纳布吉LLM实验室)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 Nanbeige4-3B通过FG-WSD调度器、DPD蒸馏和强化学习技术,实现了小型语言模型在性能和扩展定律上的突破。
PrefGen: 多模态偏好学习用于偏好条件下的图像生成
机构 * Rutgers University(罗格斯大学) ; iN2X ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; Red Hat AI Innovation(红帽人工智能创新)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 PrefGen通过多模态大语言模型提取用户偏好并注入扩散模型,实现个性化图像生成,优于现有方法。
Comments Project Page: \href{https://prefgen.github.io/}{\texttt{https://prefgen.github.io}}
通过几何投影参考约束的多维评分导向奖励模型学习
机构 * Shanghai Mingpin Medical Data Technology Co., Ltd.(上海明品医疗数据技术有限公司)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 通过几何投影参考约束的多维评分导向奖励模型学习,提升医疗领域大型语言模型的性能和对齐能力。
在生产环境中解决大语言模型重复问题:对多种解决方案的综合研究
机构 * Shenzhen Sunline Tech Co., Ltd(深圳Sunline科技有限公司)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI
AI总结 本文针对大语言模型在生产环境中重复问题,提出多种解决方案并验证其有效性,通过理论分析和实验评估,识别关键参数并提供实用的生产级方法。
迈向强化学习应用中更优质的密集奖励
机构 * McGill University(麦吉尔大学) ; Mila
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本文探讨了强化学习应用中如何构建更有效的密集奖励,通过逆强化学习、奖励建模和自监督学习等方法提高奖励的准确性和可靠性。
Comments arXiv admin note: substantial text overlap with arXiv:2505.20417
轨迹平衡与异步性:解耦探索与学习以实现快速、可扩展的LLM后训练
机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Mila – Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; KAIST(韩国科学技术院) ; CIFAR Fellow
专题命中 偏好对齐 :DPO(abstract);分类 cs.LG
AI总结 TBA通过解耦探索与学习,提升LLM后训练的速度和性能,适用于多种任务并支持大规模数据生成。
Comments NeurIPS 2025; 27 pages
侵入式上下文工程以控制大语言模型
机构 * McGill University(麦吉尔大学)
专题命中 偏好对齐 :jailbreak(abstract);分类 cs.AI
AI总结 本文提出侵入式上下文工程方法,通过在LLM上下文中插入控制句子以提升其安全性,避免长上下文场景下的数据短缺问题。
Comments 4 pages
对话不足以造就一个交际性的婴儿语言模型(但也不如发展启发式强化学习)
机构 * Center for Language and Cognition (CLCG), University of Groningen(语言与认知中心(CLCG)、格罗宁根大学) ; CRC 1646 – Linguistic Creativity in Communication, Bielefeld University(语言交流创造性研究(CRC 1646)、比尔特诺夫大学)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
AI总结 本文探讨了仅通过对话数据预训练是否能生成有效的小型语言模型,并通过多种微调策略提升模型的交际能力,发现DPO微调在自定义对话基准测试中表现更优。
Journal ref Proceedings of the First BabyLM Workshop (2025), pp. 421-435
检查表比奖励模型更能对齐语言模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。
Comments Presented at NeurIPS 2025
通过迭代PPO对齐大语言模型以实现多轮对话结果
机构 * Meta ; FAIR at Meta(Meta的FAIR)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。
Comments 12 pages, 2 figures
霍克鲁斯:用于检测和缓解具身AI系统中奖励黑客行为的可解释任务分解
机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)伯克利大学) ; Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 本研究提出MITD方法,通过可解释性任务分解有效检测和缓解具身AI系统中的奖励黑客行为,实验表明分解深度可显著降低奖励黑客频率。
Comments Accepted to the NeurIPS (Mexico City) 2025 Workshop on Embodied and Safe-Assured Robotic Systems (E-SARS). Thanks to Aman Chadha
CoTKR: 基于链式推理的增强型知识重写用于复杂知识图谱问答
机构 * Southeast University(东南大学) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University) Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室) ; China Mobile Research Institute(中国移动研究院) ; Monash University(墨尔本大学) ; University of Manchester(曼彻斯特大学) ; University of Edinburgh(爱丁堡大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 CoTKR通过链式推理增强知识重写方法,提升复杂知识图谱问答性能。
专题命中 偏好对齐 :alignment(abstract);分类 cs.CY
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
Comments Accepted at the AAAI-2026 Senior Member Track
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Meituan Inc.(美团公司) ; NiuTrans Research(牛译研所) ; CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS(中国科学院行为科学重点实验室) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Accepted by AAAI 2026
机构 * Clark Atlanta University(克拉克亚特兰大大学) ; Daffodil International University(达福尔国际大学) ; Ahsanullah University of Science and Technology(阿沙努拉大学科学与技术学院)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
Journal ref 2025 IEEE International Conference on Service-Oriented System Engineering (SOSE), Tucson, AZ, USA, 21-24 July 2025, IEEE
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
Comments After further internal discussion, our author team has decided to withdraw this submission due to the need for several important refinements to the manuscript. All co-authors have been informed and agree with this decision
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments 13 pages, 1 figure
专题命中 偏好对齐 :safety(abstract);分类 cs.LG