RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting
RLHFSpec: 通过自适应草稿打破RLHF训练的效率瓶颈
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG
AI总结 RLHFSpec通过自适应草稿策略和高效样本再分配,提升RLHF训练效率,缓解生成瓶颈,提高整体性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
RLHFSpec: 通过自适应草稿打破RLHF训练的效率瓶颈
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG
AI总结 RLHFSpec通过自适应草稿策略和高效样本再分配,提升RLHF训练效率,缓解生成瓶颈,提高整体性能。
文本自注意力网络:通过基于文本的梯度注意力进行测试时偏好优化
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TSAN,一种无需参数更新的测试时偏好优化方法,通过文本梯度空间实现多候选响应的系统分析与综合,提升输出质量。
Comments AAAI2026
SUMFORU: 一种基于LLM的个性化购买决策支持的评论摘要框架
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 SUMFORU通过可调节的多元对齐方法,实现个性化购买决策支持,结合高质量数据管道和两阶段对齐流程,提升摘要的一致性、基础性和偏好对齐性能。
Comments Code available at https://github.com/Harry20030331/SumForU
Osprey:面向安全关键控制系统的生产级代理AI
专题命中 安全训练 :safety(title,abstract)
AI总结 Osprey通过四种机制解决安全关键控制系统的协调与安全问题,展示在先进光源中的生产应用。
通过博弈论理解LLM代理行为:策略识别、偏差与多代理动态
机构 * Faculty of Information and Technology, Ho Chi Minh City University of Science (HCMUS), Vietnam(信息科技学院,胡志明市科学大学(HCMUS)) ; Vietnam National University - Ho Chi Minh City (VNU-HCM), Vietnam(越南国家大学-胡志明市(VNU-HCM)) ; Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT))
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文通过扩展FAIRGAME框架,系统评估LLM在重复社会困境中的行为,揭示其策略识别、偏差及多代理动态,为AI治理和安全多代理系统设计提供方法论基础。
A-LAMP:基于代理的大型语言模型框架用于自动马尔可夫决策过程建模与策略生成
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 A-LAMP通过基于代理的大型语言模型自动将自然语言任务描述转换为马尔可夫决策过程并生成策略,提升了自动化建模和策略生成的效率与准确性。
Comments NeurIPS 2025 Workshop: Multi-Turn Interactions in Large Language Models. 26 pages, 8 figures
超后缀:同时绕过文本生成对齐和防护模型
机构 * MITRE(MITRE公司) ; Worcester Polytechnic Institute(沃斯顿理工学院)
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出超后缀技术,通过联合优化绕过Llama Prompt Guard 2,同时提出DeltaGuard检测方法提升对抗性提示防御效果。
Comments 13 pages, 5 Figures
DeepSeek的WEIRD行为:大型语言模型的文化契合与提示语言和文化提示的影响
机构 * School of Data Science University of Virginia(数据科学学院 芝加哥大学)
专题命中 提示注入 :alignment(title,abstract);分类 cs.CL
AI总结 研究探讨了大型语言模型在不同文化提示下的对齐行为,发现DeepSeek-V3和GPT-5在美文化下表现突出,而GPT-4在英文化下更接近中国,文化提示可调整这种对齐。
注意置信差距:大型语言模型中的过度自信、校准与干扰效应
机构 * University of Southern California(美国南加州大学)
专题命中 幻觉与事实性 :RLHF(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本研究探讨了大型语言模型中的过度自信问题,通过引入干扰项显著改善校准,提出针对性的改进策略以提升模型可靠性。
Comments Published in Transactions on Machine Learning Research (TMLR)
LUCID:基于学习的不确定性感知随机动力系统认证
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 LUCID通过学习控制障碍证书和傅里叶核展开,为随机动态系统提供鲁棒且高效的认证框架,实现形式安全保证。
Comments The manuscript has been accepted for publication in the main track of AAAI 2026
你的计划可能成功,但失败呢?探究人们如何利用ChatGPT进行长期生活任务规划
专题命中 幻觉与事实性 :trustworthy(abstract)
AI总结 研究探讨人们如何利用ChatGPT进行长期生活任务规划,发现AI在结构化目标和生成想法方面有帮助,但输出缺乏个性化和适应性,需用户主动调整。
通过行为指导实现可信的多轮大语言模型代理
机构 * Gonca Gürsun(独立研究者)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本文提出一种框架,通过行为指导使大语言模型代理在多轮任务中实现可靠和可验证的行为。
Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)
通过ASCII、词性对齐和PCA进行句子结构的统计分析
机构 * New Jersey Institute of Technology(新泽西理工学院)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 本研究通过ASCII、词性对齐和PCA分析句子结构的平衡,提出一种资源高效的统计方法,用于评估文本平衡并补充传统语法工具。
针对分子毒性预测的特定任务稀疏特征掩码与化学语言模型
机构 * School of Science and Technology(科学与技术学院) ; Hong Kong Metropolitan University(香港 Metropolitan 大学) ; Faculty of Engineering(工程学院) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种多任务学习框架,通过稀疏注意力机制提升化学分子毒性预测的准确性和可解释性。
Comments 6 pages, 4 figures
健康AI中的“准备”幻觉
机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。
EpiPlanAgent:基于代理的自动化疫情响应规划
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Center For Disease Control and Prevention(上海市疾病预防控制中心)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 EpiPlanAgent利用大语言模型和多代理框架,实现自动化疫情响应规划,显著提升计划完整性并减少开发时间。
AI-MASLD 大语言模型在无结构临床叙述中的代谢功能障碍与信息脂肪变
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究首次实证表明大语言模型在处理临床信息时表现出类似代谢功能障碍的特征,提出AI-MASLD概念,强调需在人类监督下使用LLMs作为辅助工具。
Comments 47 pages, 2 figures
CLINIC:评估语言模型在医疗领域的多语言可信度
机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) ; IGIMS, Patna(帕纳布IGIMS) ; University of Virginia(弗吉尼亚大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 CLINIC提出一个多语言基准,评估语言模型在医疗领域的可信度,揭示其在事实准确性、公平性和隐私保护方面的不足。
Comments 49 pages, 31 figures
CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估
机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。
更细的更好:面向粒度感知的开集域泛化
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 SeeCLIP通过细粒度语义增强解决开集域泛化中的结构风险与开放空间风险困境,提升模型对难区分未知类别的判别能力。
Comments 9 pages,3 figures,aaai2026
将本体与大语言模型结合以增强化工工程中的控制系统
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本文提出结合本体的LLM框架,用于增强化工工程控制系统,通过结构化知识与生成推理结合,提升过程控制和安全分析的可解释性和可靠性。
Comments This paper is withdrawn due to issues with attribution and citation accuracy
对非洲语言自动语音识别模型的基准测试
机构 * Makerere University Centre for Artificial Intelligence(Makerere大学人工智能中心) ; Marconi Lab(Marconi实验室) ; Department of Information Systems(信息系统系) ; Department of Electrical Engineering(电气工程系) ; Department of Computer Science(计算机科学系)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究对四种最先进的ASR模型在13种非洲语言上进行基准测试,揭示不同模型在不同资源条件下的表现差异及优化策略。
Comments 19 pages, 8 figures, Deep Learning Indiba, Proceedings of Machine Learning Research
跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解
机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) ; School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) ; School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)
专题命中 安全评测 :alignment(abstract)
AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。
Comments 12 pages, 5 figures
SmokeBench: 评估多模态大语言模型用于野火烟雾检测
机构 * Australian National University(澳大利亚国立大学)
专题命中 安全评测 :safety(abstract)
AI总结 SmokeBench评估多模态大语言模型在野火烟雾检测中的性能,发现模型在烟雾定位方面存在显著局限,尤其在早期阶段。
Comments Accepted to WACV 2026
Insight Miner: 一个用于跨领域对齐的时间序列分析数据集与自然语言
机构 * UC Berkeley(加州大学伯克利分校) ; Mineral(矿石) ; Northwestern University(西北大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.LG
AI总结 Insight Miner 是一个大规模多模态模型,通过代理工作流生成高质量时间序列描述,提升跨领域时间序列分析能力。
通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习
机构 * KAIST(韩国科学技术院) ; IHPC, A*STAR(A*STAR研究院)
专题命中 其他安全 :alignment(title,abstract)
AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。
Comments Accepted at NeurIPS 2025
TV2TV:一种用于交错语言和视频生成的统一框架
机构 * Meta FAIR
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。
从验证负担到可信协作:LLM辅助文献综述的设计目标
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文针对LLM辅助文献综述中的信任和协作问题,提出六个设计目标和框架,通过可视化、验证和反馈对齐提升可信度与协作效率。
少样本基于视觉语言模型的CNC加工G代码和人机界面验证
机构 * Department of Mechanical and Aerospace Engineering, Michigan Technological University(机械与航空航天工程系,密歇根技术大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文提出基于视觉语言模型的少样本方法,用于验证CNC加工中G代码与人机界面的错误和安全状态。
Cr2O3/η-Ga2O3和NiOx/η-Ga2O3异质结二极管的电气稳定性
专题命中 其他安全 :alignment(abstract)
AI总结 Cr2O3基异质结二极管在高温和环境暴露下表现出更高的稳定性和性能,优于NiOx基异质结二极管。