Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback
序列到序列奖励建模:通过语言反馈改进RLHF
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。
Comments 7 pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
序列到序列奖励建模:通过语言反馈改进RLHF
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 通过序列到序列奖励建模方法改进RLHF,提升LLMs对齐人类意图的性能。
Comments 7 pages
LLaDA2.0:将扩散语言模型扩展到100B参数
机构 * Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学) ; Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; HongKong University of Science and Technology(香港科学与技术大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。
Comments 19 pages
沉默学者问题:一种基于概率的框架,用于在LLM代理中打破知识不对称性
机构 * School of Science and Technology(科学与技术学院) ; Kwansei Gakuin University(冈山大学) ; School of Engineering & Computer Science(工程与计算机科学学院) ; Victoria University of Wellington(惠灵顿维多利亚大学)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI
AI总结 本文提出了一种基于概率的框架,用于在LLM代理中打破知识不对称性,通过双向知识交流和不确定性驱动的主动学习策略提升代理的适应性和信息获取能力。
大型语言模型安全性和内容审核的半监督学习
机构 * National University of Science and Technology Politehnica Bucharest(波兰技术大学科学与技术国家大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出利用半监督学习提升大型语言模型的安全性,通过结合标记和未标记数据以及任务特定增强技术,提高安全分类器的性能。
通过指令调优LLMs、RAG和强化学习方法实现NIFTY 50的自适应金融情绪分析
机构 * National Institute of Technology Karnataka(印度卡纳塔克国家理工学院) ; Gayatri Vidya Parishad College of Engineering(迦雅利维达帕希拉工程学院)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文提出结合指令调优LLMs、RAG和强化学习的方法,提升NIFTY 50金融情绪分析的准确性和市场适应性。
Comments Accepted in CODS 2025
LLM安全性的演变:对劫持攻击及防御的研究
机构 * Cornell University Ithaca, NY ; Department of Computer Science \& Engineering University of Minnesota -- Twin Cities Minneapolis, MN
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文研究了LLM安全性的演变,分析了劫持攻击的检测技术,并探讨了模型版本、大小及多防御策略对安全性的综合影响。
为LLM突破限制而探索句子配对:恶意代码生成的测试框架
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);AI safety(abstract)
AI总结 SPELL框架通过智能句子配对探索LLM在恶意代码生成中的安全漏洞,有效提升对抗测试效果。
Comments Accepted to FSE 2026
AutoAdv:多轮对抗性提示生成用于大型语言模型的多轮 Jailbreaking 攻击
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 AutoAdv 提出了一种自动化多轮对抗性提示生成方法,通过策略性重写和优化配置,实现对大型语言模型的安全机制的高效攻击,揭示了其在有害内容生成上的高成功率。
Comments We encountered issues with the paper being hosted under my personal account, so we republished it under a different account associated with a university email, which makes updates and management easier. As a result, this version is a duplicate of arXiv:2511.02376
AegisAgent:一种对抗LLM-HAR中提示注入攻击的自主防御代理
专题命中 提示注入 :prompt injection(title,abstract);trustworthy(abstract)
AI总结 AegisAgent通过自主推理和验证机制,有效降低LLM-HAR系统中提示注入攻击的成功率,提升系统安全性。
多思维在SemEval-2025任务7中的应用:通过多源对齐实现跨语言事实核查声明检索
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TriAligner通过多源对齐和对比学习,实现跨语言事实核查声明的高效检索,提升多语言环境下的信息准确性。
Comments 11 pages Published at the SemEval-2025 workshop
像真正的病理科医生一样诊断:一种以不确定性为核心的多分辨率多实例学习方法
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 幻觉与事实性 :trustworthy(title,abstract)
AI总结 本文提出UFC-MIL方法,通过多分辨率图像和不确定性校准,提升多实例学习的诊断可靠性。
Comments Accepted by IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026
MicroProbe: 用极少数据高效评估基础模型的可靠性
机构 * Aayam Bansal(未知) ; Ishaan Gangwani(未知)
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 MicroProbe通过仅使用100个精心选择的示例,高效评估基础模型可靠性,比随机采样方法提升23.5%的综合分数,显著降低评估成本并保持高覆盖率。
Comments ICML NewInML
ALIVE: 一种具有内容感知检索的虚拟形象-讲座交互视频引擎,用于实时交互
机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系罗切斯特理工学院) ; Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系罗切斯特理工学院)
专题命中 隐私与版权 :alignment(abstract)
AI总结 ALIVE通过本地部署和内容感知检索,实现基于虚拟形象的实时互动学习,提升讲座的教育价值。
弥合效率与安全:具有早期退出的神经网络形式验证
机构 * The Hebrew University of Jerusalem, Israel(特拉维夫大学) ; Bar Ilan University, Israel(巴伊兰大学) ; Ben-Gurion University of the Negev, Israel(贝纳亚克大学) ; University of California, Riverside, USA(加州大学河滨分校)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种针对具有早期退出机制的神经网络进行形式验证的方法,通过定制鲁棒性属性和优化策略,在保证正确性的同时提升验证效率和推理速度。
基于机制的智能(MBI):用于多智能体系统中理性协调和保证对齐的可微激励
专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 基于机制的智能(MBI)通过可微价格机制实现多智能体系统的理性协调和保证对齐,提供高效、可审计且可扩展的解决方案。
对NHS初级医疗中基于LLM的药物安全审查系统的真实世界评估
机构 * i.AI, Department for Science, Innovation, and Technology(i.AI,科学、创新与技术部门) ; Centre for Experimental Therapeutics, University of Liverpool(实验治疗中心,利物浦大学) ; Civic Health Innovation Labs, University of Liverpool(公民健康创新实验室,利物浦大学) ; Downing Street(唐宁街10号) ; Department of Statistics, University of Oxford(统计系,牛津大学) ; Ellison Institute of Technology(埃利森技术研究所) ; Centre for Academic Primary Care, University of Nottingham(学术初级护理中心,诺丁汉大学) ; The UK AI Security Institute(英国人工智能安全研究所) ; Department of Computing, Imperial College London(计算系,伦敦帝国学院)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文评估了基于LLM的药物安全审查系统在真实临床数据中的表现,揭示了其在不同复杂性下的失败模式,强调了上下文推理的重要性及改进方向。
DiTSinger: 通过扩散变换器和隐式对齐扩展歌唱语音合成
机构 * Migu Music, China Mobile Communications Corporation, China(咪咕音乐,中国移动通信集团,中国)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 DiTSinger通过扩散变换器和隐式对齐机制实现高效且高保真的歌唱语音合成,解决了数据稀缺和模型扩展性问题。
Comments ICASSP26 under review. Demo page: https://nju-jet.github.io/DiTSinger
持续学习中虚假遗忘的实时检测与定量分析
机构 * Shenzhen Sunline Tech Co., Ltd.(深圳Sunline科技有限公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出浅层与深层对齐框架,通过定量指标和实时检测方法解决持续学习中的虚假遗忘问题,提升模型鲁棒性。
EEG基础模型:对当前进展和未来方向的批判性回顾
机构 * Department of Computer Science & Engineering, University of Minnesota Twin Cities(计算机科学与工程系,明尼苏达大学双城分校) ; Department of Bioengineering, University of Illinois at Urbana-Champaign(生物工程系,伊利诺伊大学厄巴纳-香槟分校) ; Department of Neurology, Mayo Clinic(神经病学系,梅奥诊所) ; Department of Neurology, University of Minnesota Twin Cities(神经病学系,明尼苏达大学双城分校)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文回顾了EEG基础模型的当前进展,分析了其在自监督建模中的方法和评估策略,指出未来需加强可扩展性和可信度以提升实际应用价值。
Comments 22 pages (main), 5 figures (main), 4 tables (main + supplement)
让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。
Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep
面向C2C市场向更好搜索的领域感知文本嵌入
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出领域感知的文本嵌入方法,通过优化C2C市场places的搜索质量,提升相关性和效率,为更丰富的LLM时代搜索体验奠定基础。
Comments 5 pages, AAAI 2026 Workshop on New Frontiers in Information Retrieval
弥合功能与规范之间的人工智能可信度差距
机构 * TNO Netherlands Organisation for Applied Scientific Research, Data Science Department(荷兰应用科学研究院数据科学部门) ; Utrecht University, Department of Information(乌得勒支大学信息与计算科学系)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出通过引入语义语言弥合功能可信人工智能与规范可信人工智能之间的差距,以提升人工智能系统的可信度评估。
Comments Published as Position Paper during the TRUST-AI workshop at the ECAI2025 Conference
RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 安全评测 :alignment(abstract)
AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。
无偏区域-语言对齐用于开放词汇密集预测
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) ; NKIARI, Shenzhen Futian(深圳福田国家信息研究院) ; OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 AI治理与伦理 :alignment(title,abstract)
AI总结 DenseVLM通过无偏区域-语言对齐提升开放词汇密集预测性能
Comments Accepted at ICCV 2025. The code is available at https://github.com/HVision-NKU/DenseVLM
拥抱辩证的主体间性:利用LLM人格模拟协调内容分析中的不同视角
机构 * Department of Media and Information(媒体与信息系) ; Michigan State University(密歇根州立大学) ; College of Liberal Arts(人文学院) ; Colorado State University(科罗拉多州立大学) ; Department of Communication(传播系) ; Department of Advertising and Public Relations(广告与公共关系系) ; Department of Communication Studies(传播学系) ; Texas Christian University(德克萨斯 Christian 大学) ; Departments of Communication and Political Science(传播与政治学系) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文通过LLM人格模拟协调内容分析中的不同视角,探讨了党派偏见对编码结果的影响,并提升了AI驱动的社会科学研究的严谨性。
Journal ref Social Science Computer Review, 2025
剪枝能否提升推理?基于能力对齐的Long-Cot压缩以获得更好的推理
机构 * XJTU(西安交通大学) ; ECNU(华东师范大学) ; THU(清华大学) ; SEU(上海师范大学) ; USST(上海师范大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文提出Prune-on-Logic框架,通过结构感知剪枝提升Long-CoT推理效率,发现验证剪枝在保持准确性的同时减少令牌使用,揭示剪枝与模型容量对齐的重要性。
Comments 19 pages,6 figures
BitRL-Light: 1位LLM代理结合深度强化学习用于节能智能家庭照明优化
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 BitRL-Light利用1位量化LLM与深度强化学习,在边缘设备上实现智能家庭照明优化,达到显著能耗降低和高用户满意度。
Comments Presented as poster in IPCCC 2025 at Austin
人工智能时代本科生数学中的合成流畅性与认知卸载
专题命中 其他安全 :alignment(abstract)
AI总结 本研究探讨了AI时代本科生数学学习中认知卸载现象,发现作业与考试表现的对齐性下降,揭示了评估实践需重新思考。
人工还是艺术?LLMs在编程中是否会打破规则?
专题命中 其他安全 :alignment(abstract)
AI总结 本文研究了LLMs在不同提示条件下如何调整代码生成策略,发现测试可见性显著影响性能,测试驱动的细化成为主要适应策略。
超越权重适应:基于特征空间的域注入用于跨模态船舶重识别
机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) ; Key Laboratory of Big Data and Intelligent Robot, Ministry of Education, South China University of Technology(大数据与智能机器人教育部重点实验室)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出基于特征空间的域注入方法,解决跨模态船舶重识别中的模态差异问题,通过轻量级模型提升性能,实现SOTA效果。