Alignment has a Fantasia Problem
对齐存在幻想问题
AI总结 该研究指出指令微调AI因不理解人类认知过程会产生幻想交互,剥夺用户任务自主权,进而提出需重新思考对齐研究,优化交互中认知责任分配并规划了相关研究议程。
Comments 10 pages, 2 figures
Journal ref ICLR 2026 Workshop HCAIR
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
对齐存在幻想问题
AI总结 该研究指出指令微调AI因不理解人类认知过程会产生幻想交互,剥夺用户任务自主权,进而提出需重新思考对齐研究,优化交互中认知责任分配并规划了相关研究议程。
Comments 10 pages, 2 figures
Journal ref ICLR 2026 Workshop HCAIR
减少信息依赖不会导致训练数据隐私泄露。对抗性非鲁棒特征才会
机构 * Dartmouth College(达特茅斯学院) ; Breuer Lab(布鲁尔实验室)
AI总结 挑战信息依赖导致训练数据隐私泄露的观点,通过三个结果揭示对抗性非鲁棒特征才是原因,引入反对抗训练建立因果关系并揭示隐私-鲁棒性权衡,修正对训练数据暴露的理解。
Comments In The Fourteenth International Conference on Learning Representations (ICLR'26), 2026
通过意图意识提升带有属性的长形式问答
机构 * Allen Institute for AI(艾伦人工智能研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。
Comments 39 pages, 7 figures
Journal ref ICLR 2026
通过分布匹配和分布式互换干预实现忠实的双向模型引导
AI总结 本文提出Concept DAS (CDAS)方法,通过分布匹配和分布式互换干预实现模型引导,改进了传统方法的过拟合问题,提高了引导的准确性和稳定性。
Comments camera ready version; 55 pages, 25 figures; accepted for ICLR 2026
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
融合傅里叶增强特征的物理信息神经网络迭代训练
机构 * Division of Decision and Control Systems(决策与控制系统 division) ; Digital Futures(数字未来) ; KTH Royal Institute of Technology(皇家理工学院)
AI总结 针对PINNs训练的频谱偏差问题,提出IFeF-PINN算法,通过随机傅里叶特征丰富潜在空间,经理论证明与实验验证,该算法在经典基准问题上性能优于现有最优算法。
Comments Accepted at ICLR 2026. 27 pages, 11 figures