Dissociating the Internal Representations of Sycophancy in LLMs
区分大语言模型中谄媚行为的内部表征
AI总结 研究大语言模型谄媚行为,将其表征分为事实和观点子类型,通过训练线性探针等方法评估不同模型对两子类型表征差异,为研究复杂模型行为表征结构提供了新框架。
Comments Accepted to Mechanistic Interpretability Workshop at ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
区分大语言模型中谄媚行为的内部表征
AI总结 研究大语言模型谄媚行为,将其表征分为事实和观点子类型,通过训练线性探针等方法评估不同模型对两子类型表征差异,为研究复杂模型行为表征结构提供了新框架。
Comments Accepted to Mechanistic Interpretability Workshop at ICML 2026
基于最优传输势的多边缘流匹配
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种利用动态最优传输势引导流匹配学习中间边缘分布的方法,实现高效无模拟的多边缘流匹配,在单细胞RNA测序、海洋学和气象数据集上取得最优性能。
Comments 9 pages, 3 figures, 4 tables, and a 27 page appendix. Accepted to the Forty-Third International Conference on Machine Learning
通过Kronecker预条件优化实现多物理场物理信息神经网络的耦合鲁棒精度
机构 * Dept. of Control and Instrumentation Engineering, Korea University, Sejong, South Korea(控制与仪器工程系,韩国大学,世宗,韩国) ; BK21 FOUR Smart Mobility Education and Research Team, Korea University, Sejong, South Korea(BK21 FOUR智能交通教育与研究团队,韩国大学,世宗,韩国)
AI总结 针对多物理场耦合PINN在强耦合下精度退化问题,通过神经正切核分析证明标准NTK谱半径随耦合强度γ呈Ω(γ²)增长,而块对角Gauss-Newton预条件使谱半径有界于网络数S,结合Kronecker预条件优化器SOAP与逆梯度范数损失平衡实现耦合鲁棒精度。
Comments Extended version of AI4Physics Workshop accepted paper (ICML 2026)
基于理论的评估揭示了LLM个性化中的作者身份差距
机构 * April 2026(2026年4月)
AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。
Comments Accepted at CTB Workshop, ICML 2026
BAT:基于大语言模型的空间声音推理学习
AI总结 该研究提出结合Spatial-AST与LLaMA-2 7B的BAT模型,通过合成数据集训练,实现了超越SELD任务的空间声音感知与推理,展现了LLM在空间音频领域的应用潜力。
Comments Accepted to ICML 2024. Our demo, dataset, code and model weights are available at: this https URL (https://zhishengzheng.com/bat)