On the Threat Model of Weird Generalization and Emergent Misalignment
怪异泛化与涌现失配的威胁模型研究
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 本文研究怪异泛化(WG)的威胁模型,发现WG程度依赖数据集组成、语言及评估问题集,预训练熟悉数据的WG程度更高,认为WG是需谨慎数据工程的对抗性威胁。
高校专区
怪异泛化与涌现失配的威胁模型研究
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 本文研究怪异泛化(WG)的威胁模型,发现WG程度依赖数据集组成、语言及评估问题集,预训练熟悉数据的WG程度更高,认为WG是需谨慎数据工程的对抗性威胁。
AnaDiffusion:用于可控3D脑部MRI生成的解剖学组成式潜在扩散模型
机构 * Stanford University(斯坦福大学) ; Texas A&M University(德克萨斯农工大学) ; University of Minnesota(明尼苏达大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Johns Hopkins University(约翰霍普金斯大学) ; UTHealth Houston(休斯顿健康科学中心) ; Stony Brook University(纽约州立大学石溪分校)
AI总结 AnaDiffusion是一种解剖学组成式潜在扩散框架,通过分解3D脑部MRI生成为解剖区域并组装细化,在ADNI测试集上实现低FID与高Cohen's d值,支持无需密集分割图的可控部分编辑。
面向多智能体计算机使用的脊柱-分支协调机制
机构 * Scale AI ; Johns Hopkins University(约翰斯·霍普金斯大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
AI总结 该研究针对多智能体计算机使用中虚拟机状态无法合并的瓶颈,提出Spine-Branch协调框架,在200项长视距任务上提升成功率6.0%-16.5%、降低成本34%-70%,实现高效扩展。
权重中遗忘,工具中恢复:面向大语言模型智能体的智能体工具遗忘
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Notre Dame(圣母大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; Northwestern University(西北大学) ; MIT(麻省理工学院)
AI总结 该研究针对大语言模型智能体的工具介导恢复问题,提出两阶段的Agentic Tool Unlearning框架,在RWKU和MUSE数据集上实现了更好的遗忘与保留效用平衡。
引用在偏好数据中的作用
机构 * University of Maryland(马里兰大学) ; Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 本文在科学问答场景下,通过混合效应模型研究引用对人类与四个开源LLM偏好的影响,发现人类偏好多样且数量少的引用,LLM也有相关偏好,还探讨了对偏好数据收集的启示。
手术视频中稀疏功能标志点定位的密集结构先验
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出利用SAM 3作为结构先验,通过零样本点提示掩码和轻量级精炼框架,在无像素级标注下实现手术视频中功能标志点定位,F1达72.4%(尖端)和58.0%(锚点)。
非线性单变量模型的条件回归
机构 * Department of Mathematics Johns Hopkins University(数学系约翰霍普金斯大学)
AI总结 本文提出了一种非参数条件回归估计器,用于非线性单变量模型,通过投影到曲线参数来避免维度诅咒,达到最优回归速率。
Comments 75 pages, 13 figures