PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction
PTP:基于前序令牌预测的大语言模型反演方法,用于近精确提示重构
机构 * IIT Bombay(印度理工学院孟买分校) ; Adobe Research(奥多比研究中心)
AI总结 提出PTP方法,在黑盒场景下从零训练逆语言模型,通过前序令牌预测实现近精确提示重构,泛化性与迁移性良好,性能优于现有LLM反演工作。
大厂专区
PTP:基于前序令牌预测的大语言模型反演方法,用于近精确提示重构
机构 * IIT Bombay(印度理工学院孟买分校) ; Adobe Research(奥多比研究中心)
AI总结 提出PTP方法,在黑盒场景下从零训练逆语言模型,通过前序令牌预测实现近精确提示重构,泛化性与迁移性良好,性能优于现有LLM反演工作。
它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量
机构 * UC Merced(加州大学默塞德分校) ; UC San Diego(加州大学圣迭戈分校) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Adobe Research(奥多比研究院)
AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。
Comments 13 pages, 3 figures
从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励
机构 * Duke University(杜克大学) ; Adobe Inc.(奥多比公司) ; Oregon State University(俄勒冈州立大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊)
AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。
Comments COLM 2026
CompoSE:通过部分感知控制进行3D形状的组合合成与编辑
机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) ; Adobe Research(Adobe研究)
AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。