The Cold-Start Safety Gap in LLM Agents
LLM智能体中的冷启动安全差距
机构 * University of California, San Diego(加州大学圣地亚哥分校)
AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。
Comments Accepted to EMNLP2026 Main
高校专区
LLM智能体中的冷启动安全差距
机构 * University of California, San Diego(加州大学圣地亚哥分校)
AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。
Comments Accepted to EMNLP2026 Main
大语言模型如何扭曲我们的书面语言
机构 * UC Berkeley(加州大学伯克利分校) ; UC San Diego(加州大学圣地亚哥分校) ; University of Washington(华盛顿大学) ; Zaytuna College(扎亚图纳学院) ; Google DeepMind(谷歌DeepMind)
AI总结 研究揭示大语言模型不仅改变写作语气,还持续改变写作本意,通过用户研究和数据集分析发现,即使在专家反馈下,LLM仍会显著改变文本语义,影响科学机构和文化。
Think3D: 基于空间的思考以实现空间推理
机构 * Dalian University of Technology(大连理工大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Oxford(牛津大学)
AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。
一个非常大的视频推理套件
机构 * University of California, Berkeley(加州大学伯克利分校) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学) ; University of Tübingen(图宾根大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Michigan(密歇根大学) ; University of Southern California(南加州大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Cornell University(康奈尔大学) ; San Jose State University(圣何塞州立大学) ; University of California, Irvine(加州大学尔湾分校) ; Technical University of Munich(慕尼黑技术大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; Imperial College London(伦敦帝国学院) ; University of Wisconsin--Madison(威斯康星大学麦迪逊分校) ; University of Edinburgh(爱丁堡大学) ; Hong Kong University of Science(香港科学大学) ; New York University(纽约大学) ; Auburn University(阿伯丁大学) ; Columbia University(哥伦比亚大学) ; University of Bristol(布里斯托大学) ; University of Waterloo(滑铁卢大学) ; The Chinese University of Hong Kong(香港中文大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Oxford(牛津大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。
Comments Homepage: this https URL (https://video-reason.com/?v=vbvr)
DeepPlanner:通过优势塑造提升深度研究智能体的规划能力
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Amazon(亚马逊) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 针对现有深度研究智能体规划阶段优化不足的问题,提出端到端 RL 框架 DeepPlanner,通过塑造 token 级优势与选择性提升样本级优势,在7个基准上以更低训练预算实现最优规划效果。
Comments Accepted by ACL 2026