Counterparty Modeling is Not Strategy: The Limits of LLM Negotiators
对手建模不是策略:大语言模型谈判者的局限
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨了大语言模型在多属性谈判中的表现,发现其能建模对手偏好但无法有效转化为战略谈判,最终协议受初始锚定影响大。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
对手建模不是策略:大语言模型谈判者的局限
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨了大语言模型在多属性谈判中的表现,发现其能建模对手偏好但无法有效转化为战略谈判,最终协议受初始锚定影响大。
视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解
机构 * University College London(伦敦大学学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。
MoleCode 解锁大型语言模型中的结构智能
机构 * Peking University Shenzhen Graduage School
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 MoleCode 通过引入图显分子语言,使大型语言模型能直接操作分子结构,提升分子推理、编辑、生成和分析任务的性能,尤其在结构受限场景下表现突出。
VideoSeeker:通过原生代理工具调用激励实例级视频理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Xiaohongshu Inc.(小红书公司) ; East China Normal University(华东师范大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 VideoSeeker通过整合代理推理与实例级视频理解任务,提升视频理解精度,实验表明其在实例级任务中比基线模型提升13.7%,超越GPT-4o和Gemini-2.5-Pro。
Comments Project Page: https://gaotiexinqu.github.io/VideoSeeker/
稳健的AI安全与对齐:一项西西弗斯式的努力?
机构 * CSD/ITL(计算机科学与技术实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文通过扩展哥德尔不完全性定理,探讨了AI安全与对齐的理论极限,并提出应对挑战的实践方法,揭示了AI系统认知推理的局限性。
Comments 17 pages, 1 figure. This version will appear in IEEE Security $ Privacy in June 2026
LLM-EDT: 基于大语言模型的跨领域序列推荐增强方法与双阶段训练
机构 * City University of Hong Kong Hong Kong China ; Xi'an Jiaotong University \& City University of Hong Kong Xi'an China ; University of Science ; Independent Researcher Beijing China ; Tsinghua University Beijing China ; City University of Hong Kong ; Xi'an Jiaotong University \& City University of Hong Kong ; Independent Researcher ; Tsinghua University
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出LLM-EDT,通过双阶段训练策略解决跨领域序列推荐中的领域不平衡和过渡问题,引入可转移物品增强器和领域感知配置模块,提升推荐效果。
VLMs 跟踪无需跟踪:诊断视觉路径跟随中的失败
机构 * Yonsei University(延世大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究VLMs在视觉路径跟随任务中的表现,发现其在面对局部相似干扰时易切换路径,揭示局部竞争导致的失败原因。
PSD: 推动扩散大语言模型的帕累托前沿:通过并行推测解码
机构 * Huawei Technologies(华为技术)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出PSD框架,通过并行推测解码提升推理效率与生成质量,在推理效率和生成质量之间取得良好平衡,达到每前向传递5.5倍的token处理速度。
Comments 16 pages
基于大语言模型的操纵性政治叙事检测
机构 * University of the Bundeswehr Munich(联邦国防军大学慕尼黑)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出一种检测和组织操纵性政治叙事的新框架,通过预处理过滤和无监督聚类识别出41个操纵性叙事集群。
Comments This paper has been submitted to the upcoming 18th International Conference on Advances in Social Networks Analysis and Mining (ASONAM 2026)
ShadowMerge:一种通过关系通道冲突的图基agent内存新型污染攻击
机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE)(可信分布式计算与服务重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhongguancun Laboratory(中关村实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ShadowMerge攻击,通过关系通道冲突攻击图基agent内存,利用冲突值影响agent行为,改进现有攻击方法,实现93.8%的攻击成功率。
Comments Preprint. Corresponding authors: Zifeng Kang and Tiantian Ji. Code is available at https://anonymous.4open.science/status/ShadowMerge-033C
视觉即理解:解锁因果注意力以实现模态互注意力用于多模态大语言模型
机构 * Sony Group Corporation, Tokyo, Japan(索尼集团,日本东京)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出模态互注意力机制,通过解锁因果注意力,提升多模态理解性能,无需额外参数,在12个基准测试中平均提升6.2%。
Comments ICML 2026. Code is available at https://github.com/sony/aki
EVA:针对对抗性攻击的多功能对齐编辑
机构 * ShanghaiTech University(上海科技大学) ; Sun Yat-sen University(中山大学) ; State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Tsinghua University(清华大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。
Comments IEEE TPAMI 2026
可争议的多智能体辩论与基于竞技场的论证计算用于多媒体验证
机构 * University of New Brunswick(新 Brunswick大学) ; University of Science, VNU-HCM(越南国家大学科学学院(VNU-HCM))
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种可争议的多智能体框架,结合多模态大语言模型、外部验证工具和基于竞技场的定量双极论证,以解决多媒体验证的透明性和可争议性问题。
Comments ACM ICMR 2026 Grand Challenge on Multimedia Verification
LEMON:通过反事实强化学习学习可执行多智能体编排
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 LEMON通过反事实强化学习生成可执行的多智能体编排规范,整合任务特定角色、定制职责、容量级别和依赖结构,提升多智能体系统解决方案质量和执行效率。
Comments Submitted to Neurips 2026
OmniDrop:通过查询引导的分层令牌剪枝实现多模态大语言模型
机构 * Samsung Research(三星研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出OmniDrop,通过查询引导的分层令牌剪枝方法,提升多模态大语言模型的效率与性能,实验表明其在多个音频视频基准测试中表现优异,减少预填充延迟和内存使用。
通过顺序证据累积实现LLM集成的自适应共识:自动预算识别和校准的承诺信号
机构 * Independent Researcher(独立研究员)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出DASE方法,通过顺序证据累积实现LLM集成的自适应共识,通过自动预算识别和校准承诺信号提升推理准确性。
大语言模型通过社会科学研究中的机构痕迹学习科学品味
机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨机构痕迹作为训练信号,帮助AI在低可验证性领域进行评估判断,通过八个社会科学学科的四层研究提案基准测试,验证了微调LLM在不同领域的准确率,最高达85.5%。
对OpenClaw AI代理框架的安全性分析
机构 * SUCCESS Lab(SUCCESS实验室) ; Texas A&M University(德克萨斯大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。
如何解释智能体行为
机构 * Johns Hopkins University(约翰霍普金斯大学) ; California Institute of Technology(加州理工学院) ; Northeastern University(东北大学) ; Purdue University(普渡大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。
Comments 34 pages in total
基于外部化攻击-防御共演的模型无关持续LLM安全
机构 * City University of Hong Kong(香港城市大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Wuhan University(武汉大学) ; Beihang University(北京航空航天大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。
Comments 48 pages, 7 figures
言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复
机构 * Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。
AgenticRecTune: 多智能体与自演化技能 hub 用于推荐系统优化
机构 * Google(谷歌)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AgenticRecTune框架,通过五个智能体实现端到端配置优化,利用LLM进行最优配置空间探索,结合自演化Skillhub提升推荐系统性能。
基于技能的视觉地理定位用于视觉-语言模型
机构 * Southwest Jiaotong University(西南交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhejiang University(浙江大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出GeoSkill框架,通过技能图进化提升视觉语言模型的地理定位能力与自我进化能力,实验显示其在GeoRC任务中表现优异,且在外部数据集上具有良好的泛化能力。
变换器中的几何事实回忆
机构 * New York University(纽约大学) ; Flatiron Institute(Flatiron研究所)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL
AI总结 研究探讨了变换器模型如何通过几何方式记忆事实关联,证明嵌入维度与事实数量呈对数关系,并展示了多跳查询中的容量-深度权衡。
Comments Preprint
通过答案可信度评分估计问题难度
机构 * University of Innsbruck(因斯布鲁克大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。
Comments Accepted at ACL 2026
Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)
语言模型对谁进行对齐?在高风险竞争需求下测量主导层级
机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) ; University of Oxford(牛津大学) ; Imperial College London(帝国理工学院伦敦分校)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨了在高风险专业场景中语言模型如何在用户、机构权威和专业规范之间进行对齐,发现模型在任务执行中常忽视专业规范,且对齐层级在不同领域和模型间不稳定。
OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。
原生AI资产智能
机构 * Sola Security(Sola安全)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出原生AI资产智能框架,通过结构化方法整合异构安全数据,实现一致、上下文感知和主动的资产推理。框架结合建模层和评分层,通过敏感性分析和消融研究验证其在资产优先级和安全态势推理中的有效性。
Comments 23 pages, 4 figures, 8 tables. Preprint
探测音频-视觉大语言模型中的跨模态信息枢纽
机构 * Department of Electrical Engineering, Korea Advanced Institute of Science ; The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。
Comments Accepted by ICML 2026
当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷
机构 * The University of Sydney(悉尼大学) ; Nanjing University(南京大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。