TRACE: Task-Aware Adaptive Self-Evolving Agentic Jailbreaking
TRACE: 任务感知的自适应自我进化代理越狱
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 提出TRACE框架,通过任务分解、场景伪装和Q学习进化,实现LLM代理的高效越狱,在AgentHarm和AdvCUA上达到最高100%绕过率。
Comments 16 pages, 7 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
TRACE: 任务感知的自适应自我进化代理越狱
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 提出TRACE框架,通过任务分解、场景伪装和Q学习进化,实现LLM代理的高效越狱,在AgentHarm和AdvCUA上达到最高100%绕过率。
Comments 16 pages, 7 figures
MuCRASP: 多模态思维链推理感知的结构化剪枝
机构 * Indian Institute of Technology, Kharagpur(印度理工学院,哈里科普尔)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对视觉语言模型在结构化剪枝后思维链推理准确性下降的问题,提出MuCRASP框架,通过识别推理关键令牌并保持跨模态对齐,在压缩下维持推理质量。
Comments Preprint ver. 2
推理密集型回归
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 针对推理密集型回归任务,提出MENTAT方法,结合批量反思提示优化与神经集成学习,在基准测试中相比基线提升高达65%。
ReGuLaR:面向大型视觉语言模型的基于关系的潜在推理
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 提出ReGuLaR框架,通过训练时的ReGFormer将潜在推理显式地锚定在视觉证据中的对象和关系上,在多种基准上取得最优性能。
VLM-GLoc:视觉语言模型增强的蒙特卡洛定位,用于杂乱准静态环境中的鲁棒语义全局定位
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 提出VLM-GLoc方法,利用开放词汇视觉语言模型作为统一语义观测前端,通过逆语义提议机制和文本到地图检索,在几何模糊和语义歧义的准静态环境中实现鲁棒全局定位。
MultiPriv: 视觉语言模型中个体级隐私推理的基准测试
机构 * Xidian University(西安电子科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 针对视觉语言模型通过层次化链式推理关联多模态数据识别个体的隐私风险,提出首个系统评估个体级隐私推理的基准MultiPriv,包含隐私感知与推理框架、双语多模态数据集和九项挑战任务,对50多个开源和商业模型评估发现60%的模型能以高达80%的准确率进行个体级隐私推理。
GSAM: 一种通用且安全的铰接物体操作机器人框架
机构 * College of Computer Science, Chongqing University, Chongqing, China(重庆大学计算机学院) ; Lumos Robotics, China(Lumos机器人中国) ; Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) ; Fudan University, China(复旦大学) ; Department of Information Engineering and Computer Science, University of Trento, Trento, Italy(特伦托大学信息工程与计算机科学系)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI
AI总结 提出GSAM框架,通过视觉感知器生成运动学参数、基于VLM的细调器进行常识推理修正、交互约束函数生成器集成障碍物避免知识,并由运动学感知规划器验证轨迹可达性,在50个铰链任务上相比最佳基线将标准差降低3.1%、操作成功率提升36.0%。
Comments Accepted by the 19th International Conference on Parallel Problem Solving from Nature (PPSN 2026)
OBLIQ-Bench:揭示现代检索器中被忽视的瓶颈——潜在与隐式查询
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 针对现有检索基准饱和但实际搜索问题未解决的现象,提出一类“倾斜查询”并构建OBLIQ-Bench基准,揭示检索与验证之间的不对称性,即推理LLM能可靠识别潜在相关性但检索管道无法召回多数相关文档。
面向方面情感三元组抽取的诊断推理监督细粒度验证
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Lingnan University(岭南大学) ; Education University of Hong Kong(香港教育大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出FiVeD框架,通过诊断推理监督进行细粒度验证,利用质量评分和错误分类等辅助任务提升ASTE三元组抽取的可靠性。
Comments 25 pages, 13 figures, and 6 tables
编译以压缩:通过编译器输出提升形式定理证明器
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 利用编译器将大量证明尝试压缩为结构化失败模式,提出一种学习-精炼框架,通过树搜索基于验证器反馈局部修正错误,在可比测试时预算下在PutnamBench上达到最先进性能。
学习适应:通过认知感知探索实现自我改进的网络智能体
机构 * Zhejiang University(浙江大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出SCALE框架,利用选择器、预测器和评判器三个对抗角色,通过环境探索自主发现智能体局限性并扩展认知边界,结合SCALE-Hop图探索策略和SCALE-20k数据集,显著提升多模态大语言模型在多种网络环境中的性能和泛化能力。
Comments 24 pages
任意场景检测:一种具有经验感知推理的目标检测智能体框架
机构 * Keio University(Keio大学) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出DetAS/DetAS-X智能体框架,利用多模态大语言模型自适应组合恢复模块和专用检测器,通过自进化经验积累实现经验感知推理,在六个基准上平均F1提升28.36%。
LLMs 对中文零代词的了解程度如何?
机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北省人工智能与智能学习重点实验室) ; National Language Resources Monitoring and Research Center for Network Media(网络媒体语言资源监测与研究中心) ; School of Computer Science, Central China Normal University(中央财经大学计算机学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 通过一系列语言学动机任务(识别、指称性分类、指称类型分类、消解和翻译),系统评估了大型语言模型处理中文零代词的能力,发现当前LLMs在零代词处理上仍面临巨大挑战,尤其在识别和指称性分类等上游任务上表现不佳。
MoG:用于基于图的检索增强生成的混合专家模型
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Monash University(墨尔本大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出MoG框架,通过组织知识为中心枢纽图和稀疏激活的专家图,利用拓扑感知路由器动态选择相关专家图,以解决检索增强生成中统一知识库引入无关信息的问题,在MuSiQue上相对提升超过20%。
SLAT:面向高效CoT推理的段级自适应修剪
机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能学院,香港理工大学) ; The Hong Kong Polytechnic University-Daya Bay Technology and Innovation Research Institute, Huizhou,Guangdong Province, China(香港理工大学大亚湾科技与创新研究院,广东惠州市) ; The Hong Kong Polytechnic University Shenzhen Research Institute, Shenzhen, China(香港理工大学深圳研究院,深圳)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出段级自适应修剪框架SLAT,通过强化学习选择性抑制低边际效用的高概率冗余段,在保持准确率的同时将推理长度减少50%。
使用RAG支持的跨模型多数投票工作流评估ChatGPT在生物医学关联生成与验证中的协议
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出一个协议,通过RAG和跨模型多数投票工作流评估ChatGPT生成疾病中心生物医学关联的能力,并验证其可靠性。
Comments Main Manuscript and Supplementary Information. Both are equally important
Journal ref STAR Protocols, 2026; 7
面向长程可解释性:高效且忠实的多Token归因用于推理大语言模型
机构 * Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(香港城市大学计算机科学系) ; Harbin Institute of Technology, Harbin, China(哈尔滨工业大学)
专题命中 推理与问题求解 :LLM(abstract_cn);language model(abstract);分类 cs.LG
AI总结 提出FlashTrace方法,通过跨跨度聚合和递归归因机制,在长上下文推理中实现高效且忠实的多Token归因,速度提升超130倍。
Comments Accepted as an Oral paper at ICML 2026. Code available at https://github.com/wbopan/flashtrace
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中
机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) ; Independent Researcher(独立研究者) ; University of Science and Technology of China(中国科学技术大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。
Comments Accepted by ICML 2026
推进大型多模态模型中的创造性物理智能
机构 * UIUC(伊利诺伊大学香槟分校) ; Amazon(亚马逊)
专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大型多模态模型在开放式环境中缺乏基于视觉的创造性工具使用能力的问题,提出MM-CreativityBench基准和基于偏好学习的具身对齐方法,显著提升实体选择并减少幻觉。
Comments 51 Pages, 9 Figures, 7 Tables, Previous Work CreativityBench: arXiv:2605.02910
有效推理链降低内在维度
机构 * Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过内在维度量化推理链有效性,发现有效推理策略能降低任务内在维度,并在GSM8K上验证其与泛化性能的强负相关。
Comments ICML (spotlight) camera-ready; 22 pages, 3 figures
位置注意力头与符号注意力头:学习动态、RoPE几何和长度泛化
机构 * CENIA & Faculty of Mathematics UC Santiago(CENIA与圣托里尼大学数学系) ; IMC UC & CENIA Santiago(UC IMC与圣托里尼CENIA)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 通过控制实验研究Transformer注意力头在位置推理和符号推理任务中的学习动态,发现位置和符号注意力头的不同机制及其对长度泛化的影响。
SpatialAct:探测VLM智能体在3D场景中的空间推理到行动能力
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学) ; Helsinki University(赫尔辛基大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SpatialAct基准,通过多轮交互细化、单步错误检测与修复等任务,揭示当前视觉语言模型在3D场景中从空间推理到行动存在显著差距。
Rationalize: 人机对齐的共享语义推理
机构 * New Jersey Institute of Technology(新泽西理工学院)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出Rationalize角色对框架,通过共享推理空间中的互补角色对(如探索者-引导者)实现人类与AI在数据驱动意义建构中的语义对齐,并设计元素级和角色特定的对齐评估方法。
Comments Accepted by ACM CHI 2026 BiAlign Workshop
看见不等于知道:视觉语言模型是否知道何时不回答空间问题(以及为什么)?
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Google Research(谷歌研究)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 针对视觉语言模型在空间推理中过度自信回答的问题,提出SpatialUncertain框架,通过遮挡和视角歧义两种挑战,评估模型是否知道何时应弃权以及如何寻找可靠证据。
Comments Website: https://zhangyuejoslin.github.io/spatialuncertain/
多轮多智能体对话用于协作重建仅略微提升VLM在空间推理上的性能
机构 * Computational Linguistics, Department of Linguistics University of Potsdam(语言学计算系,语言学系 柏林洪堡大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 研究通过多轮多智能体对话框架评估视觉语言模型在协作空间推理任务中的表现,发现视觉空间理解仍是主要瓶颈,文本表示和分解图像表示可部分提升性能。
Comments Preprint
关注证据:面向多模态RLVR的证据锚定空间注意力监督
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Nankai University(南开大学) ; Shanghai Jiaotong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。
面向深度研究的规划器中心强化学习与结构感知奖励
机构 * National University of Singapore(新加坡国立大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI
AI总结 提出DecomposeR框架,通过将研究计划表示为有向无环图(DAG)并采用两阶段强化学习(规划器RL和回答器RL),实现显式结构化规划与细粒度奖励分配,在长文本基准上提升5.1-8.0分。
思维链与压缩循环Transformer:记忆预算分离
机构 * Department of Mathematics and Statistics(数学与统计学系)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG
AI总结 本文通过比较三种记忆机制(压缩潜在循环、全序列状态循环和思维链暂存区),证明压缩循环Transformer的记忆预算限制其推理能力,而思维链通过扩展上下文实现更强的问题求解。
NGDBench:迈向神经图数据管理
机构 * HKUST(香港理工大学) ; Beijing Institute of Technology(北京理工大学) ; Hong Kong Baptist University(香港 Baptist 大学) ; Guangdong University of Technology(广东技术大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI
AI总结 针对现有数据管理系统在噪声、不完整和动态更新下缺乏隐式结构发现和推理能力的问题,提出NGDBench基准,通过统一结构化与非结构化来源的图视图,评估神经查询方法在噪声和动态状态跟踪中的表现。
面向仇恨视频检测的推理感知多模态融合
机构 * Multimodal Intelligence Lab(多模态智能实验室) ; Department of Computer Science(计算机科学系) ; University of Exeter(埃克塞特大学) ; School of Computer Science(计算机科学学院) ; University of Leeds(利兹大学) ; School of Computer Science and Informatics(计算机科学与信息学学院) ; University of Liverpool(利物浦大学) ; University of Birmingham(伯明翰大学) ; Machine Intelligence + x Group(机器智能+X小组)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出推理感知多模态融合框架,通过局部-全局上下文融合和语义交叉注意力实现多模态交互,并引入对抗推理生成互补语义视角,在仇恨视频检测中提升Macro-F1和召回率3%和7%。
Comments Accepted at Transactions on Machine Learning Research (TMLR)