TCPO: Turn-Level Credit Policy Optimization
TCPO:回合级信用策略优化
机构 * Moore Threads AI(摩尔线程人工智能)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
TCPO:回合级信用策略优化
机构 * Moore Threads AI(摩尔线程人工智能)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。
智能体图令牌推理
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究提出智能体图令牌推理,将图令牌化融入推理过程,通过三阶段训练实现,在七个图领域评估中大幅优于基线,可零样本迁移至未见领域,推动图分析向智能体范式发展。
VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架
机构 * Peking University(北京大学) ; China Agricultural University(中国农业大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。
Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint
前沿视觉语言模型的心智理论跨任务解离
机构 * University of Maryland(马里兰大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究评估9个前沿VLM在两项心理学衍生ToM任务中的表现,发现其ToM特征存在跨任务解离,无模型在两项任务中均接近典型发展成人,推理可改善部分模型在导演任务中的表现。
KVerus:面向Rust代码的可扩展且高鲁棒性的形式化验证证明生成工具
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 KVerus是适配Rust代码的形式化验证工具,通过自适应范式与动态知识库,在单文件、仓库级基准及Rust内核验证中均优于现有方案,为形式化验证的规模化应用提供了关键进展。
Comments Accepted at ASE 2026
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
机构 * Alibaba Group(阿里巴巴集团)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。
Comments 29 pages
LUT:用于视觉推理的隐式效用训练
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
Vul4Py:利用配对漏洞利用与功能预言机对Python自动化漏洞修复进行基准测试
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出Vul4Py基准测试,含100个Python真实漏洞及配对预言机,对比三类AVR方法,发现智能体OpenHands修复漏洞数远超同类方法,配对预言机保障结果可信。
低资源东南亚语言中的原生多语言思维链推理
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。
Comments 22 pages, 16 figures, 12 tables
从单体到群体:多智能体Web系统转型中的攻击面演化研究
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文针对从单智能体到多智能体Web系统转型的安全问题,提出MAS攻击向量分类法,构建WebMASLab测试平台,发现新型电话环路攻击对多数前沿多智能体模型威胁显著,提示防御通用性有限,揭示多智能体架构的新型安全风险。
面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract_cn);language model(abstract_cn)
AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。
EcoTable: 数据湖中面向自然语言查询的经济高效的表集成
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 针对数据湖中表格格式多样导致ETL困难的问题,提出EcoTable框架,利用LLM的语义理解和复杂推理能力,通过图结构搜索和轻量级模型降低LLM调用成本,在4个基准数据集上准确率提升30%以上,成本降低5倍。
能否用视觉-语言模型评估城市衰败:以底特律为例
机构 * School for Environment and Sustainability(环境与可持续发展学院) ; School of Information(信息学院) ; University of Michigan(密歇根大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 本研究以底特律为案例,提出基于开源大视觉-语言模型的多视角住宅衰败评估框架,经实验验证该框架可低成本跟踪住房状况,为传统调查提供补充。
Comments 19 pages, 11 figures
判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏
机构 * University of Macau(澳门大学) ; South China University of Technology(华南理工大学)
专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI
AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。
Comments 53 pages, 14 figures, 26 tables
PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI
AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。
Comments Accepted in Interspeech 2026
MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现
专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI
AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。
Comments Project page: https://mvhoi.hirotong.fun
AdaThink-Med:通过不确定性量化优化医学推理的推理时计算
机构 * SJTU(上海交通大学) ; SII(上海信息所) ; Shanghai AI Lab(上海人工智能实验室) ; FDU(复旦大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出AdaThink-Med框架,通过不确定性引导长度校准优化医学推理的推理时计算,在六大医学基准上降低4.7-6.4倍推理token消耗且性能损失极小,无需外部分类器即可实现资源高效分配。
用于通用符号推理的递归视觉语言模型
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。
机器人中的基础模型:方法、模型、数据集、挑战及未来研究方向的全面综述
机构 * Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗科比欧大学)
专题命中 推理与问题求解 :foundation model(title,abstract)
AI总结 本文综述了机器人中基础模型的发展,涵盖方法、模型、数据集、挑战及未来方向,分析了不同阶段的研究演变及关键方面。
Journal ref Transactions on Machine Learning Research (TMLR), 07/2026
SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Texas A&M University(德克萨斯大学) ; Smart Information Flow Technologies (SIFT)(智能信息流技术公司) ; Kudu Dynamics(Kudu动态公司) ; Microsoft(微软)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。
Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)
Journal ref USENIX Security 2026
ParticleGen:用于粒子效果生成的多智能体系统
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出多智能体框架ParticleGen,可从自然语言描述合成结构化可编辑粒子系统,经Unreal Engine 5的Niagara系统多场景验证,能降低创作门槛、提升迭代效率。
TRACE-TS:面向人类活动理解的归因基础且可追踪的传感器-语言推理
专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有传感器-语言推理与信号关联弱、解释不可靠的问题,提出TRACE-TS框架,通过专家归因识别关键传感器区域并构建可追踪推理轨迹,在7个可穿戴基准上实现最优性能。
Comments 24 pages, 9 figures, 24 tables
自然语言数学证明的高性价比自动评判
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究以 IMO-GradingBench 为基准,验证 GPT-OSS 120B 等三个低成本模型作为数学证明评判器的效果,发现全票通过规则的低成本方案与前沿模型效果相当,成本低达 100 倍。
Comments 7 pages, 5 figures, 4 tables
Otap:用于评估智能体轨迹中规划与执行的结构感知最优传输
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究智能体轨迹评估问题,将其重新定义为执行图与有效解决方案图的距离,通过不平衡融合Gromov-Wasserstein传输问题实例化得到\otap{}分数,该分数可区分有效与无效轨迹,对保持依赖的重新排序不变且对冗余步骤有界敏感。
LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准
机构 * The University of Hong Kong(香港大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。
用于Transformer的黎曼注意力机制:理论框架与架构设计
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对Transformer自注意力栈的秩双指数衰减问题,提出用逐token黎曼度量替代欧几里得度量的理论框架,设计纤维丛Transformer架构,推导相关理论预测并明确核心开放问题。
Comments 23 pages, theoretical paper
AdaMTP:一种面向多令牌预测的自适应训练范式
机构 * City University of Hong Kong(香港城市大学) ; Huawei Technologies(华为技术有限公司) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学) ; Peking University(北京大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 AdaMTP是适配序列内在可预测性的自适应MTP训练范式,通过熵算法划分语义边界抑制噪声梯度,在三类主干模型的多任务基准中均优于标准MTP,兼具性能与推理速度优势。
Pro²Assist:面向长程流程任务的、基于多模态自我中心感知的步骤感知主动式辅助系统
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出Pro²Assist,一种基于多模态自我中心感知的步骤感知主动式辅助系统,通过AR眼镜感知与持续推理提升长程流程任务辅助效果,在动作理解与主动时机准确率上优于基线,获多数用户认可。
Comments To appear in IMWUT'26
MechGeo:在Lean 4中自动形式化与证明欧几里得几何
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。
Comments 43 pages
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。