Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis
结合三维骨架提取与语言分析的多模态植物根表型分析
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
结合三维骨架提取与语言分析的多模态植物根表型分析
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。
SUV:将未来场景理解建模为视频生成的端到端驾驶
专题命中 视觉空间推理 :planning(abstract)
AI总结 SUV是将未来场景理解建模为视频生成的端到端驾驶框架,其在NAVSIM-v2和WOD-E2E基准上优于近期SOTA方法,实现了更优的轨迹规划性能。
Comments 16 pages, 5 figures. Code: https://github.com/ASH-2046/SUV
基于全局图验证的VLM驱动3D室内场景生成优化
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 该研究针对VLM驱动3D室内布局生成中全局一致性与物理可行性不足的问题,提出结合GSV与GPFS的混合策略,实现了该任务的当前最优性能。
Comments 15 pages, 8 figures
自引导防御:通过合成指南实现推理模型的自适应安全对齐
机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) ; Beijing Jiaotong University(北京交通大学) ; School of Information Technology and Management(信息科技与管理学院) ; University of International Business and Economics(国际经济贸易大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SGASA框架,通过合成指南实现推理模型的自适应安全对齐,提升对抗性提示防御能力并减少对良性请求的拒绝。
PAMT:面向多领域机器翻译的过程对齐强化学习
专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL
AI总结 针对多领域机器翻译中显式推理的偏差问题,提出过程对齐强化学习框架PAMT,结合长思维链监督与多维度奖励机制,在多种场景下表现优于基线模型。
Comments 23 pages, 10 figures, and 18 tables
推理分歧之处:本地化多智能体辩论
机构 * The Chinese University of Hong Kong(香港中文大学) ; Nagoya University(名古屋大学) ; Institute of Science Tokyo(东京科学大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 测试时计算 :reasoning(title);分类 cs.AI
AI总结 针对多智能体辩论冗余交换完整推理轨迹的问题,提出LMAD协议,通过定位冲突并限制辩论范围,在十个骨干模型上实现宏平均评判准确率提升7.20个百分点。
测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。
面向大语言模型测试时缩放的可解释自适应采样
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对LLM测试时推理的固定计算预算不灵活、不可解释的问题,提出带轻量级模糊控制器的自适应采样方法,在问答和数学任务上提升性能并减少平均采样数,为高效测试时推理提供实用方向。
MutMem:持久智能体内存中的密码学授权突变
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 本研究针对持久智能体内存的授权与防篡改问题,提出HOM-AIMOS中的MutMem协议,经实验验证其在多个基准任务中表现良好,可有效抵御中毒攻击。
Comments https://github.com/wallidsaydi-creator/HOM-AIMOS. 32 Pages
MDArena:面向真实分子动力学工作流的编码智能体评估基准
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。
Comments 17 pages including appendices, 4 figures
通过端到端评估应用层行动证据发现Project Veraison的TPM参考方案中存在的挑战随机数新鲜度缺口
专题命中 测试时计算 :verifier(abstract)
AI总结 本文发现Project Veraison的TPM参考方案存在挑战随机数新鲜度缺口,通过端到端测试验证修复方案,使重放Quote的评估结果变为否定,提升了RATS架构的安全性。
Comments 18 pages, 3 figures. Responsible disclosure: veraison/services#427, fixed in PR #432. Artifact and data: doi:10.5281/zenodo.20998730
CURV:通过课程可视化接地推理增强图表理解
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。
TurnSight:面向工具集成推理的回合级事后自蒸馏方法
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。
PI-Mem:通过并行迭代式记忆将长上下文推理推向360万 tokens
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出PI-Mem并行迭代记忆机制,在360万 tokens长上下文下,使Qwen系列模型在HotpotQA基准上较循环记忆基线实现准确率提升与推理加速,打破长上下文推理的准确率-效率权衡。
ReflectRL:通过反思到直接推理从优质负轨迹中学习
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。
Comments Project page: https://github.com/bibisbar/ReflectRL
CLEAR:基于因果上下文的智能体推理漏洞检测
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 该研究针对现有漏洞检测方法无法捕捉漏洞复杂因果依赖的问题,提出CLEAR多智能体框架,通过构建VCKG并结合四类智能体协同推理,在C/C++和Java基准上性能显著优于现有最优方法。
元数据推理的代理方法
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 本文提出元数据推理代理,通过检索候选表和自主咨询元数据,有效筛选数据源。在KramaBench和合成基准测试中,其在数据选择和避免低质量数据方面表现优异。
形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦
机构 * Islamic University of Technology(伊斯兰科技大学)
专题命中 复杂问题求解 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL
AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。
Comments 15 pages, 6 figures
知止:用于减少过度思考的片段级信用分配
机构 * Capital One(第一资本)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 提出DASH方法,通过将推理轨迹中的最终答案候选与真实值比较,实现片段级信用分配,减少推理语言模型过度思考行为,在AIME25上准确率达50.8%。
对抗性快速变化的真实世界领域:用于基准测试AI科学家能力的测试床
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出以F1、MTG等对抗性快速变化的真实世界领域为测试床,发现AI科学家的核心能力差距是想法过滤、优先级排序而非生成。
Comments Accepted at the AI for Science workshop at ICML 2026. 14 pages, 11 figures
SphUnc:通过信息几何的超球面不确定性分解与因果识别
机构 * University of Macau(澳门大学) ; Fudan University(复旦大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Renmin University of China(中国人民大学) ; Hanyang University(翰阳大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Liverpool(利物浦大学) ; Southeast University(东南大学) ; Central South University(中南大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SphUnc结合超球面表示学习与结构因果建模,通过信息几何融合分解不确定性为epistemic和aleatoric成分,并通过样本模拟实现因果识别,提升多智能体系统中的预测准确性和不确定性校准能力。
Comments 22 pages, 15 figures
FLARE:基于小样本学习的自适应反思引擎
机构 * Microsoft(微软)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出FLARE框架,利用小样本学习与反思机制优化指令,在多基准任务中优于GEPA,数据效率更高且稳定性更强,凸显小样本学习策略优化对提升LLM性能的重要性。
SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。
基于本体引导和流程感知FMEA图学习结合大语言模型的跨生产线故障原因识别
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 该研究针对跨生产线故障原因识别难题,提出OGPAL框架,结合LLM与RGCN实现FMEA知识复用,在汽车压力传感器装配线案例中性能优于基线方法。
通过多路径推理和反馈驱动优化实现自动化可视化代码合成
机构 * AI Research, Enhans, Seoul, South Korea Innovation \& Technology, KAIST, Daejeon, South Korea Department of Computer Science, University of California, Berkeley, CA, United States Department of Electrical
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 VisPath通过多路径推理和反馈驱动优化,提升自动化可视化代码生成的可靠性与准确性。
Comments Accepted by International Conference on Pattern Recognization (ICPR 2026)
Journal ref Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science, vol 16812. Springer, Cham
危险的业务:测量忠实度与安全性之间的张力
专题命中 推理评测 :reasoning(abstract,abstract_cn);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对大型推理模型中忠实度与安全性的张力,构建HazMart数据集,提出TRR技术,发现QwQ-32B的反相关内部方向,并通过表征引导提升安全行为9个百分点。
推理大语言模型中的测试时缩放:推理机制、评估与可复现性
专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对推理大语言模型的测试时缩放,明确三种推理机制,提出系统评估原则与可复现性要求,应用于多类基准并发布超20亿条推理轨迹。
更短的推理,更早的答案?对推理接口的评估
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究评估大型语言模型的推理接口,测试提示词和训练设置对推理长度、准确率的影响,发现早答指令和低 effort 推理在特定 token 限制下可提升部分数据集准确率,需综合报告多维度评估指标。
Comments 52 pages, 13 figures, 30 tables
过滤推理得分:在模型最自信的轨迹上评估推理质量
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出过滤推理得分,用于评估模型推理质量,区分相似准确率的模型,并提高对输入提示和生成配置变化的鲁棒性。
Comments Accepted at the Conference on Language Modeling (COLM) 2026. Camera-ready version
超越准确率:大型语言模型统计推理的多维度评估
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究结合多维度分析框架评估15款LLMs的统计推理,发现仅用准确率无法全面描述其统计推理能力,且存在厂商专属解释风格差异。
Comments 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication