Large reasoning models for abnormal situation management in safety-critical industrial processes
面向安全关键工业过程异常状况管理的大型推理模型
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究提出通用大型推理模型,通过有界经程序验证的动作接口管理安全关键工业过程的异常状况,在39种异常测试中表现优于基础调节控制,可实现无需人类参与的运行时异常状况管理。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向安全关键工业过程异常状况管理的大型推理模型
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究提出通用大型推理模型,通过有界经程序验证的动作接口管理安全关键工业过程的异常状况,在39种异常测试中表现优于基础调节控制,可实现无需人类参与的运行时异常状况管理。
CAViAR:用于真实场景细粒度事故推理的因果视频数据集
机构 * NEC Laboratories, America(美国NEC实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。
Comments Accepted to ECCV 2026 Workshop DriveX
UVLM:一种通用视觉-语言模型加载器,用于可重复的多模态基准测试
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 UVLM提供统一接口加载和基准测试多种视觉-语言模型架构,支持LLaVA-NeXT和Qwen2.5-VL,通过抽象差异实现一致评估,具备多任务提示构建、共识验证和灵活token预算等功能。
Comments 22 pages, 3 figures
Journal ref Software 2026, 5(3), 30
评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。
AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。
TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击
机构 * University of Electronic Science and Technology of China(电子科技大学) ; East China Normal University(华东师范大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。
Comments 8 pages,4 figures
PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配
机构 * Carnegie Mellon University(卡内基梅隆大学) ; RadixArk ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。
Qworld: 为LLMs设计的问题特定评估标准
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院医学部) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究 institute) ; Broad Institute of MIT and Harvard(MIT 和哈佛大学Broad研究所) ; Harvard Data Science Initiative(哈佛大学数据科学计划)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Qworld通过递归扩展树生成问题特定评估标准,覆盖89%专家标准并产生79%新标准,揭示LLM在长期影响、公平性等维度的能力差异。
OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准
机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) ; StrategAI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。
系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用
机构 * RWTH Aachen University(亚琛工业大学) ; Process Systems Engineering(过程系统工程) ; Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)
专题命中 推理评测 :planning(abstract);分类 cs.LG
AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。
Comments 33 pages, 10 figures; supplementary information included
ReguSim:评估大语言模型智能体在金融合规中的规则落地
机构 * HKUST(香港科技大学) ; HKBU(香港浸会大学) ; NTU(新加坡南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。
Holtercare-Bench:用于评估长期动态心电图分析的多模态基准
机构 * Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对现有多模态大语言模型在长期动态心电图分析中的不足,构建了含22980个问答对的Holtercare-23K数据集及Holtercare-Bench基准,评估发现零样本模型处理超长病理序列性能差,微调后提升显著,为长期医疗多模态大语言模型提供基础基准。
你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架
机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Computer Network Information Center(计算机网络信息中心) ; Chinese Academy of Sciences(中国科学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。
Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author
当情境推理失效时:交互指令跟随中的可取消性
机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) ; Department of Language Science and Technology, Saarland University(萨尔兰大学语言科学与技术系)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究探讨了在协作积木构建任务中,如何区分字面解释与情境推理,引入了交互基准测试BWIM,发现模型在判断与行动间存在脱节,未能有效利用信息进行澄清。
PACT:面向多表型分组临时协作的表型感知对比团队表示
机构 * Sun Yat-sen University(中山大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对多智能体系统中需与多样表型陌生队友协作的MPG-AHT问题,提出PACT方法,经实验验证其在分布外评估与样本效率上均优于现有最优基线。
基于经验证的LLM推断依赖关系与响应驱动优化的REST API测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出APIPilot框架,通过执行验证LLM推断的REST API依赖关系,结合响应驱动优化,在16个真实API上实现高覆盖率与成功率,优于现有基线。
Comments Under review
ScaleHP: 在度量空间中估计手部姿态
机构 * Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院) ; Visincept ; International Digital Economy Academy (IDEA Research)(国际数字经济学院(IDEA研究院)) ; South China University of Technology(华南理工大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ScaleHP,一种端到端的一阶段手部姿态估计框架,利用手部骨骼内在比例关系作为度量先验,通过尺度token和透视约束最小二乘法在相机坐标系中恢复绝对度量尺度,在多个基准上达到最先进性能。
Comments 19 pages, 9 figures, 12 tables; includes supplementary material
GRACE:基于适配器组合与证据感知校准的教育视觉问答的接地推理
专题命中 其他推理 :reasoning(title,abstract)
AI总结 针对教育视觉问答的问题-选项捷径问题,提出GRACE框架,利用结构化教育状态实现参数高效多模态适配,在ScienceQA上提升了多项准确率。
超越模仿:通过推理进度过滤在线策略蒸馏
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 针对在线策略蒸馏中教师奖励与真实推理进度不匹配的问题,提出R2-OPD方法,通过过滤冲突奖励提升推理性能,实现对标准OPD的改进。
第一滴墨水:误导信息在长上下文推理中的非线性影响
机构 * Department of Computer Science ; Engineering, Texas A\&M University, College Station, TX, USA ; NVIDIA AI Technology Center, NVIDIA Corporation, Santa Clara, CA, USA
专题命中 其他推理 :reasoning(title);分类 cs.AI
AI总结 研究探讨了误导信息在长上下文推理中的非线性影响,发现误导信息比例增加时,性能在初期急剧下降,后续变化较小。通过理论和实证分析,揭示了误导信息对注意力的 disproportionate 影响,并指出过滤收益主要来自减少上下文长度而非去除误导信息。
月球地质学的可验证机器解释
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。
SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏
专题命中 其他推理 :reasoning(abstract)
AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。