OwlPath: Lossless Knowledge Compression for LLM Bug Repair
OwlPath:面向大语言模型漏洞修复的无损知识压缩
专题命中 推理评测 :reasoning(abstract)
AI总结 OwlPath是构建于CodeGraph之上的OWL2推理层,通过无损知识压缩将代码编码为OWL2本体,提升LLM漏洞修复的结构检索性能,在多组基准测试中实现了严格应用率、召回率等指标的显著提升。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
OwlPath:面向大语言模型漏洞修复的无损知识压缩
专题命中 推理评测 :reasoning(abstract)
AI总结 OwlPath是构建于CodeGraph之上的OWL2推理层,通过无损知识压缩将代码编码为OWL2本体,提升LLM漏洞修复的结构检索性能,在多组基准测试中实现了严格应用率、召回率等指标的显著提升。
EgoSafe:用于视觉安全理解的第一人称移动采集基准
机构 * South China University of Technology(华南理工大学) ; Beihang University(北京航空航天大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架
KuaiSearch: 一个大规模电商平台搜索数据集用于召回、排序和相关性
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出KuaiSearch,首个涵盖召回、排序和相关性评估的大型电商平台搜索数据集,通过真实用户交互数据提升电商搜索研究的准确性与实用性。
DocPrism:代码与文档间错误不一致性的多语言检测
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出轻量级多语言代码-文档不一致性检测工具DocPrism,通过LCEF方法降低标记率、提升F1分数,在多语言真实场景中表现优于现有技术。
Comments 22 pages. To appear in Proceedings of the ACM on Software Engineering, Volume 3, ISSTA 2026
AI时代的前瞻性数据治理:数据访问、复用与主权中的新兴信号
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究通过专家预测工作坊识别出AI时代数据治理的7个新兴信号及强化反馈循环,提出与多领域融合的前瞻性数据治理议程,为结构性转变提供诊断框架。
Comments 11 pages
ICDAR 2026 原子层沉积/蚀刻(ALD/E)科学图信息提取竞赛
机构 * TIB - Leibniz Information Centre for Science and Technology(蒂宾根信息中心(莱布尼茨科学技术信息中心)) ; L3S Research Center, Leibniz University(莱布尼茨大学L3S研究中心)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究介绍了ICDAR 2026 ALD/E科学图信息提取竞赛,基于Sci-ImageMiner基准数据集开展多任务评测,发现现有多模态模型在数据提取等任务中存在局限,为领域多模态AI研究提供了平台。
Comments 17 pages, 6 figures, 8 tables, to be published in ICDAR 2026 Conference Proceedings and Volume 16975 of the Lecture Notes in Computer Science series (Springer Nature)
CodeSpec:面向智能体长周期功能开发的双可执行规范
专题命中 推理评测 :reasoning(abstract)
AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。
Text2Score:从文本提示生成乐谱
机构 * Queen Mary University of London(伦敦女王学院) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Politecnico di Milano(米兰理工大学) ; EmotionWave(情绪波)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。
Comments 9 pages including references, 2 figures
通过元课程学习实现抗可读性代码摘要
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出RoFTCodeSum方法,通过结合课程学习和元学习提升代码摘要对低可读性代码的鲁棒性。
Comments Code available at https://github.com/Zengwh02/RoFTCodeSum
医学中的智能体人工智能:临床转化的架构、应用、评估及挑战
机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) ; Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, San Francisco(加州大学旧金山分校) ; Yale University(耶鲁大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理评测 :planning(abstract)
AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。
Comments Review article, 6 figures, 2 tables. 42 pages
迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架
机构 * East China Normal University(华东师范大学) ; Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) ; Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) ; Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。
Comments 10 pages, accepted by ACMMM2026 Main Track
反对用于检索的生成式模型:判别式语言模型作为有效的检索器
专题命中 推理评测 :reasoning(abstract)
AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。
HiEviDR-Bench:深度研究中分层证据聚合的基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。
Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io
感知基准:评估多模态大语言模型中的原子视觉感知
机构 * Moonshot AI(登月人工智能)
专题命中 推理评测 :reasoning(abstract)
AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。
用于智能家庭能源管理的大语言模型
专题命中 推理评测 :reasoning(abstract)
AI总结 研究家庭能源管理系统中,大语言模型智能体能否为多设备家庭能源调度提供自然语言接口。通过工具调用ReAct智能体及相关数据,对三个商业模型进行基准测试,结果显示模型表现各异,能实现高调度成功率和接近最优性。
Comments 15 pages, 8 figures
可解释的Sentinel-1 SAR影像洪水分割:CNN与Transformer架构的比较研究
机构 * United Nations University's Institute for Environment and Human Security (UNU-EHS)(联合国大学环境与人类安全研究所(UNU-EHS))
专题命中 推理评测 :planning(abstract)
AI总结 比较CNN和视觉Transformer在Sentinel-1 SAR影像多类洪水分割中的性能,SegFormer-b2在ETCI数据集上显著优于U-Net,但在Sen1Floods11上优势缩小,并利用可解释性技术分析模型决策。
TrajAudit:智能体编码系统的自动化故障诊断
专题命中 推理评测 :reasoning(abstract)
AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。
彩色眼底摄影分析:数据、预处理和建模向多模态人工智能的共同进化
专题命中 推理评测 :reasoning(abstract)
AI总结 研究彩色眼底摄影分析中数据、预处理和建模的共同进化,通过数据集进化、预处理范式和建模框架的相互作用进行综合概述,指出未来进展取决于三者协同优化,为临床部署等提供路线图。
Comments Survey paper, 77 pages, 18 figures, 2 tables
我能编辑什么?开放式策略发现与情感可编辑性景观
机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) ; School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。
通过结合Transformer和程序依赖图增强代码理解以进行影响分析
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对影响分析这一软件维护任务,提出Athena方法,结合软件系统依赖图信息与概念耦合方法,无需更改历史和执行信息。构建新基准测试,实验表明该方法在新基准上表现出色,比简单基线有显著性能提升。
Comments Accepted to FSE'24
DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策
机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。
探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。
Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL
StAR:分段任何推理器
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出StAR框架,通过多角度优化提升分割性能,并首次引入并行测试时间扩展,构建ReasonSeg-X数据集以评估高级方法。
Comments ECCV 2026 / Code: https://github.com/ysj9909/StAR
展示而非讲述:在生成像素而非语言模型文本中评估空间认知
机构 * Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。
Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/
TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集
机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; College of Design and Innovation, Tongji University(同济大学设计创意学院) ; Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) ; School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。
Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026
MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商
机构 * Tsinghua University(清华大学) ; Nankai University(南开大学) ; Beijing Institute of Technology(北京理工大学) ; Chinese Academy of Sciences(中国科学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。
ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Zhongguancun Academy(中关村科学城) ; School of Engineering, Westlake University(西湖大学工学院) ; School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。
Comments 37 pages, 37 figures
超越人工智能辅助结肠镜检查中的置信度:一种用于内镜人工智能审查的空间、时间和质量感知审计框架
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对AI辅助结肠镜检查中仅置信度不能全面评估预测的问题,提出EndoExplain审计框架,整合多种要素。通过实验展示了分类器和分割器的性能,还验证了归因方法等,该框架能分离多种信号,为临床审查提供支持,是回顾性研究原型。
Comments 18 pages, 5 figures, 5 tables. Substantially revised version with a new title and scope; added calibration analysis, paired multi-CAM evaluation, random-deletion controls, architecture and seed robustness analyses, and frozen external spatial transfer
面向复制包质量评估的智能体方法
专题命中 推理评测 :planning(abstract)
AI总结 提出一种多智能体方法,将开放科学指南转化为机器可验证标准,自动检查复制包质量并生成改进报告,初步评估显示高一致性和正确性。
筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究
专题命中 推理评测 :reasoning(abstract)
AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。
Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)