SF20K Competition 2025: Summary and findings
SF20K竞赛2025:总结与发现
机构 * SLoMO Workshop(SLoMO工作坊) ; Hugging Face
专题命中 推理评测 :reasoning(abstract)
AI总结 本文总结了首个SF20K竞赛的结果,探讨了视频问答任务中多模态理解的重要性,并指出信息选择和推理结构是长视频问答的主要瓶颈。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
SF20K竞赛2025:总结与发现
机构 * SLoMO Workshop(SLoMO工作坊) ; Hugging Face
专题命中 推理评测 :reasoning(abstract)
AI总结 本文总结了首个SF20K竞赛的结果,探讨了视频问答任务中多模态理解的重要性,并指出信息选择和推理结构是长视频问答的主要瓶颈。
无中断协助:一种非侵入式人机协助的基准和基于大语言模型的框架
机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Xi’an Jiaotong University(西安交通大学) ; School of Electrical Engineering(电气工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出非侵入式协助的基准和框架,通过模拟基准和新指标评估,结合LLM与评分模型实现主动非侵入式协助,减少人类努力并保持任务有效性。
BioVeil MATRIX: 洞察和分类代理生物AI科学家中的漏洞
专题命中 推理评测 :planning(abstract)
AI总结 研究探讨了代理生物AI科学家在多学科科学流程中的应用,指出现有安全评估无法覆盖双用途应用风险,提出BioVeil MATRIX作为防御分类体系,用于系统化分类生物安全风险。
基于变换器的荧光图预测在临床真实扰动下的鲁棒性
机构 * Wayne State University(韦恩州立大学) ; Henry Ford Health(亨利福特健康)
专题命中 推理评测 :planning(abstract)
AI总结 研究基于变换器的荧光图预测在临床真实扰动下的鲁棒性,通过对比不同注意力机制的变换器模型,发现分层变换器在能量误差上表现更优,强调了物理指导评估的重要性。
Comments Accepted by The Artificial Intelligence in Medicine (AIME) 2026 Conference
高速视觉提升人类动作的零样本语义理解
机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) ; Interfaculty Initiative in Information Studies, Graduate School of Interdisciplinary Information Studies, The University of Tokyo(东京大学跨学科信息研究 graduate school)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文研究高速视觉对人类动作零样本语义理解的影响,提出无需训练的管道结合预训练视频-语言模型与大语言模型进行动作比较,实验显示高帧率提升语义分离度,验证了高速感知对语义理解的重要性。
CUJBench:跨模态故障诊断的LLM-代理基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。
Comments 10 pages, 1 figure; updated source code url
SoK:自主大语言模型代理在代理商业中的安全性
专题命中 推理评测 :reasoning(abstract)
AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。
在细粒度图像任务上评估大型视觉-语言模型:全面评估
机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) ; Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) ; University of Copenhagen, Denmark(丹麦哥本哈根大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。
Comments Accepted to ICLR 2026
MSR:用于带有标注数据集的颈椎脊柱CT-MRI刚-变形配准的混合场建模
机构 * School of Biomedical Engineering, Southern Medical University, Guangzhou, 510515, China.(南方医科大学生物医学工程学院) ; Guangdong Provincial Key Laboratory of Medical Image Processing, Guangzhou, 510515, China.(广东省医学图像处理重点实验室) ; Guangdong Province Engineering Laboratory for Medical Imaging(广东省医学影像与诊断技术工程实验室) ; Information Center, Nanfang Hospital, Southern Medical University, Guangzhou, 510515, China.(南方医科大学南华医院信息中心) ; Division of Spine Surgery, Department of Orthopaedics, Nanfang hospital, Southern Medical University, Guangzhou, Guangdong, 510515, China.(南方医科大学南华医院骨科脊柱外科)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出MSR框架,通过混合刚-变形配准方法提升颈椎脊柱CT-MRI配准精度,解决复杂结构配准难题。
评估胰腺导管腺癌血管侵袭:PDACVI基准
机构 * Sycai Technologies SL, Scientific ; Technical Department, Barcelona, Spain ; Universit\" a tsklinikum Erlangen, Department of Radiology of the Uniklinikum Erlangen (UKER), Erlangen, Germany ; University Hospital Erlangen, Imaging Science Institute, Erlangen, Germany ; ICUBE Laboratory, CNRS UMR-7357, University of Strasbourg, Strasbourg, France ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China ; University of Chinese Academy of Sciences, Beijing, China ; German Cancer Research Center (DKFZ), Medical Image Computing (E230), Heidelberg, Germany ; Hospital de Matar\' o , Matar\' o , Spain ; Hospital de Sant Pau i la Santa Creu, Diagnostic Imaging Department, Barcelona, Spain ; Institut de Recerca Sant Pau - CERCA, Advanced Medical Imaging, Artificial Intelligence ; Imaging-Guided Therapy Research Group, Barcelona, Spain ; TECNALIA, Basque Research
专题命中 推理评测 :planning(abstract)
AI总结 本文提出PDACVI基准,通过密集标注数据集评估胰腺癌血管侵袭,揭示传统体积重叠指标的局限性,强调概率模型在术前决策中的重要性。
评判,然后驾驶:一种以评判为中心的视觉语言动作框架用于自动驾驶
机构 * Bosch Research(博世研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出CriticVLA框架,通过多模态评估和单步优化提升自动驾驶决策质量,实验显示其在复杂场景中性能显著优于现有方法。
Comments preprint
SynSQL: 为文本到SQL系统的稳健评估合成关系数据库
专题命中 推理评测 :reasoning(abstract)
AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。
对LLM生成的密码学Rust代码的实证安全评估
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。
Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering
DenseStep2M: 一种可扩展且无需训练的密集指令视频标注流水线
机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出无需训练的DenseStep2M流水线,通过分割视频、过滤对齐不佳内容并利用先进多模态模型生成高质量步骤注释,构建了包含10万视频和200万步骤的大型数据集,支持长期视频理解。
为大语言模型系统设计的AI可观测性:从置信度校准到基础设施追踪的多层分析
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 本文分析了大语言模型在生产环境中的可观测性需求,探讨了从置信度校准到基础设施追踪的多层监控方法,识别了当前领域中的关键缺口。
Comments 10 pages, 2 figures, 3 tables, survey paper
BridgeRAG:无训练桥条件检索用于多跳问答
专题命中 推理评测 :reasoning(abstract)
AI总结 BridgeRAG通过桥条件检索提升多跳问答性能,无需训练或图数据库,通过三元评分器实现有效检索,实验显示其在选择性、不可替代性、可预测性和机制精确性方面均优于现有方法。
Comments 11 pages, 4 figures
大语言模型增强的关系运算符:分类、基准测试与分析
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出统一的关系运算符分类,设计全面的基准测试,并评估不同实现下的运算符性能,以指导复杂语义查询系统的设计。
大型语言模型具有情感链
专题命中 推理评测 :reasoning(abstract)
AI总结 研究探讨了大型语言模型在持续交互中情感状态的演变,发现其情感动态具有结构性和可重复性,影响生成、用户体验及集体动态。
一种基于图增强知识蒸馏的双流视觉Transformer与区域感知注意力的胃肠道疾病分类可解释AI方法
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出一种结合图增强知识蒸馏的双流视觉Transformer与区域感知注意力机制,用于胃肠道疾病分类,通过软标签蒸馏实现高效且准确的诊断,同时保证模型的可解释性。
代理中的幽灵:重新定义LLM代理的信息流跟踪
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。
面向6G NaaS的意图共创作代理框架:架构与开源模型评估
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出面向6G NaaS的意图驱动端到端 orchestration 框架,通过协作意图共创作提升复杂网络环境下的自主性,评估开源大语言模型在高分辨率意图到有效订单转换中的性能差距。
超越度量偏差的遥感图像描述评估
机构 * Hohai University(河海大学) ; Cardiff University(卡迪夫大学)
专题命中 推理评测 :self-correction(abstract)
AI总结 本文提出ReconScore指标,通过文本重建能力评估描述质量,发现未微调的MLLM在零样本遥感图像描述任务中表现更优,并引入无需训练的RemoteDescriber方法提升语义精度。
相关性如何出现:对零样本重排序内部注意力的分层研究
专题命中 推理评测 :reasoning(abstract)
AI总结 本文研究了多排名框架中生成、似然和内部注意力机制的对比,发现Transformer层中相关性信号呈现钟形分布,提出Selective-ICR策略降低推理延迟30%-50%,并在BRIGHT基准测试中证明了内部信号在复杂推理排序中的潜力。
Comments Accepted by SIGIR 2026. 10 pages, 5 figures, 4 tables. Code available at https://github.com/ielab/Selective-ICR
看见整个象:面向基于大语言模型的多智能体系统故障归因的基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出TraceElephant基准测试,通过完整执行轨迹和可复现环境提升故障归因准确性,验证完整轨迹对故障原因识别的重要性。
Comments Accepted by ACL 2026
EV-CLIP:为视觉挑战下的少样本动作识别在CLIP中实现高效的视觉提示适应
机构 * Artificial Intelligence & Computer Vision Lab., Konkuk University, Seoul, South Korea(人工智能与计算机视觉实验室,韩国康 kuk 大学,首尔)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出EV-CLIP,通过引入mask prompts和context prompts提升CLIP在少样本视频动作识别中的性能,克服视觉挑战对空间感知的影响。
Comments 14 pages, 8 figures, 6 tables
HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试
机构 * Nanjing University, China(南京大学,中国) ; AISHELL, China(AISHELL,中国)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。
V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架
机构 * Nanjing University(南京大学) ; Microsoft Research(微软研究院) ; Central South University(中南大学) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。
CCTVBench:用于多模态大语言模型的对比一致性交通视频问答基准
机构 * Technical University of Munich(慕尼黑技术大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 推理评测 :reasoning(abstract)
AI总结 CCTVBench通过真实事故视频与世界模型生成的反事实场景配对,提出对比一致性评估方法,揭示视频问答中对比一致性与标准指标间的显著差距,并引入C-TCD方法提升问答与一致性性能。
基于调优变量的统计软件工程
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出将统计软件工程中的治理空间作为核心对象,强调在变化环境中通过调优变量维持程序质量与安全性的方法。
Comments 3 pages, position paper
MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。
Comments ACL 2026 Industry Track Camera Ready