Legal Retrieval for Public Defenders
为公共辩护人设计的法律检索
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种针对公共辩护人工作的法律检索工具,通过引入领域知识提升检索效果,并发布了一个真实辩护人检索查询的分类学和手动标注的数据集,以改进现实中的法律检索基准。
Comments Forthcoming TMLR
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
为公共辩护人设计的法律检索
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种针对公共辩护人工作的法律检索工具,通过引入领域知识提升检索效果,并发布了一个真实辩护人检索查询的分类学和手动标注的数据集,以改进现实中的法律检索基准。
Comments Forthcoming TMLR
CATP:基于置信度的令牌修剪用于伪装目标检测
机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ; Academy for Advanced Interdisciplinary Studies, Nankai University(先进交叉学科研究院,南开大学) ; School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) ; School of Information and Communication Engineering, UESTC(信息与通信工程学院,电子科技大学) ; Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出CATP框架,通过分层修剪和双路径补偿机制提升伪装目标检测效率,减少计算量并保持高精度。
BMDS-Net:一种用于鲁棒脑肿瘤分割的贝叶斯多模态深度监督网络
机构 * School of Mathematics and Statistics, Changsha University of Science and Technology(数学与统计学学院,长沙理工大学) ; School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) ; Shanghai Chest Hospital, Shanghai Jiao Tong University School of Medicine(上海胸科医院,上海交通大学医学院)
专题命中 推理评测 :planning(abstract)
AI总结 BMDS-Net通过贝叶斯方法提升多模态脑肿瘤分割的鲁棒性和可信度,实现更稳定的临床应用。
Comments 21 pages, 6 figures. Manuscript prepared for submission to ACM HEALTH
SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络
机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) ; College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。
面向第一人称视角助手的视觉意图定位
机构 * National University of Singapore(新加坡国立大学) ; Google DeepMind(谷歌DeepMind)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。
ResPlan:包含17000张住宅平面图的大规模矢量图数据集
机构 * Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 ResPlan是含17000张住宅平面图的矢量图数据集,具备功能空间标注与四类图边,相比RPLAN、MSD有更高质量单元布局,含相关代码与三个基准任务基线,可公开获取。
Comments 11 pages, 7 figures, 7 tables
RSVideo:你的视觉-语言模型准备好应对遥感视频了吗?
机构 * Wuhan University(武汉大学) ; Zhongguancun Academy(中关村学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究构建了遥感视频数据集RSVideo-10K与评估基准RSVideo-Bench,发现现有视觉-语言模型在遥感视频理解上存在不足,提出强化学习框架RSVideo提升小目标时空聚焦能力,取得显著性能提升。
MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能
机构 * University of British Columbia(英属哥伦比亚大学) ; Weathon Software(威盛软件)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。
Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures
RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; China University of Mining Technology(中国矿业大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。
Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。
Comments We need to make a huge revision
大规模事实核查:用于在线媒体真实性与上下文验证的多模态AI
专题命中 推理评测 :reasoning(abstract)
AI总结 本文为2025年ACM多媒体大会多媒体验证挑战赛开发了多模态验证系统,整合视觉取证等技术,可检测脱离上下文的媒体,提升了多媒体验证水平,为相关从业者提供实用工具。
MMOOC:多模态大语言模型的上下文外评估综合基准
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Eastern Institute of Technology(东方理工大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出MMOOC基准,评估多模态大语言模型在上下文偏移场景下的拒绝与作答能力,实验发现当前模型难以平衡可答性与拒绝性,后训练可提升稳健性,该基准将公开。
Comments project page:https://zhuwenjie98.github.io/MMOOC-project-page/
OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。
安全的假象:AI与人类C++代码的多层验证
专题命中 推理评测 :reasoning(abstract)
AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。
EnergyAgentBench: 在实时能源基础设施数据上评估LLM代理的基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出EnergyAgentBench,首个基于实时电力市场数据的LLM代理基准测试,评估数据中心选址、长期投资组合优化等任务,九种模型在1414次运行中表现各异,Claude Sonnet 4.6在整体得分上领先。
看见不可见:基于知识增强视觉语言模型的无训练风机叶片检测方法
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究提出结合RAG与VLM的零样本风机叶片检测框架,构建多模态知识库,在小样本测试中表现优于基线,为工业检测提供数据高效方案。
错误且更自信:语言模型参加研究生经济学考试的实地实验
专题命中 推理评测 :reasoning(abstract)
AI总结 研究语言模型在研究生经济学考试中面对误导性信息的表现,通过GERB实验发现误导性信息降低正确答案概率,不同类型模型受影响无显著差异,错误答案有完整解释且模型自信,不对照答案难以发现错误。
EgoSafe:用于视觉安全理解的第一人称移动采集基准
机构 * South China University of Technology(华南理工大学) ; Beihang University(北京航空航天大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架
KuaiSearch: 一个大规模电商平台搜索数据集用于召回、排序和相关性
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出KuaiSearch,首个涵盖召回、排序和相关性评估的大型电商平台搜索数据集,通过真实用户交互数据提升电商搜索研究的准确性与实用性。
DocPrism:代码与文档间错误不一致性的多语言检测
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出轻量级多语言代码-文档不一致性检测工具DocPrism,通过LCEF方法降低标记率、提升F1分数,在多语言真实场景中表现优于现有技术。
Comments 22 pages. To appear in Proceedings of the ACM on Software Engineering, Volume 3, ISSTA 2026
Text2Score:从文本提示生成乐谱
机构 * Queen Mary University of London(伦敦女王学院) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Politecnico di Milano(米兰理工大学) ; EmotionWave(情绪波)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出Text2Score框架,通过规划和执行阶段生成乐谱,利用符号XML数据直接生成监督信号,优于其他方法。
Comments 9 pages including references, 2 figures
通过元课程学习实现抗可读性代码摘要
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出RoFTCodeSum方法,通过结合课程学习和元学习提升代码摘要对低可读性代码的鲁棒性。
Comments Code available at https://github.com/Zengwh02/RoFTCodeSum
用于智能家庭能源管理的大语言模型
专题命中 推理评测 :reasoning(abstract)
AI总结 研究家庭能源管理系统中,大语言模型智能体能否为多设备家庭能源调度提供自然语言接口。通过工具调用ReAct智能体及相关数据,对三个商业模型进行基准测试,结果显示模型表现各异,能实现高调度成功率和接近最优性。
Comments 15 pages, 8 figures
可解释的Sentinel-1 SAR影像洪水分割:CNN与Transformer架构的比较研究
机构 * United Nations University's Institute for Environment and Human Security (UNU-EHS)(联合国大学环境与人类安全研究所(UNU-EHS))
专题命中 推理评测 :planning(abstract)
AI总结 比较CNN和视觉Transformer在Sentinel-1 SAR影像多类洪水分割中的性能,SegFormer-b2在ETCI数据集上显著优于U-Net,但在Sen1Floods11上优势缩小,并利用可解释性技术分析模型决策。
TrajAudit:智能体编码系统的自动化故障诊断
专题命中 推理评测 :reasoning(abstract)
AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。
探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。
Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL
StAR:分段任何推理器
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出StAR框架,通过多角度优化提升分割性能,并首次引入并行测试时间扩展,构建ReasonSeg-X数据集以评估高级方法。
Comments ECCV 2026 / Code: https://github.com/ysj9909/StAR
超越人工智能辅助结肠镜检查中的置信度:一种用于内镜人工智能审查的空间、时间和质量感知审计框架
专题命中 推理评测 :reasoning(abstract)
AI总结 研究针对AI辅助结肠镜检查中仅置信度不能全面评估预测的问题,提出EndoExplain审计框架,整合多种要素。通过实验展示了分类器和分割器的性能,还验证了归因方法等,该框架能分离多种信号,为临床审查提供支持,是回顾性研究原型。
Comments 18 pages, 5 figures, 5 tables. Substantially revised version with a new title and scope; added calibration analysis, paired multi-CAM evaluation, random-deletion controls, architecture and seed robustness analyses, and frozen external spatial transfer
面向复制包质量评估的智能体方法
专题命中 推理评测 :planning(abstract)
AI总结 提出一种多智能体方法,将开放科学指南转化为机器可验证标准,自动检查复制包质量并生成改进报告,初步评估显示高一致性和正确性。
筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究
专题命中 推理评测 :reasoning(abstract)
AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。
Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)