FloodSQL-Bench: A Retrieval-Augmented Benchmark for Geospatially-Grounded Text-to-SQL
FloodSQL-Bench: 一个用于洪水管理领域的检索增强基准
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出FloodSQL-Bench,一个结合异构数据集的地理空间基准,用于评估大语言模型在多表和地理空间推理中的性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
FloodSQL-Bench: 一个用于洪水管理领域的检索增强基准
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出FloodSQL-Bench,一个结合异构数据集的地理空间基准,用于评估大语言模型在多表和地理空间推理中的性能。
面向统一模型的基于推理的视频编辑:带有自我反思学习
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。
WAT:在线视频理解需要先观看再思考
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; University of Science and Technology Beijing(北京科技大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。
FakeScope:大型多模态专家模型用于透明的AI生成图像取证
机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) ; School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) ; School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) ; Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。
揭示深层阴影:深度学习时代图像和视频阴影检测、去除与生成的综述与基准
机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院) ; Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学院) ; Adobe Research(Adobe研究)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文综述并建立了深度学习时代图像和视频阴影检测、去除与生成的统一基准,揭示了现有研究中的不一致、模型设计依赖性和跨数据集泛化限制,并提出了未来研究方向。
Comments Accepted by International Journal of Computer Vision (IJCV). Publicly available results, trained models, and evaluation metrics at https://github.com/xw-hu/Unveiling-Deep-Shadows
Journal ref International Journal of Computer Vision (IJCV), vol.134, article 158, 2026
多标准:在多元标准下评估多模态裁判
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Waterloo(滑铁卢大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。
Comments Accepted to CVPR 2026
基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。
PromCopilot: 通过大型语言模型简化云原生在线服务系统的Prometheus指标查询
专题命中 推理评测 :reasoning(abstract)
AI总结 PromCopilot通过大型语言模型简化云原生在线服务系统的Prometheus指标查询,首次提出文本到PromQL框架,准确率达69.1%。
重新评估 EVMBench:AI代理是否准备好应对智能合约安全?
专题命中 推理评测 :reasoning(abstract)
AI总结 重新评估EVMBench发现AI代理在智能合约安全检测中存在稳定性、真实事件处理和框架依赖性问题,挑战了自动化审计的可行性。
AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计
专题命中 推理评测 :reasoning(abstract)
AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。
迈向赛场:评估体育中的空间智能
专题命中 推理评测 :reasoning(abstract)
AI总结 CourtSI通过大规模体育场景数据集评估VLMs的空间智能,发现现有基准存在局限,并验证了模型在体育场景中的提升效果。
EmoSURA:迈向精确评估详细且长上下文情感语音字幕
机构 * CHI – Chair of Health Informatics, TUM University Hospital, Munich, Germany(慕尼黑大学医院健康信息学系) ; MCML - Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心) ; Huawei, Netherlands(荷兰华为) ; GLAM, Imperial College London, UK(伦敦帝国理工学院GLAM研究中心)
专题命中 推理评测 :reasoning(abstract)
AI总结 EmoSURA通过原子验证机制和SURABench基准,提供更可靠的长上下文情感语音字幕评估方法
Comments Submitted to Interspeech 2026
OmniEarth:一个评估遥感任务中视觉-语言模型的基准
机构 * Jilin University(吉林大学) ; Chang Guang Satellite Technology(长光卫星技术)
专题命中 推理评测 :reasoning(abstract)
AI总结 OmniEarth是一个评估遥感任务中视觉-语言模型性能的基准,通过多维任务和严格测试协议,揭示现有模型在复杂地理任务中的不足。
以资产为中心的度量-语义地图:室内环境
机构 * Department of Electrical & Systems Engineering and General Robotics, Automation, Sensing and Perception (GRASP) Laboratory at the University of Pennsylvania(宾夕法尼亚大学电气与系统工程系及通用机器人、自动化、传感与感知(GRASP)实验室) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出了一种以资产为中心的度量-语义地图方法,利用四足机器人和RGB-D数据构建室内环境的高精度表示,结合自然语言和网格信息,提升机器人场景理解和导航能力。
Comments 9 pages, 8 figures, 3 tables
FormalRTL: 在大规模上实现验证的RTL综合
专题命中 推理评测 :planning(abstract)
AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。
模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。
为何大语言模型可以秘密超越嵌入相似性在信息检索中的表现
专题命中 推理评测 :reasoning(abstract)
AI总结 本文探讨了大语言模型在信息检索中通过推理超越传统嵌入相似性方法的潜力,并指出当前注释数据集难以准确评估其效果。
Comments 13 pages, 6 figures, 5 tables
用眼睛倾听:跨时空的自体视觉共指基准测试
机构 * Beijing Jiaotong University(北京交通大学) ; Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) ; Tencent Robotics X(腾讯机器人X) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。
OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集
机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)
专题命中 推理评测 :reasoning(abstract)
AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。
Comments Accepted as a Short Paper at VISAPP 2026
VIVECaption:一种改进标题质量的分步方法
机构 * Adobe Inc.(Adobe公司)
专题命中 推理评测 :reasoning(abstract)
AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。
TAPFormer: 通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪
机构 * National University of Defense Technology(国防科技大学) ; Hunan University(湖南大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 TAPFormer通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪,提升跟踪精度和鲁棒性。
测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。
InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统
专题命中 推理评测 :CoT(abstract)
AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。
Comments Accepted at ACM Multimedia 2025
评估多智能体LLM架构在罕见病诊断中的表现
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究评估了多智能体LLM架构在罕见病诊断中的表现,发现分层结构略优于其他拓扑,而对抗模型性能显著下降,支持动态拓扑选择的重要性。
SIQA:迈向可靠的科学图像质量评估
机构 * TongJi University(同济大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。
在交出轮子之前:评估LLMs用于安全事件分析
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出SIABENCH框架,通过构建首个涵盖安全事件分析两大类任务的数据集,并实现自主执行SIA任务的代理,对11种LLM进行基准测试,以评估其在动态安全事件分析中的有效性。
Spatial4D-Bench: 一种多功能的4D空间智能基准
机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) ; Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) ; Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) ; Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) ; Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) ; Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) ; Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) ; Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) ; Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) ; Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) ; Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) ; Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) ; Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) ; Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) ; Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) ; Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) ; Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) ; Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) ; Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) ; Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) ; Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) ; Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) ; Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) ; Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) ; Yiyi Liao Zhejiang University(廖亿毅 浙江大学) ; Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)
专题命中 推理评测 :reasoning(abstract)
AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。
Comments Technical Report
OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析
机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) ; Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; Shanghai Jiao Tong University(上海交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。
Comments 34 pages, 24 figures, conference
Journal ref CVPR 2026
ChatShopBuddy:通过强化学习实现可靠的对话购物代理
专题命中 推理评测 :reasoning(abstract)
AI总结 ChatShopBuddy通过强化学习优化对话购物代理,结合分层奖励建模和动态对比策略优化,提升购物代理的稳定性和效率。
在函数式编程课程背景下评估LLM:一项全面研究
专题命中 推理评测 :reasoning(abstract)
AI总结 本文评估了LLM在函数式编程课程中的有效性,通过构建三个基准测试,发现LLM在纠正语法和类型错误及回答基础概念问题方面表现良好,但解决低资源环境下家庭作业问题的能力较弱。
Journal ref The Art, Science, and Engineering of Programming, 2026, Vol. 11, Issue 1, Article 5