MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos
MMHBench:用于长视频心理健康理解的多视角基准测试集
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
MMHBench:用于长视频心理健康理解的多视角基准测试集
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。
从零开始多智能体编码中作为一等公民的协作模式的实证研究
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究构建多智能体编码基准MSEval,发现组织拓扑与模型能力对速度-成本-质量权衡影响相当,结构化流水线表现最优,为多智能体软件开发评估提供严格标准。
手语问答:手语理解的新任务、基准与基线模型
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。
通过功能、证据和验证评估智能体生物信息学
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统
PAUSE:统一服务环境中面向用户的个人AI助手基准测试
机构 * University of Alberta(阿尔伯塔大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验
机构 * Jinling Institute of Technology(金陵科技学院) ; College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。
Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation
VISTA:一种用于日常协助的生成性眼动视频框架
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。
Comments pre-print
LLM2Vec-Gen:从大型语言模型生成嵌入向量
机构 * McGill University(麦吉尔大学) ; Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ; ServiceNow Research(ServiceNow研究院) ; Cohere ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。
Comments Accepted to COLM 2026
GradMAP: 更快的层剪枝与梯度度量和投影补偿
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 GradMAP通过梯度度量和投影补偿实现更快的层剪枝,提升剪枝效率和性能。
Comments 19 pages
EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。
RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断
机构 * University of Liverpool(利物浦大学) ; Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) ; Department of Eye and Vision Sciences(眼科与视觉科学系) ; Computer Science Department(计算机科学系) ; Cardiovascular & Metabolic Medicine(心血管与代谢医学) ; Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。
Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)
探索物理问题中的结构:AI智能体能否发现统计力学映射?
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。
Comments Accepted to the AID-Wild workshop at CAIS 2026
RAGuard:一种针对检索增强生成系统数据中毒的分层防御框架
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对RAG系统的语料库中毒攻击,提出分层防御框架RAGuard,含对抗微调检索器与ZKIP两层,可将攻击成功率降至0,且保持检索性能,相关资源已开源。
Comments Accepted to NeurIPS ResponsibleFM 2025, AAAI FrontierIR 2026
ClinLens:面向纵向多模态临床数据科学的长周期编码智能体
机构 * Shandong University(山东大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。
扩展规模会改善基于LLM的社会模拟吗?
机构 * Stanford University(斯坦福大学) ; Open Athena(开放雅典娜)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究LLM规模扩展对社会模拟保真度的影响,发现多数任务随规模提升而改善,但存在例外,如纵向预测和低资源领域改进缓慢。
对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧
机构 * The University of Hong Kong(香港大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。
Comments ACM FAccT 2026
MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。
梅西耶:用于跨基准智能体评估的高分辨率语料库
机构 * Andromede AI(仙女座人工智能公司)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。
MARS:用于重复订单食品配送推荐的多智能体重排
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对重复订单食品配送推荐,提出MARS模块化多智能体重排框架,分两阶段推荐,结合多种信号与推理。通过实验评估,贡献包括给出集成框架、证明预训练主干结合轻量级检索有竞争力、建立可重现评估设置。
DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧
机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) ; School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Automation, Southeast University(东南大学自动化学院) ; Department of Geography, National University of Singapore(新加坡国立大学地理系)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。
RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试
机构 * Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室) ; Hefei University of Technology(合肥工业大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; United Arab Emirates University(阿联酋大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对视觉语言模型在罕见遥感图像解释能力不足的问题,提出RRS-10K基准测试,含军事遥感图像及问答对,构建时引入干扰项过滤策略,评估多个模型,揭示其性能弱点,为开发更可靠的遥感视觉语言模型提供指导。
心理能力作为人工智能评估中缺失的维度
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究指出当前人工智能评估框架对面向人类的系统不足,引入心理能力这一缺失维度,借鉴多领域研究概述其概念框架,定义结构、阐明边界并说明评估方式,强调其应成为多方关注的核心考量。
Comments 12 pages, 3 figures. LaTeX source added to enable accessible HTML; minor wording and typesetting revisions
ERUnderstand:在结构化实体关系图上评估视觉语言模型
机构 * Temple University(天普大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。
用于大语言模型代理中污点限制的代理权限策略代数
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。
Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure
INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准
机构 * Fudan University(复旦大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。
Comments 18 pages, including appendices; 11 figures and 12 tables
成功并非不言自明:在智能体评估中审核成功溯源
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究智能体评估中成功溯源问题,通过AcquaBench的匹配值替换和聚类分析审核,在不同场景测试,发现成功与正确值相关,行为依赖可能超出预期,模型比较有分数差距变化,建议基准报告成功及信息状态支持情况。
Comments 17 pages, 3 figures, including supplementary material. Code: https://github.com/luojingkun22/acquabench
确信错误:前沿大语言模型规则评估中的异常链崩溃
机构 * Aethis
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究前沿大语言模型在规则评估中异常链崩溃问题,提出神经符号架构Aethis资格模块,通过多方面验证,将不确定性从推理边界转移到规范边界,且相关内容公开可重现。
Comments 43 pages, 9 figures. Working paper v3.13.0. Benchmark data, rule encodings and per-case result artefacts: https://github.com/Aethis-ai/confidently-wrong-benchmark
SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试
机构 * Shaqiu Community(沙丘社区)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。
Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench
视觉语言模型中的图表欺骗:从漏洞到缓解
机构 * York University(约克大学) ; University of Alberta(阿尔伯塔大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。