Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs
质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。
M3MAD-Bench: 多智能体辩论在不同领域和模态中真的有效吗?
机构 * Shandong University(山东大学) ; MBZUAI ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; BOB Cloud(BOB云)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 M3MAD-Bench通过多领域、多模态和多维指标评估多智能体辩论方法的有效性,提供全面的性能-成本分析。
Comments Accepted by ACMMM 2026
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验
机构 * Jinling Institute of Technology(金陵科技学院) ; College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。
Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation
VISTA:一种用于日常协助的生成性眼动视频框架
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。
Comments pre-print
LLM2Vec-Gen:从大型语言模型生成嵌入向量
机构 * McGill University(麦吉尔大学) ; Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ; ServiceNow Research(ServiceNow研究院) ; Cohere ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。
Comments Accepted to COLM 2026
GradMAP: 更快的层剪枝与梯度度量和投影补偿
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 GradMAP通过梯度度量和投影补偿实现更快的层剪枝,提升剪枝效率和性能。
Comments 19 pages
EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。
RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断
机构 * University of Liverpool(利物浦大学) ; Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) ; Department of Eye and Vision Sciences(眼科与视觉科学系) ; Computer Science Department(计算机科学系) ; Cardiovascular & Metabolic Medicine(心血管与代谢医学) ; Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。
Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)
扩展规模会改善基于LLM的社会模拟吗?
机构 * Stanford University(斯坦福大学) ; Open Athena(开放雅典娜)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究LLM规模扩展对社会模拟保真度的影响,发现多数任务随规模提升而改善,但存在例外,如纵向预测和低资源领域改进缓慢。
对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧
机构 * The University of Hong Kong(香港大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。
Comments ACM FAccT 2026
心理能力作为人工智能评估中缺失的维度
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究指出当前人工智能评估框架对面向人类的系统不足,引入心理能力这一缺失维度,借鉴多领域研究概述其概念框架,定义结构、阐明边界并说明评估方式,强调其应成为多方关注的核心考量。
Comments 12 pages, 3 figures. LaTeX source added to enable accessible HTML; minor wording and typesetting revisions
雅典娜大脑技术报告:用于通用智能和具身交互的高效机器人大脑
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对具身智能体对设备端紧凑模型需求,提出雅典娜大脑8B模型,经多阶段训练流程,使其兼具通用与具身交互能力,实验证明该模型在通用和具身评估中有效,能在保持性能同时生成更简洁回复。
EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线
机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。
Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)
VeriLLMed: 基于知识图谱的医疗大语言模型交互式可视化调试
机构 * IEEE
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出VeriLLMed系统,通过整合外部生物医学知识,帮助开发者审计和调试医疗大语言模型的诊断推理过程,识别三种常见诊断错误类型,提升模型可靠性。
Comments Accepted by VIS 2026
贝叶斯-LoRA:大型语言模型的概率低秩适应
机构 * School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland(特里尼蒂学院都柏林分校计算机科学与统计学学院) ; School of Computer Science, University College Dublin, Dublin, Ireland(都柏林大学学院计算机科学学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出贝叶斯-LoRA,通过概率低秩表示改进LoRA,提升模型校准性,在多个常识推理基准中实现84%的ECE和76%的NLL减少。
大语言模型是算法上盲目
机构 * School of Computer Engineering, Manipal Institute of Technology, Bengaluru, India(马尼帕尔理工学院计算机工程学院,班加罗尔,印度)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究发现大语言模型在算法推理上存在系统性失败,主要贡献是揭示了算法盲目的本质,即声明性知识与校准过程预测之间的差距。
Comments Code available at https://github.com/sohv/algorithmic-blindness
熵哨兵:基于STEM解码熵迹的连续LLM准确性监控
机构 * Departamento de Matematica, FCEyN Universidad de Buenos Aires(数学系,布宜诺斯艾利斯大学) ; ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(ELIAS实验室,圣安德烈斯大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出利用输出熵迹作为推理时信号,通过轻量分类器预测实例正确性并聚合为领域级准确性估计,在STEM推理基准上验证了其用于监控和数据采集的有效性。
OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现
机构 * OpenAI
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。
Comments 13 pages, two graphs
AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。
Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat
AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架
机构 * The University of Melbourne(墨尔本大学)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。
享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判
机构 * SenseTime Research(商汤科技研究院) ; University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。
超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?
机构 * ByteDance Inc.(字节跳动公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。
开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。
在冲突软件构件中衡量LLM的信任分配
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; IQVIA Inc.(IQVIA公司)
专题命中 推理评测 :reasoning(abstract_cn);分类 cs.AI
AI总结 研究探讨LLM在处理冲突软件构件时的信任分配问题,提出TRACE框架评估不同构件的质量、不一致性和信任校准,发现模型在检测文档错误时表现优于实现错误,但对实现漂移而文档无误的情况检测率下降,且信任校准不佳。
评估两用生物学环境中的校准拒绝和安全有用性
机构 * American Wetware(美国湿科公司) ; LatchBio
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。
T2T-VICL:通过隐式文本驱动的视觉语言模型进行跨任务视觉上下文学习
机构 * Duke University(杜克大学) ; Texas A&M University(德克萨斯农工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究跨任务视觉上下文学习问题,提出T2T-VICL协作式提示转移框架,通过大教师VLM生成结构化描述构建数据集,提炼能力到轻量级学生VLM,实验表明该框架能改进任务感知对齐,揭示跨任务VICL的潜力与局限。
Comments 22 pages, 6 figures, under submission
SEC-bench Pro:语言模型能解决长周期软件安全任务吗?
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。
Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证
机构 * Tsinghua University(清华大学)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。
MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。