Google DeepMind让AMIE视频问诊:100个模拟病例中多项能力追平或超过医生
Google Research和Google DeepMind把医疗对话系统AMIE扩展到实时视频问诊。新系统能在交谈时分析声音和画面,记录动作、表情与身体观察,再将这些信息纳入诊断和处置。
Google Research和Google DeepMind把医疗对话系统AMIE扩展到实时视频问诊。新系统能在交谈时分析声音和画面,记录动作、表情与身体观察,再将这些信息纳入诊断和处置。
奥尔堡大学、上奥地利应用科学大学等机构的研究者提出一套RGB与热红外视频融合方法,用于无人机马鹿调查,相关工作入选ECCV 2026。在4次飞行记录的26只马鹿中,融合方法正确分类25只;单独使用任一模态都只能认对20只。普通相机会让棕色身
能识别显微图、读懂谱图,再据此判断实验结论,和背出科学知识不是一回事。阿里通义、浙江大学、清华大学与中国科学院大学等团队推出SEE,收集1116道以真实实验图像为核心的问题,覆盖19个多模态大模型。标准评测中,模型准确率分布在15.9%到4
医疗AI在一道选择题上答对,不代表它能完成一次真正的接诊。Google DeepMind联合多家医院提出ResidencyRL,让模型在最长60轮对话、最多8次工具调用的模拟门诊中练习问诊、检查、诊断、治疗和记录。在97个病例的医生盲评中,
斯坦福大学等机构推出DelusionEval,用经历过妄想和心理伤害的用户对话测试聊天机器人。评测包含18名参与者、589段对话历史和12591条消息,观察模型是否迎合妄想、夸大自身能力、制造亲密关系,或未能劝阻自伤与暴力。
康奈尔大学发布SoniSpeech,用带超声传感器的眼镜采集无声说话时的面部运动。数据集包含34小时、18000条话语和5356个独立单词,基线模型在开放词汇无声语音识别中的词错误率为26.3%。
亚马逊研究人员用AI智能体模拟营销A/B测试,并拿67项历史实验验证预测结果。未经校准的系统能判断部分效果方向,方向重合度为0.70,但会系统性高估改版带来的影响。
Sakana AI与FARS等团队提出的一项自动科研基准,让Sakana AI v1、Sakana AI v2、CycleResearcher和Data-to-Paper围绕15个研究提案各写一篇论文,再让GPT-5.4、Gemini和Cl
复旦大学、浙江大学、帝国理工学院和微软亚洲研究院等机构发布肠镜视觉语言模型EndoCLIP。团队从280476份常规肠镜记录中恢复出125756组病灶图文配对,用医生日常书写的报告替代昂贵的逐帧人工标注。
亚马逊Health AI团队用1200个模拟患者场景测试10款基础模型。表现最强的模型综合得分为4.25分,满分5分;分诊项目的最高通过率为88%,最弱模型只有32%。
要让机器理解一次钢琴演奏,需要同时看见手怎么落键、身体怎么用力、琴键何时发声,还要能逐音对上乐谱。现有数据集却往往只占其中一两样:有的只有音频和MIDI,有的只有单视角视频,有的缺指法、缺身体动作。首尔国立大学、韩国科学技术院(KAIST)
肠镜报告里写清了病灶的部位、大小和形态,却几乎不会注明这些描述对应检查中的哪一帧画面。复旦大学(附属中山医院)联合浙江大学、微软亚洲研究院、曼彻斯特大学等机构提出EndoCLIP,一个面向结肠镜检查的视觉语言基础模型:它直接复用医院档案库中
当被要求描述一张从未提供的医学图像时,前沿视觉语言模型不会弃权,而是会编造诊断结果。更关键的是,这些编造不是随机的——它高度依赖于患者的人口统计学特征。卡内基梅隆大学和亚马逊云科技的研究人员发现了这一现象,测试涉及Claude Opus-4
同一块月面可能同时有可见光、地形、温度、雷达和重力数据,但不同仪器的分辨率、覆盖与物理含义不一样。剑桥大学、德国航空航天中心、SPAIDER SPACE、帝国理工学院等团队提出LunarFM,把三次月球任务、六种仪器的18个输入通道对齐到一
受试者在磁共振扫描仪里观看数字人面部视频,模型再根据fMRI信号重建身份外观、表情、头部姿态和连续运动。复旦大学、西湖大学、浙江大学、南洋理工大学团队提出fMRI2Face,并构建62856组脑信号与1920×1080视频配对样本。