arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

科学发现、生命科学、材料及其他交叉技术。

2608.06973 视觉与生成

ECCV 2026|无人机融合RGB与热成像,26只马鹿认对25只

奥尔堡大学、上奥地利应用科学大学等机构的研究者提出一套RGB与热红外视频融合方法,用于无人机马鹿调查,相关工作入选ECCV 2026。在4次飞行记录的26只马鹿中,融合方法正确分类25只;单独使用任一模态都只能认对20只。普通相机会让棕色身

奥尔堡大学、上奥地利应用科学大学等
无人机RGB与热成像中的多只马鹿对照文章封面
2608.06931 大模型

阿里通义SEE给19个多模态模型出实验题,最强准确率也没过50%

能识别显微图、读懂谱图,再据此判断实验结论,和背出科学知识不是一回事。阿里通义、浙江大学、清华大学与中国科学院大学等团队推出SEE,收集1116道以真实实验图像为核心的问题,覆盖19个多模态大模型。标准评测中,模型准确率分布在15.9%到4

中国科学院大学、清华大学、浙江大学等
化学、生物与材料实验图表题的文章封面
2608.07418 更多前沿

Google DeepMind发表ResidencyRL,临床AI在模拟问诊中获87.6%医生偏好

医疗AI在一道选择题上答对,不代表它能完成一次真正的接诊。Google DeepMind联合多家医院提出ResidencyRL,让模型在最长60轮对话、最多8次工具调用的模拟门诊中练习问诊、检查、诊断、治疗和记录。在97个病例的医生盲评中,

Google DeepMind等
模拟患者病例与临床智能体问诊界面的文章封面
2608.00803 更多前沿

康奈尔用超声眼镜读取无声说话,词汇量扩到5356个

康奈尔大学发布SoniSpeech,用带超声传感器的眼镜采集无声说话时的面部运动。数据集包含34小时、18000条话语和5356个独立单词,基线模型在开放词汇无声语音识别中的词错误率为26.3%。

康奈尔大学等
康奈尔用超声眼镜读取无声说话,词汇量扩到5356个文章封面
2607.28466 更多前沿

复旦浙大微软用28万份肠镜报告训练医疗AI

复旦大学、浙江大学、帝国理工学院和微软亚洲研究院等机构发布肠镜视觉语言模型EndoCLIP。团队从280476份常规肠镜记录中恢复出125756组病灶图文配对,用医生日常书写的报告替代昂贵的逐帧人工标注。

浙江大学、微软亚洲研究院等
复旦浙大微软用28万份肠镜报告训练医疗AI文章封面
2607.27296 更多前沿

雅马哈联手首尔大、KAIST发布SKY-Piano:11小时多模态钢琴演奏数据集

要让机器理解一次钢琴演奏,需要同时看见手怎么落键、身体怎么用力、琴键何时发声,还要能逐音对上乐谱。现有数据集却往往只占其中一两样:有的只有音频和MIDI,有的只有单视角视频,有的缺指法、缺身体动作。首尔国立大学、韩国科学技术院(KAIST)

韩国科学技术院、首尔国立大学、雅马哈等
文章封面
2607.28466 更多前沿

复旦等用28万份肠镜报告训练AI,良恶性判断接近内镜医师水平

肠镜报告里写清了病灶的部位、大小和形态,却几乎不会注明这些描述对应检查中的哪一帧画面。复旦大学(附属中山医院)联合浙江大学、微软亚洲研究院、曼彻斯特大学等机构提出EndoCLIP,一个面向结肠镜检查的视觉语言基础模型:它直接复用医院档案库中

复旦大学、浙江大学、微软亚洲研究院、曼彻斯特大学等
文章封面
2607.26886 大模型

CMU&亚马逊研究:Claude、GPT无图也编造诊断,66%的虚构还会同时承认「没图」

当被要求描述一张从未提供的医学图像时,前沿视觉语言模型不会弃权,而是会编造诊断结果。更关键的是,这些编造不是随机的——它高度依赖于患者的人口统计学特征。卡内基梅隆大学和亚马逊云科技的研究人员发现了这一现象,测试涉及Claude Opus-4

卡内基梅隆大学、亚马逊云科技等
封面
2607.22408 更多前沿

剑桥等把三次月球任务数据合成一个模型,20万个月面切片可直接搜索和找矿

同一块月面可能同时有可见光、地形、温度、雷达和重力数据,但不同仪器的分辨率、覆盖与物理含义不一样。剑桥大学、德国航空航天中心、SPAIDER SPACE、帝国理工学院等团队提出LunarFM,把三次月球任务、六种仪器的18个输入通道对齐到一

剑桥大学、德国航空航天中心、SPAIDER SPACE、帝国理工学院等
文章封面
2607.22302 更多前沿

复旦、西湖等从脑信号重建动态人脸,数据集包含62856组高清视频样本

受试者在磁共振扫描仪里观看数字人面部视频,模型再根据fMRI信号重建身份外观、表情、头部姿态和连续运动。复旦大学、西湖大学、浙江大学、南洋理工大学团队提出fMRI2Face,并构建62856组脑信号与1920×1080视频配对样本。

复旦大学、西湖大学、浙江大学、南洋理工大学等
文章封面
↑