ECCV 2026|英伟达等提出HRDiT,现成DiT不重训也能生成8K图像
把FLUX、Stable Diffusion 3这类DiT直接拉到8K,常出现窗户错位、物体重复和整体结构散架,计算时间也陡增。兰卡斯特大学、华南理工大学与英伟达AI技术中心提出ECCV 2026论文HRDiT,通过空间位置重排和分层注意力
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
把FLUX、Stable Diffusion 3这类DiT直接拉到8K,常出现窗户错位、物体重复和整体结构散架,计算时间也陡增。兰卡斯特大学、华南理工大学与英伟达AI技术中心提出ECCV 2026论文HRDiT,通过空间位置重排和分层注意力
奥尔堡大学、上奥地利应用科学大学等机构的研究者提出一套RGB与热红外视频融合方法,用于无人机马鹿调查,相关工作入选ECCV 2026。在4次飞行记录的26只马鹿中,融合方法正确分类25只;单独使用任一模态都只能认对20只。普通相机会让棕色身
扩散语言模型可以并行修改多个词元,但长序列中的全注意力仍会吃掉大量计算。Apple、Google DeepMind与哈佛大学研究者在MIT开展的工作提出LLaDA-Hybrid:把16B模型20层中的6层换成块级混合注意力,再通过两阶段轻量
能识别显微图、读懂谱图,再据此判断实验结论,和背出科学知识不是一回事。阿里通义、浙江大学、清华大学与中国科学院大学等团队推出SEE,收集1116道以真实实验图像为核心的问题,覆盖19个多模态大模型。标准评测中,模型准确率分布在15.9%到4
人类视频数量巨大,但把其中的手部动作直接复制给机械手,常因手指数量、关节长度和运动范围不同而失败。南京大学与中国移动研究院提出C2Dex,从单目人类视频中提取稳定的物体接触关系,再把它迁移到机器人灵巧手。在DexYCB任务上,其宽松标准成功
给花朵换颜色、改海报上的文字,生成模型往往能改对内容,却在掩码边缘留下色差、硬线或纹理断裂。商汤研究院、北京航空航天大学与南洋理工大学等团队提出MaskFlow,把编辑区域直接写进生成路径,并用Soft-Poisson机制处理边界融合。完整
医疗AI在一道选择题上答对,不代表它能完成一次真正的接诊。Google DeepMind联合多家医院提出ResidencyRL,让模型在最长60轮对话、最多8次工具调用的模拟门诊中练习问诊、检查、诊断、治疗和记录。在97个病例的医生盲评中,
让视频世界模型模拟“向前走、转弯、再回到原地”,画面经常会悄悄换成另一处。英伟达、普林斯顿大学、多伦多大学与Vector Institute提出WorldTrace,无需重新训练模型,只改推理时的记忆缓存,就能把持续时间从数秒推向分钟尺度;
网页智能体点完几下按钮,再返回一句“任务完成”,并不代表它真的按用户要求做对了。谷歌与加州大学洛杉矶分校推出WebRider,在42个真实网站上构造4096份可检查的“意图合同”。最强配置有99.2%的任务能够正常停机,但同时满足全部合同门
让人形机器人学会一个动作,麻烦的往往不是动作本身,而是要把机器人搬到不同房间、不同位置反复采集真机画面。小鹏机器人与香港理工大学提出R2S-EGO:只用6次真实采集、共48个第一视角观测,再让生成模型补出策略可能遇到的画面,宇树G1的实机坐
智能体完成一段几十轮任务后只得到成功或失败总分,训练算法往往把同一奖励广播给每一步,难以区分真正扭转结果的动作。清华大学、浙江大学和美团提出AgentOPSD,把信用重新分配到每一轮。
给时间序列模型检索历史案例,曲线形状相似却可能高低不同、时间错位,直接塞进上下文反而会误导预测。斯坦福大学与亚马逊提出Align-RAG,用两个免训练变换先对齐振幅和相位。
训练时摄像头在桌面左侧,部署时换到右侧,机器人可能把图像坐标误当成任务空间位置。伊利诺伊大学厄巴纳-香槟分校与哈佛大学提出ARGUS,先把任意视角转换成标准机位,再交给现有视觉动作策略。
模型同时收到视频、音频、图片和文字,文字若与其他证据冲突,它常直接跟着文字回答。微软研究院印度分院与IIIT Hyderabad推出C3PO基准,最佳模型准确率73.17%,人类为88.64%。
处理器微架构要在性能、功耗和面积之间反复取舍,但一次PPA评估就可能需要昂贵仿真。东南大学、国家EDA技术创新中心、英伟达、复旦、中科院计算所和北大等团队提出MicroEvo,在论文设置下把搜索效率做到NSGA-II的10.6倍。
输入人物描述和长段讲话文本,不提供音轨,也不提供第一帧,模型可以一边生成声音一边生成画面。Vorch团队联合同济大学、哈工大(深圳)和上海交大公布Vorch-Streamer,在单张H200上达到27.12 FPS。
一段视频平均88.8分钟,问题没有选择项,还可能要求模型回忆半小时前的画面或主动发出提醒。香港科技大学、小红书、香港大学和香港中文大学推出StreamArena,用243段完整视频和3646个开放题测试流式视频智能体。
视觉模型能描述眼前的桌椅,却未必知道自己走到了房间哪一侧。字节跳动Seed、浙江大学和新加坡国立大学推出GST-Bench,测试22个视觉语言模型后,最强零样本模型得分42.68,人类为79.08,相差36.4分。
上传一张角色图和一段驱动视频,系统可以让新角色复现动作,并用文字改变输出镜头。阿里巴巴通义实验室公布的Wan-Animate-2还提供轻量版,在400×720分辨率、4张NVIDIA H100上达到24 FPS。
韩国科学技术院、中国科学技术大学和微软亚洲研究院提出一种稀疏dToF深度补全模型。它只用合成数据训练,却在六个数据集和三款真实直接飞行时间传感器上做零样本测试,把低分辨率、带噪的测距点补成密集度量深度图。