arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

共 149 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.07003 cs.CV

ECCV 2026|英伟达等提出HRDiT,现成DiT不重训也能生成8K图像

把FLUX、Stable Diffusion 3这类DiT直接拉到8K,常出现窗户错位、物体重复和整体结构散架,计算时间也陡增。兰卡斯特大学、华南理工大学与英伟达AI技术中心提出ECCV 2026论文HRDiT,通过空间位置重排和分层注意力

兰卡斯特大学、华南理工大学、英伟达AI技术中心等
HRDiT生成的高分辨率粉色玩具屋文章封面
2608.06973 cs.CV

ECCV 2026|无人机融合RGB与热成像,26只马鹿认对25只

奥尔堡大学、上奥地利应用科学大学等机构的研究者提出一套RGB与热红外视频融合方法,用于无人机马鹿调查,相关工作入选ECCV 2026。在4次飞行记录的26只马鹿中,融合方法正确分类25只;单独使用任一模态都只能认对20只。普通相机会让棕色身

奥尔堡大学、上奥地利应用科学大学等
无人机RGB与热成像中的多只马鹿对照文章封面
2608.06628 cs.LG

Apple&Google DeepMind改造16B扩散模型,换6层注意力吞吐提1.7倍

扩散语言模型可以并行修改多个词元,但长序列中的全注意力仍会吃掉大量计算。Apple、Google DeepMind与哈佛大学研究者在MIT开展的工作提出LLaDA-Hybrid:把16B模型20层中的6层换成块级混合注意力,再通过两阶段轻量

哈佛大学等
LLaDA-Hybrid两阶段注意力改造流程的文章封面
2608.06931 cs.AI

阿里通义SEE给19个多模态模型出实验题,最强准确率也没过50%

能识别显微图、读懂谱图,再据此判断实验结论,和背出科学知识不是一回事。阿里通义、浙江大学、清华大学与中国科学院大学等团队推出SEE,收集1116道以真实实验图像为核心的问题,覆盖19个多模态大模型。标准评测中,模型准确率分布在15.9%到4

中国科学院大学、清华大学、浙江大学等
化学、生物与材料实验图表题的文章封面
2608.07045 cs.CV · cs.RO

南大&中国移动提出C2Dex,一段人类视频教灵巧手稳定抓物

人类视频数量巨大,但把其中的手部动作直接复制给机械手,常因手指数量、关节长度和运动范围不同而失败。南京大学与中国移动研究院提出C2Dex,从单目人类视频中提取稳定的物体接触关系,再把它迁移到机器人灵巧手。在DexYCB任务上,其宽松标准成功

南京大学、中国移动研究院等
人类操作与机器人灵巧手复现动作的文章封面
2608.06929 cs.AI · cs.CV

商汤&北航等提出MaskFlow,局部修图不再留下生硬接缝

给花朵换颜色、改海报上的文字,生成模型往往能改对内容,却在掩码边缘留下色差、硬线或纹理断裂。商汤研究院、北京航空航天大学与南洋理工大学等团队提出MaskFlow,把编辑区域直接写进生成路径,并用Soft-Poisson机制处理边界融合。完整

北京航空航天大学、南洋理工大学等
花朵与猫咪局部编辑效果对比的文章封面
2608.07418 cs.AI · cs.CL

Google DeepMind发表ResidencyRL,临床AI在模拟问诊中获87.6%医生偏好

医疗AI在一道选择题上答对,不代表它能完成一次真正的接诊。Google DeepMind联合多家医院提出ResidencyRL,让模型在最长60轮对话、最多8次工具调用的模拟门诊中练习问诊、检查、诊断、治疗和记录。在97个病例的医生盲评中,

Google DeepMind等
模拟患者病例与临床智能体问诊界面的文章封面
2608.07408 cs.CV · cs.LG

英伟达WorldTrace让视频世界模型记住走过的场景,回访一致性提19.5%

让视频世界模型模拟“向前走、转弯、再回到原地”,画面经常会悄悄换成另一处。英伟达、普林斯顿大学、多伦多大学与Vector Institute提出WorldTrace,无需重新训练模型,只改推理时的记忆缓存,就能把持续时间从数秒推向分钟尺度;

英伟达、普林斯顿大学、多伦多大学等
视频世界模型离开森林后再次返回同一场景的文章封面
2608.06704 cs.AI · cs.HC

谷歌WebRider揭开网页智能体假完成:99.2%交差,只有38.8%守规矩

网页智能体点完几下按钮,再返回一句“任务完成”,并不代表它真的按用户要求做对了。谷歌与加州大学洛杉矶分校推出WebRider,在42个真实网站上构造4096份可检查的“意图合同”。最强配置有99.2%的任务能够正常停机,但同时满足全部合同门

谷歌等
网页智能体操作轨迹与人工审核界面的文章封面
2608.06827 cs.CV · cs.GR

小鹏机器人R2S-EGO让宇树G1学坐下,实机成功率从10%升至82.5%

让人形机器人学会一个动作,麻烦的往往不是动作本身,而是要把机器人搬到不同房间、不同位置反复采集真机画面。小鹏机器人与香港理工大学提出R2S-EGO:只用6次真实采集、共48个第一视角观测,再让生成模型补出策略可能遇到的画面,宇树G1的实机坐

小鹏机器人、香港理工大学等
宇树G1在不同场景执行坐下任务的文章封面
2608.05987 cs.AI · cs.LG

智能体走对100步,奖励该算给哪一步?AgentOPSD把信用分到每轮

智能体完成一段几十轮任务后只得到成功或失败总分,训练算法往往把同一奖励广播给每一步,难以区分真正扭转结果的动作。清华大学、浙江大学和美团提出AgentOPSD,把信用重新分配到每一轮。

清华大学、浙江大学、美团等
智能体走对100步,奖励该算给哪一步?AgentOPSD把信用分到每轮文章封面
2608.05579 cs.RO

摄像头一挪机器人就失手,ARGUS先把画面统一到同一机位

训练时摄像头在桌面左侧,部署时换到右侧,机器人可能把图像坐标误当成任务空间位置。伊利诺伊大学厄巴纳-香槟分校与哈佛大学提出ARGUS,先把任意视角转换成标准机位,再交给现有视觉动作策略。

伊利诺伊大学厄巴纳-香槟分校、哈佛大学等
摄像头一挪机器人就失手,ARGUS先把画面统一到同一机位文章封面
2608.06183 cs.AI

让大模型参与芯片微架构搜索:MicroEvo效率做到10.6倍

处理器微架构要在性能、功耗和面积之间反复取舍,但一次PPA评估就可能需要昂贵仿真。东南大学、国家EDA技术创新中心、英伟达、复旦、中科院计算所和北大等团队提出MicroEvo,在论文设置下把搜索效率做到NSGA-II的10.6倍。

东南大学、国家EDA技术创新中心等
让大模型参与芯片微架构搜索:MicroEvo效率做到10.6倍文章封面
2608.05663 cs.CV · cs.SD

文字直接生成会说话的数字人,Vorch-Streamer跑到27.12 FPS

输入人物描述和长段讲话文本,不提供音轨,也不提供第一帧,模型可以一边生成声音一边生成画面。Vorch团队联合同济大学、哈工大(深圳)和上海交大公布Vorch-Streamer,在单张H200上达到27.12 FPS。

Vorch团队、同济大学等
文字直接生成会说话的数字人,Vorch-Streamer跑到27.12 FPS文章封面
2608.05703 cs.CV

视频智能体看一小时后还记得什么?小红书等团队做了场硬测

一段视频平均88.8分钟,问题没有选择项,还可能要求模型回忆半小时前的画面或主动发出提醒。香港科技大学、小红书、香港大学和香港中文大学推出StreamArena,用243段完整视频和3646个开放题测试流式视频智能体。

香港科技大学、香港大学、香港中文大学等
视频智能体看一小时后还记得什么?小红书等团队做了场硬测文章封面
2608.05747 cs.CV

看完整段视频仍会迷路:22个视觉模型与人类差36.4分

视觉模型能描述眼前的桌椅,却未必知道自己走到了房间哪一侧。字节跳动Seed、浙江大学和新加坡国立大学推出GST-Bench,测试22个视觉语言模型后,最强零样本模型得分42.68,人类为79.08,相差36.4分。

浙江大学、新加坡国立大学等
看完整段视频仍会迷路:22个视觉模型与人类差36.4分文章封面
2608.06009 cs.CV

阿里Wan-Animate-2把角色动画跑到24 FPS,还能用文字改机位

上传一张角色图和一段驱动视频,系统可以让新角色复现动作,并用文字改变输出镜头。阿里巴巴通义实验室公布的Wan-Animate-2还提供轻量版,在400×720分辨率、4张NVIDIA H100上达到24 FPS。

阿里巴巴通义实验室等
阿里Wan-Animate-2把角色动画跑到24 FPS,还能用文字改机位文章封面
2608.04737 cs.CV · cs.GR

低分辨率深度传感器也能生成密集3D:合成训练跨过3款真实设备

韩国科学技术院、中国科学技术大学和微软亚洲研究院提出一种稀疏dToF深度补全模型。它只用合成数据训练,却在六个数据集和三款真实直接飞行时间传感器上做零样本测试,把低分辨率、带噪的测距点补成密集度量深度图。

韩国科学技术院、中国科学技术大学、微软亚洲研究院等
低分辨率深度传感器也能生成密集3D:合成训练跨过3款真实设备文章封面