arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

图像、视频、三维重建与视觉内容生成。

2609.18323 大模型

MiniMax-H3会生成音视频,却只答对41.97%的物理推理题

复旦大学、新加坡国立大学和腾讯团队提出一套MiniMax-H3跨模态物理推理评测,包含517个样例。模型要把文字、图像、声音和前缀视频中的不完整线索拼在一起,最终总体成功率41.97%;其中视频决策推理最高为56.00%,音频消歧最低仅27

复旦大学、新加坡国立大学、腾讯等
文章封面
2609.18602 AI基础设施

不用GPU也能跑神经压缩:中科大、微软把1080p解码压到126毫秒

中国科学技术大学与微软亚洲研究院提出PULSE,把学习型图像压缩的解码端压缩到5.2 kMAC/像素,并用整数线性CDF预测器实现跨平台逐比特一致的熵编码。论文测试中,单线程CPU解码一张1080p图像耗时126毫秒;该数字依赖具体硬件、图

中国科学技术大学、微软亚洲研究院等
文章封面
2609.17909 视觉与生成

生成视频真能玩了:Zing-0.5跑到24 FPS,每分钟不到1美分

SeedLeap.ai推出5B参数世界模型Zing-0.5,让用户同时用键盘动作和在线文字指令改变正在生成的画面。论文报告它以832×480分辨率达到24 FPS,服务器租赁成本估算约每流分钟0.009美元;不过长期状态保持和动作后果仍有限

SeedLeap.ai等
文章封面
2609.17248 视觉与生成

长视频AI只会看不会听?腾讯、清华新测试中强模型仍不到60%

腾讯、清华大学、中国科学院大学提出Video-HolmesV2,专门检查长视频AI能否把画面与声音放进同一条证据链。模型不只要选对答案,还要给出准确的视听时间位置,靠剧情常识猜中也会暴露。在这套新测试中,强专有模型准确率仍低于60%;团队还

腾讯、清华大学、中国科学院大学等
文章封面
2609.17521 视觉与生成

视频生成到一半还能改物体速度,宾大、Snap把运动误差降12%

宾夕法尼亚大学、Snap、阿卜杜拉国王科技大学提出PhysStream,让视频生成不必在开始前写死全部动作。用户可以在生成过程中给某个物体追加速度方向,模型再继续合成多物体运动。它用位置图和跟踪图保存场景状态,在合成基准上将运动分布距离降低

宾夕法尼亚大学、Snap、阿卜杜拉国王科技大学等
文章封面
2609.16409 视觉与生成

AI推理不只写草稿,还会先画图:六项视觉任务最高提升25%

达姆施塔特工业大学提出ReImaGin,让多模态模型遇到空间问题时先生成一张中间图,再根据这张图回答。它可以移除遮挡、连接轨迹,或把多个房间视角整理成平面图。在多视角空间判断、碰撞预测等六项任务上,这条“先画再想”的路线超过纯文字推理和固定

达姆施塔特工业大学等
文章封面
2609.16255 大模型

900条样本、单卡不到2小时,2B视频模型反超大四倍对手

Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校提出一套低成本视频推理蒸馏方案。团队只选约900条模型最犹豫的样本,用4B教师补充合成推理,在单张A100上训练不到两小时。得到的2B模型在三个视频问答基准上超过最高大四倍

Meta、卡内基梅隆大学、利物浦约翰摩尔大学、德克萨斯大学阿灵顿分校等
文章封面
2609.16443 具身智能与机器人

MIT、斯坦福给机器人造了60多个逼真跑酷考场,专测真实部署前翻车

南加州大学、斯坦福大学、麻省理工学院、加州大学圣迭戈分校等机构推出Neverwhere,把超过60个真实室内外场景重建成可闭环运行的机器人考场。视觉运动控制器能在部署前反复接受台阶、沟槽和障碍测试,失败条件也能复现。论文还发现,只靠3D高斯

南加州大学、斯坦福大学、麻省理工学院、加州大学圣迭戈分校等
文章封面
2609.13269 视觉与生成

不用AI分类器也能抓准翻手瞬间:240段干扰动作零误报

独立研究者提出一种几何手势检测法,把张开手掌绕长轴翻转写成单个标量的过零事件,无需分类器、训练数据或用户校准。带精确真值的实验中,它检出95%的翻转,对240段相似干扰动作零误报,并把时刻定位到平均6.7毫秒;方法只适用于这一类动作且依赖上

独立研究者等
文章封面
2609.13947 AI基础设施

视觉数据压低18816倍,传感器还没出片就先做计算

凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学和德州大学奥斯汀分校提出OASIS,让传感器附近的小编码器先提取任务信息再传输。特定视觉唤醒模型配置把数据量压到原始8比特图像的1/18816,系统能耗降低约2至4.5倍;部分芯片结果来自仿

凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学、德州大学奥斯汀分校等
文章封面
2609.13251 视觉与生成

微软让AI扩图别乱改主角,主体误差平均降10.8%

微软与弗吉尼亚理工大学提出主体清晰度外扩框架,专门处理人物、车辆或文字被裁掉一部分的难题。它用视觉语言提示确认主角,再以多尺度小波监督补回局部细节;四套基准上,相比各数据集最强方法,主体误差平均降10.8%,结果仍取决于原图与主体类型。

微软、弗吉尼亚理工大学等
文章封面
2609.15503 视觉与生成

苏黎世联邦理工造了100万张假文档,专治拍照弯曲和阴影

苏黎世联邦理工学院发布SyntheticDoc,用物理模拟与路径追踪生成100万张高分辨率文档训练样本,覆盖弯曲、折叠、褶皱和复杂光照。数据同时给出UV图、法线、反照率与阴影等像素级标注;但它仍是合成数据,跨真实手机和纸张的表现要以实测为准

苏黎世联邦理工学院等
文章封面
2609.15128 大模型

画面先骗人、声音后纠错:新方法让流式多模态模型别急着下结论

香港大学、香港科技大学(广州)、萨塞克斯大学和LIGHTSPEED提出Omni-Streaming Thinking,让实时音视频模型把早期判断先标成待验证,而不是立刻当事实。冻结Qwen3-Omni骨干并加轻量适配后,它在五项基准上相对最

香港大学、香港科技大学(广州)、萨塞克斯大学、LIGHTSPEED等
文章封面
2609.15570 具身智能与机器人

机器人预测未来只用一步,DIDO在LIBERO成功率做到99%

中科院自动化所、智源研究院、西安交通大学和亚马逊提出DIDO,把多步视频世界动作模型压缩成一次去噪。它在LIBERO平均成功率达到99.0%,LIBERO-Plus为76.6%,RoboTwin为92.0%;99%是仿真基准成绩,真实机器人

中科院自动化所、智源研究院、西安交通大学、亚马逊等
文章封面
2609.15810 AI基础设施

英伟达等把视频注意力压到低比特,工作站显卡最高快3.6倍

Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只

Nunchux AI、麻省理工学院、卡内基梅隆大学、英伟达等
文章封面
2609.14156 具身智能与机器人

UCLA把触觉画进画面,机器人实机成功率平均提升30个百分点

加州大学洛杉矶分校提出Visible Touch,把接触位置渲染成机器人视觉策略能直接读取的画面标记,不必另建触觉编码器。接上团队自制的低成本磁传感器后,π0.5在四项真实接触任务中的成功率平均提高30个百分点;这个结果只对应论文测试的任务

加州大学洛杉矶分校等
文章封面
2609.12342 视觉与生成

人和动物共用一个动作模型,14.6万段动作跨过骨骼差异

澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)提出UniMo,用统一表示学习人和动物动作。配套UniML3D包含145907段动作与433388条描述,动物规模约为AnimalML3D的102倍;数据主要来自既有与合成资源,

澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)等
文章封面
2609.12830 视觉与生成

给AI图片调情绪不换内容,3300组实验测住语义漂移

兰州大学、中国矿业大学、深圳大学、新加坡国立大学等机构联合提出一种情绪可控图像方法,目标是只改变AI图片的情绪、不把内容一起换掉。方法用中性图作为语义锚点,在3300个提示词与情绪组合上降低情绪误差并改善CLIPScore;实验基于指定生成

兰州大学、中国矿业大学、深圳大学、新加坡国立大学等
文章封面
2609.12090 视觉与生成

视频AI记错了也能用?错误记忆竟保住94.1%收益

伊利诺伊大学厄巴纳-香槟分校、Adobe研究院联合提出“替换记忆”实验,检查视频模型到底从历史帧拿走了什么。WorldMem中,来自同一轨迹但地点错误的记忆仍保留相对零内容参考94.1%的PSNR收益;这说明收益可能来自运动和场景先验,但结

伊利诺伊大学厄巴纳-香槟分校、Adobe研究院等
文章封面
↑