英伟达等把视频注意力压到低比特,工作站显卡最高快3.6倍
Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只
Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只
加州大学洛杉矶分校提出Visible Touch,把接触位置渲染成机器人视觉策略能直接读取的画面标记,不必另建触觉编码器。接上团队自制的低成本磁传感器后,π0.5在四项真实接触任务中的成功率平均提高30个百分点;这个结果只对应论文测试的任务
百度提出VideoXAgent,让AI面对小时级视频时先按问题检索,再调用字幕、画面和音频工具取证。它用约5万Token智能体上下文,在Video-MME-Long、LVBench和MINERVA分别达到85.1%、76.5%和65.7%;
作业帮发布DuplexDrama,用合成流程构造包含打断、附和、说半句和环境声的双工语音数据,总音频超过2000小时,并计划开放6400段双语对话、合计800小时的子集。它补足真实交谈的重叠现象;但主体是合成语音,不能等同于真实用户分布与隐
微软研究院、清华大学提出ESRL,在混合专家模型后训练时直接探索不同专家路由,而不是只提高文本采样温度。Qwen3-30B-A3B上,平均Pass@1和Pass@8比GRPO提高3.2与4.5个百分点;结果来自指定数学推理基准,不能推断所有
澳大利亚国立大学、阿德莱德大学、西湖大学、香港科技大学(广州)提出UniMo,用统一表示学习人和动物动作。配套UniML3D包含145907段动作与433388条描述,动物规模约为AnimalML3D的102倍;数据主要来自既有与合成资源,
兰州大学、中国矿业大学、深圳大学、新加坡国立大学等机构联合提出一种情绪可控图像方法,目标是只改变AI图片的情绪、不把内容一起换掉。方法用中性图作为语义锚点,在3300个提示词与情绪组合上降低情绪误差并改善CLIPScore;实验基于指定生成
伊利诺伊大学厄巴纳-香槟分校、Adobe研究院联合提出“替换记忆”实验,检查视频模型到底从历史帧拿走了什么。WorldMem中,来自同一轨迹但地点错误的记忆仍保留相对零内容参考94.1%的PSNR收益;这说明收益可能来自运动和场景先验,但结
北京航空航天大学、阿里巴巴提出ProactiveBench,专门测试视频AI什么时候该开口。六个系统中有四个“提前响应”比“错过事件”更常见,比例从2.1倍到28倍;基准揭示的是受控视频任务中的时间判断,不等同于真实产品已造成同等风险。
清华大学、Xspark AI、香港科技大学(广州)、香港大学提出MoPA,让移动机器人不必停稳后再伸手,而是在行进中持续观察和操作。四项真机任务平均完整成功率76.3%,比最强基线高12.5个百分点;实验仍是室内受控任务,尚未证明在人群和开
AMD发布AMDKernelVault,把62153条执行验证的HIP内核、39893条Triton内核和2377条ROCm问答整理成训练资源,并用它训练本地8B模型智能体。它补上了GPU代码AI长期偏向CUDA的数据缺口;但正确性来自指定
北大前沿计算研究中心、银河通用机器人提出FoldNet++,让双臂机器人只看合成演示就学会展开和折叠T恤,真机端到端成功率超过90%。这意味着难采、慢采的真实机器人数据有机会被大规模仿真替代;不过实验集中在T恤和受控桌面,不能直接外推到所有
洛桑联邦理工学院、香港科技大学提出SwarmNxt,把无人机硬件组装、批量软件部署、ROS 2导航、规划和深度估计整理成开放平台。6架无人机完成高速互避,4架在障碍环境集体飞行;两组实验都在8×8×4米室内运动捕捉场地进行。
苏黎世联邦理工学院软体机器人实验室提出一套实时控制方法,让灵巧手只靠手指转动握住的笔,不用强化学习、仿真训练或预采集演示。控制器在笔记本CPU上约18秒完成初始化,实体手多次书写的平均平面误差为0.6毫米;速度提高后误差会明显变大。
西蒙菲莎大学、宾夕法尼亚大学、阿尔伯塔机器智能研究院提出IMLE-VLA,把机器人动作头从10次迭代采样改成一次生成,推理频率由15Hz升至55Hz。它在LIBERO平均成功率98.0%,真机也更顺更快;98.0%属于仿真基准,真机只验证4
乔治亚理工学院提出Recursive Code World Models,让视觉语言编程智能体从一张参考图生成可执行3D场景代码。它先搭整体,再递归进入局部补建筑和关系,最后回到全局修边界;中世纪村落实验的PSNR从16.8升到19.0,但
Adobe Research、伍斯特理工学院提出CamPilot,让多个智能体先规划故事、镜头角度、相机运动和焦点,再按拍摄脚本生成多镜头视频。团队从14,581部视频整理99,975个镜头用于训练和评测;成绩来自自建CamEval与自动指
阿里巴巴、北京大学提出DIAL,从视频扩散模型内部找出能定位参考主体的注意力图,用它在推理时调节保真强度,并在训练时自动构造偏好样本。Kaleido骨干上的FaceSim从43.80%升至57.46%,相对提高31.2%;评测基于180条提
Adobe Research、威廉与玛丽学院提出Overpainting,用白、灰、黑三值蒙版告诉AI哪些像素必须修改、可以修改和绝对不能动。它既能保护背景,又允许模型在物体边缘补足上下文;结果来自研究原型和用户实验,并非Adobe商业软件
论文公开页面未披露作者机构。SenseNova-U1.5是一款8B混合专家统一视觉模型,把图像理解、生成、编辑、多图参考和图文交错输出放进同一套端到端架构,并增加512到4096像素的高分辨率训练阶段;4K是论文报告的原生能力,不代表所有公