arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.24724 具身智能与机器人

斯坦福、交大、清华给水下机器人装上“海豹胡须”,20次辨路成功17次

鱼游过后,水中会留下持续一段时间的涡流。海豹能用胡须读取这些尾流,在黑暗或浑浊水体里追踪目标。斯坦福大学、上海交通大学、清华大学把这一机制做成光纤布拉格光栅触须,并装到小型水下机器人前端。

斯坦福大学、上海交通大学、清华大学等
文章封面
2608.24572 更多前沿

Meta做了一只光纤传感手套,60Hz捕捉手势、指尖误差4.9毫米

手指被杯子、工具或另一只手挡住时,摄像头很容易丢点;依赖惯性或磁场的传感手套又会遇到漂移和干扰。Meta、西北大学提出一套光纤传感手套,用沿手指铺设的多芯形状传感光纤直接恢复三维曲线,再以60Hz重建完整手部姿态。

Meta、西北大学等
文章封面
2608.21378 AI基础设施

不到68万字节,sanoTTS无需NPU在ESP32上实时生成语音

一个完整神经语音合成系统,从音素ID一路生成22.05kHz波形,部署图只有567008个参数,两个int8数据块合计679832字节。Ampixa Labs提出sanoTTS,在不使用神经加速器的ESP32-S3上,生成4.54秒语音耗时

Ampixa Labs等
文章封面
2608.22039 视觉与生成

Google DeepMind用100段360°视频测三维重建,多种新方法仍频繁失准

只要镜头快速转动、前景有人群穿过,或大半画面被水面和白墙占据,三维重建就可能把相机轨迹算错。Google DeepMind、多伦多大学、西蒙菲莎大学提出ORBIT,用100段来自360°视频的真实片段,专门测试运动恢复结构在动态、低纹理和复

Google DeepMind、多伦多大学、西蒙菲莎大学等
文章封面
2608.22906 视觉与生成

浙大&上海AI实验室等用单目视频实时重建水下,定位误差降低13.2%

水下单目视频不仅缺少尺度信息,还会被光线衰减、散射和颜色偏移干扰。浙江大学、上海人工智能实验室、上海交通大学、清华大学等机构提出AquaFlow,让系统一边接收视频,一边估计相机轨迹并更新3D高斯场景。62条水下轨迹上,平均定位误差比Wat

浙江大学、上海人工智能实验室、上海交通大学、清华大学等
文章封面
2608.23318 Agent

百度&浙大用高斯分布给智能体提示,ALFWorld成功率最高98.4%

长程智能体在强化学习早期很难碰到成功轨迹,一种办法是先替它执行专家轨迹的前半段,再让策略从更接近目标的位置探索。浙江大学、百度、山东大学提出Agent-G2,不再为所有任务固定同一段提示长度,而是按任务从动态高斯分布中采样。Qwen2.5-

浙江大学、百度、山东大学等
文章封面
2608.23478 具身智能与机器人

浦项科大让机器人先理解动作目的,GR00T成功率从64.3%升至84.7%

行为克隆告诉机器人“这个时刻手臂该怎么动”,却不直接说明这段动作要完成什么局部目标。浦项科技大学提出INDI,用教师视觉语言模型从执行视频中提炼行为意图,再监督VLA动作解码器。SimplerEnv-Bridge上,GR00T-N1.7平均

浦项科技大学等
文章封面
2608.21460 Agent

Patronus AI记录200小时Figma设计过程,训练智能体学会人类工作流

给模型一张优秀网页截图,它能学到最终像素,却看不到设计师如何选图层、建样式、调整间距、撤销错误。Patronus AI推出FigmaTrace,记录超过200小时的人类Figma操作视频,将其转换为3469条设计轨迹,覆盖126项开放式长程

Patronus AI等
文章封面
2608.22419 具身智能与机器人

浙大&上交等给机器人训练时遮住部分信息,双臂任务成功率提升超30%

双臂机器人同时读取多个相机画面和语言指令时,更多信息不一定带来更稳定的动作。上海创新研究院、浙江大学、上海交通大学、中国科学技术大学等机构提出M3:训练时随机遮掉部分模态通道,不改模型结构,也不增加大规模机器人预训练。三项真实长程任务中,平

上海创新研究院、浙江大学、上海交通大学、中国科学技术大学等
文章封面
2608.23189 视觉与生成

京东&港科大等提出EchoWM:边走边生成720p画面、环境声和语音

在生成场景里向前走、转弯或绕着角色移动时,画面、环境声、音乐和对白同时延续。京东探索研究院、香港科技大学、北京大学、斯坦福大学等机构提出EchoWM,用连续导航信号控制720p视频,并联合生成与场景同步的音频。

京东探索研究院、香港科技大学、北京大学、斯坦福大学等
文章封面
2608.23565 视觉与生成

阿里&港科广提出ReWorld:走出64秒再回头,AI世界仍记得起点

交互式世界模型跟随按键向前走并不难,难的是走远以后再回来,场景还要与起点一致。香港科技大学(广州)、阿里巴巴ATH实验室提出ReWorld,在64秒、384个潜变量的往返轨迹中,只保留固定12个视频块的缓存,仍能恢复开头看到的场景。

香港科技大学(广州)、阿里巴巴ATH实验室等
文章封面
2608.21424 视觉与生成

Adobe把6类视频生成编辑塞进一个模型,4步推理实现720p实时流式输出

同一个视频模型,既能从文字或图片生成画面,也能改角色、传递首帧编辑、转换已有视频和重新安排镜头。Adobe研究院、罗切斯特大学提出EditStream,把六类生成与编辑任务合进一套DiT权重,再将多步扩散过程压缩为4步自回归推理。论文评测中

Adobe研究院、罗切斯特大学等
文章封面
2608.20387 大模型

作业帮提出Poly-InstructTTS,用自然语言控制1000多种语音情绪与风格

“压低声音,带一点犹豫,像在嘈杂房间里提醒同伴”,这类描述比“悲伤”“兴奋”标签复杂得多。作业帮提出Poly-InstructTTS,用开放自然语言同时控制情绪、风格、口音和副语言行为。团队从影视视听素材构建1000小时指令标注语料,覆盖1

作业帮等
文章封面
2608.20720 具身智能与机器人

同济&中科院让机器人看一张照片就找把手,覆盖473类物体

“拿住杯把”“按下按钮”“握住喷嘴”都要求机器人把一句自然语言落到物体的具体3D区域。以往方法常假设已经有完整点云和固定动作类别。同济大学与中国科学院提出AffordAny,从一张RGB图片出发重建物体,再根据自由文本定位可操作部位。自动管

同济大学、中国科学院等
文章封面
2608.20534 视觉与生成

NVIDIA把单段第三人称视频转成第一视角,补全镜头看不到的区域

把厨房角落的第三人称录像改成操作者头戴相机视角,镜头旋转幅度可能超过普通新视角合成的范围,身体和台面还会遮住大量区域。NVIDIA提出Grounded-Exo2Ego,从单段外部视频重建场景几何,再用物体级语义补全第一人称镜头中原视频看不到

NVIDIA等
文章封面
2608.20492 大模型

南开&西工大等让视频模型省掉思维链,解码从4780毫秒降至130毫秒

视频模型做强化学习时,一组采样答案可能全都不够好,模型只能在一堆错误里挑相对高分者。南开大学、西北工业大学、中科院自动化所和南开深圳研究院提出OraRL,把每条人工标注直接序列化成一条“标准轨迹”,同时保留模型自己的探索。Video-ORA

南开大学、西北工业大学、中科院自动化所、南开深圳研究院等
文章封面
2608.21360 大模型

南大&南开等测试实时视频助手:Gemini-3-Pro最高仅得66.4分

普通视频问答只要求模型看完片段再回答,实时助手的建议会改变用户下一步动作。南京大学、南开大学和滑铁卢大学联合构建OmniAssistBench,用连续视频片段测试模型能否记住历史、读懂手势、等待关键事件并在正确时间提醒。榜单中Gemini-

南京大学、南开大学、滑铁卢大学等
文章封面
2608.20614 Agent

NVIDIA实测145个Agent Skill:文档检查过关,不等于运行有效

一个Agent Skill的说明文档格式完整、写得清楚,不代表模型会在真实任务中找到它、按对步骤执行并交付正确结果。NVIDIA提出ACES,把同一任务分别交给“有Skill”和“无Skill”的Agent运行,再计算Skill带来的边际增

NVIDIA等
文章封面
2608.20868 视觉与生成

IBM用2.56亿参数模型直接读表单,比Qwen2.5-VL小27倍、快5倍

一张表单里,“项目名称”对应哪段长文本、一个字段是否连着多个值,传统流程通常先OCR,再做实体识别与关系抽取。IBM苏黎世研究院和苏黎世联邦理工提出端到端方案,微调2.56亿参数SmolDocling,直接从文档图片生成键、值、边界框和连接

IBM苏黎世研究院、苏黎世联邦理工等
文章封面
2608.20735 具身智能与机器人

清华&上海AI实验室等让机械臂预判传送带,抓取完成数从23次增至44次

传送带上的物体不会等机械臂想清楚再进入抓取区。清华大学、上海AI实验室、哈尔滨工业大学和云深处科技联合提出ForeTime-VLA,把世界动作模型看到的未来压缩成训练信号,部署时只看过去八帧。三档速度的实机测试中,它完成44/90次抓取,π

清华大学、上海AI实验室、哈尔滨工业大学、云深处科技等
文章封面