arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.13560 Agent

美团北大清华等开源AutoDesign:40分钟把论文做成会议海报,成本不到3美元

把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,A

美团、北京大学、清华大学、香港中文大学等
AutoDesign自动生成学术会议海报的文章封面
2608.12313 视觉与生成

阿里通义等提出AVA-Encoder:把电影拆成知识图谱,视频Agent可直接查询和编辑

阿里通义、上海科技大学、香港科技大学等团队提出AVA-Encoder,把视频编码成知识图谱,再从图谱重建回视频。图中的文本节点记录镜头层级、状态和剧情信息,资产层链接图像、音频与视频,Agent可以查询人物、定位片段或修改关系,而不必每次重

上海科技大学、香港科技大学等
文章封面
2608.12262 大模型

百度牛津等推出Diagram-MMU:AI能看懂科研图,却很难把它画成可编辑代码

多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求

南京理工大学、牛津大学等
文章封面
2608.11650 大模型

网易有道开源Confucius4-TTS:14种语言克隆声音,参考音频不用先转写

只有一段参考录音,不知道录音里说了什么,模型也能提取音色并用另一种语言合成新内容。网易有道发布Confucius4-TTS技术报告,系统覆盖14种语言,支持同语种和跨语种零样本声音克隆,不要求在推理前准备提示音频的文字稿;代码、模型权重和演

网易有道等
文章封面
2608.11605 具身智能与机器人

机器人不用生成视频也能预演未来:交大等提出ForeWAM,LIBERO成功率超96%

机器人在抓杯子、开抽屉前,如果能预测“动作之后场景会怎样变化”,通常更容易规划下一步。上海交通大学、ACE Robotics和南洋理工大学提出ForeWAM,让动作模型获得未来动态,却不在部署时真正生成未来视频;标准版和加速版在LIBERO

上海交通大学、南洋理工大学等
文章封面
2608.11367 视觉与生成

Google联合UIUC开源GazeAnywhere:一句话指定人物,AI直接判断他在看哪里

一张多人照片里,输入“穿红衣服的男孩”,模型先找到指定人物,再画出他的视线落点;也可以直接点击画面坐标来选人。Google与伊利诺伊大学香槟分校提出GazeAnywhere,并开源12万组带提示标注的Gaze-Co数据,把注视估计从固定检测

Google、伊利诺伊大学香槟分校等
文章封面
2608.07887 具身智能与机器人

日本团队给机器人装上软硬仿生指尖,贴桌硬币也能抓起6种日元

日本电气通信大学团队设计了一种混合硬度仿生指尖,中央指肚使用软硅胶,两侧换成更硬的材料,内部保留类似指甲的刚性结构。机器人不用先把硬币推到桌边,也不需要在底部留缝,就能从硬平面上抬起硬币。

电气通信大学等
文章封面
2608.08814 Agent

东大把秋叶原85条街搬进360CityArena,Gemini导航得分仅17.1%

东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。

东京大学等
文章封面
2608.09771 具身智能与机器人

清华&北智院等提出SLIM-0.5B:小模型操控机器人,推理延迟压到60.6毫秒

复旦大学、北京智源人工智能研究院、清华大学和中国人民大学提出SLIM,一个只有0.47B参数的机器人操作策略。它不用大型多模态骨干每个控制步都重做开放域理解,而是学习与动作和状态变化紧密相关的紧凑潜表示。

复旦大学、清华大学、中国人民大学等
文章封面