arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

共 149 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.12313 cs.CL · cs.CV

阿里通义等提出AVA-Encoder:把电影拆成知识图谱,视频Agent可直接查询和编辑

阿里通义、上海科技大学、香港科技大学等团队提出AVA-Encoder,把视频编码成知识图谱,再从图谱重建回视频。图中的文本节点记录镜头层级、状态和剧情信息,资产层链接图像、音频与视频,Agent可以查询人物、定位片段或修改关系,而不必每次重

上海科技大学、香港科技大学等
文章封面
2608.12262 cs.AI · cs.CV

百度牛津等推出Diagram-MMU:AI能看懂科研图,却很难把它画成可编辑代码

多模态模型可以回答图里哪条曲线更高,却未必能把同一张科研图准确还原成可编辑TikZ代码。百度、牛津大学、南京理工大学等团队推出Diagram-MMU,收录3700张精选科研图和1.83万道人工验证问题,测试12个模型的读图、图转代码和按要求

南京理工大学、牛津大学等
文章封面
2608.11650 cs.CL · cs.SD

网易有道开源Confucius4-TTS:14种语言克隆声音,参考音频不用先转写

只有一段参考录音,不知道录音里说了什么,模型也能提取音色并用另一种语言合成新内容。网易有道发布Confucius4-TTS技术报告,系统覆盖14种语言,支持同语种和跨语种零样本声音克隆,不要求在推理前准备提示音频的文字稿;代码、模型权重和演

网易有道等
文章封面
2608.11236 cs.AI · cs.CL

快手开源TRACE Bench:测角色扮演AI不再只给总分,99.91%设定逐条核验

一个模型扮演游戏角色得82分,究竟是忘了世界观、说错人物关系,还是没有完成玩家交代的目标?快手GameMind Lab开源TRACE Bench,把角色设定提前拆成固定检查表,再用用户Agent对话并保存逐轮证据。它在更少对话轮次中覆盖99

快手GameMind Lab等
文章封面
2608.11605 cs.AI

机器人不用生成视频也能预演未来:交大等提出ForeWAM,LIBERO成功率超96%

机器人在抓杯子、开抽屉前,如果能预测“动作之后场景会怎样变化”,通常更容易规划下一步。上海交通大学、ACE Robotics和南洋理工大学提出ForeWAM,让动作模型获得未来动态,却不在部署时真正生成未来视频;标准版和加速版在LIBERO

上海交通大学、南洋理工大学等
文章封面
2608.11367 cs.AI · cs.CV

Google联合UIUC开源GazeAnywhere:一句话指定人物,AI直接判断他在看哪里

一张多人照片里,输入“穿红衣服的男孩”,模型先找到指定人物,再画出他的视线落点;也可以直接点击画面坐标来选人。Google与伊利诺伊大学香槟分校提出GazeAnywhere,并开源12万组带提示标注的Gaze-Co数据,把注视估计从固定检测

Google、伊利诺伊大学香槟分校等
文章封面
2608.08814 cs.AI · cs.CV

东大把秋叶原85条街搬进360CityArena,Gemini导航得分仅17.1%

东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。

东京大学等
文章封面
2608.08392 cs.AI · cs.CL

清华等提出CAP:420项跨站任务,最强商用浏览器Agent完整成功率仅6%

清华大学、澳门科技大学、东南大学、爱丁堡大学和FellouAI等团队提出浏览器Agent基准CAP。它不只检查Agent能否打开页面并点击按钮,而是要求跨多个网站完成长流程,处理复杂控件和动态视觉内容。

澳门科技大学、清华大学、东南大学、FellouAI等
文章封面