arXivDaily arXiv每日学术速递 周一至周五更新

行业趋势

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2609.24058 视觉与生成

一个OCR读懂229种语言,复旦腾讯把F1从65.71%拉到80.89%

复旦大学、腾讯微信视觉、华南理工大学提出ScriptMoE,用一个稀疏专家识别器覆盖10种文字体系、229种语言。它替换PP-OCRv5的识别模块后,在CC-OCR多语种任务上把F1从65.71%提高到80.89%,略高于最佳视觉语言模型的

复旦大学、腾讯微信视觉、华南理工大学等
文章封面
2609.22308 Agent

不给源码,只看画面:AI开始黑盒复刻25款游戏

中科院信息工程研究所、中关村实验室、小米汽车、阿里巴巴达摩院提出GameReplica:不给智能体源码、说明书或现成轨迹,只允许它看截图并操作目标游戏,再写出可运行复刻。基准含125项任务、25款受控游戏和5类核心机制。

中科院信息工程研究所、中关村实验室、小米汽车、阿里巴巴达摩院等
文章封面
2609.24981 视觉与生成

视频一转镜头就变形?腾讯把3D几何塞进生成底层

香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校提出GAE,把3D几何直接放进生成模型的潜空间。同一份紧凑表示可解码画面、深度、相机和点云;在两个视频数据集上,FVD分别下降12.7%和23.1%。

香港科技大学、腾讯、香港大学、得克萨斯大学奥斯汀分校等
文章封面
2609.23863 具身智能与机器人

桌面一变机器人就懵?新模型把成功次数从4次拉到17次

西北大学、华盛顿大学、新加坡国立大学、微软提出Grounded Action Model,让机器人先把语言、点或框指定的目标变成带尺度的3D表示,再预测动作。在双臂YAM机器人视觉变化测试中,它20次成功17次,对照模型只成功4次。

西北大学、华盛顿大学、新加坡国立大学、微软等
文章封面
2609.24976 具身智能与机器人

机器人终于会“摸”了:伯克利触觉模型六项任务全胜

伊利诺伊大学厄巴纳-香槟分校、加州大学伯克利分校、西北大学提出DexTacWAM,让双手机器人同时预测视觉变化和十个指尖的接触变化。它在六项接触密集任务上全部取得最高分,平均70.6分,而最强基线为38.0分。

伊利诺伊大学厄巴纳-香槟分校、加州大学伯克利分校、西北大学等
文章封面
2609.23153 AI基础设施

单卡视频生成暴增265倍,北大清华阿里把50步压到3步

北京大学、清华大学、阿里巴巴等机构提出SparkDiffusion,把视频扩散的稠密注意力改成97%稀疏,并把50步生成压到3步。在Wan2.1 14B的720P测试中,单张RTX 5090端到端最高加速265倍,1.3B模型生成480P视

北京大学、清华大学、阿里巴巴等
文章封面
2609.21709 大模型

腾讯AI Lab&清华让大模型双向“说”手语,12名手语用户参与实测

清华大学、南洋理工大学、鹏城实验室与腾讯AI Lab提出SignGPT,用共享语言模型同时完成无gloss手语转文字和文字转手语。系统串起一轮手语对话,并邀请12名聋人美国手语使用者参与探索性评估,分别观察语义和动作体验。

清华大学、南洋理工大学、鹏城实验室、腾讯AI Lab等
文章封面
2609.21818 AI基础设施

48伏不够快,东京大学把机器人电机推到100伏、峰值80安

东京大学团队推出LunaDrive,把基于氮化镓器件的高压驱动器装到扁平无刷电机背部。系统在96伏下实现连续30安、峰值80安和最高3110赫兹电频率,并用100伏电池完成高速负载举升,验证高压关节的短时动态能力。

东京大学等
文章封面
2609.21929 具身智能与机器人

机械臂边干活边找视角:固定相机0/20,它做到了14/20

卡内基梅隆大学、上海交通大学、中国科学技术大学和香港大学提出MAAP,让多只机械臂在操作时主动移动腕部相机。双臂实机放置实验中,它20次成功14次,固定视角ACT为0次,动作同时承担观察任务。

卡内基梅隆大学、上海交通大学、中国科学技术大学、香港大学等
文章封面
2609.21455 视觉与生成

阿里淘宝让视频模型补物理课:碰撞、多阶段运动一次适应

哈尔滨工业大学与阿里巴巴淘宝提出CompAdapt,让视频生成模型处理耦合运动、多阶段转换和多物体碰撞,并能用一个样例适应新的物理环境。目标不是只让单个物体移动得像,而是让连续事件彼此接得上。

哈尔滨工业大学、阿里巴巴淘宝等
文章封面
2609.20886 Agent

前沿模型做BI还不到50分,微软智能体最高拉升40个百分点

伊利诺伊大学厄巴纳-香槟分校、微软研究院和微软提出BI-Agent,让智能体自己找表、转换数据、建立关联并回答商业问题。前沿模型在BI-Bench准确率不足50%,专用智能体最高提升40个百分点,完整流程而非单次查询成为评测对象。

伊利诺伊大学厄巴纳-香槟分校、微软研究院、微软等
文章封面
2609.21058 AI基础设施

AI写GPU内核快283倍?放进真实大模型,端到端只快约1%

论文公开页面未披露作者机构。研究重新检查AI生成GPU内核的正确性和真实工作负载占比:一个曾被计为283倍加速的内核只写入0.3%输出;即使替换可优化算子,Transformer端到端现实改善也约为1%,局部跑分不能直接代表整机收益。

论文公开页面未披露作者机构
文章封面
2609.22068 Agent

小米把3185个代码库变训练场,编程智能体五项基准全涨

小米、北京大学、香港大学和中国人民大学提出CodeMidas,只读取源码,就把3185个代码库转成5545项可执行训练任务,覆盖23种语言。使用这些环境训练后,MiMo-V2.5在论文选定的五项编程基准上均有提升,也减少了对现成工单的依赖。

小米、北京大学、香港大学、中国人民大学等
文章封面
2609.21967 大模型

英伟达把语音助手做成真对话:被打断100%接管,还能调用工具

英伟达推出NemotronLabs VoiceChat,把流式听、说、打断处理、反馈识别和工具调用放进统一语音架构。论文报告用户打断后的接管率为100%,短促反馈后恢复回答的比例为93%,工具选择F1达到82.5%,重点转向真实对话节奏。

英伟达等
文章封面
2609.22086 Agent

Adobe让设计智能体自己长技能,成功率从72.7%冲到99.3%

Adobe与布朗大学提出Designer-RSI:不更新模型权重,让设计智能体从自己完成和失败的任务中扩展外部技能库。五轮演化后,技能从76项增至139项;在Claude-Sonnet-4上的GenEval2执行成功率由72.7%升至99.

Adobe、布朗大学等
文章封面
BogdanTheGeek 项目仓库与博客 更多前沿

废弃电子烟,居然被改成了网站服务器

用完的一次性电子烟,还能拿来架网站。开发者 Bogdan Ionescu 在开源项目 semihost-ip 中,把拆出的普冉微控制器变成了一台微型网页服务器:只有3KB内存,靠调试接口与电脑交换网络数据。代码和搭建方法都已公开,硬件爱好者

封面
Arnaud Bertrand(Substack)热文,科技日报、光明日报、新华网数据核验 AI基础设施

“最接近世界大脑的地方” !一座没名气的内蒙古小城,签下5000亿建全球最大AI机房

一位法国分析师的热文,让内蒙古乌兰察布在海外刷屏:这座150万人口的草原小城,签约标准机架已超500万架,将成为全球规模最大的数据中心集群,签约总投资超5000亿元,华为、阿里、字节、百度都在此训练大模型。冷风、绿电,加上距北京毫秒级直达光

文章封面
2609.20218 大模型

别急着用LLM做表格预测:只用约6%标签,经典模型就能反超

宾夕法尼亚大学研究者把“直接提示冻结小型GPT”与“收集标签训练经典模型”放到18个表格数据集上比较。观察到的性能交叉点中位数约为完整训练集的6%;在86%的案例里,手头已有标签量就足以让经典模型胜出,为企业表格预测给出一条可量化的选型线。

宾夕法尼亚大学等
文章封面
2609.19927 视觉与生成

反光点乱成一团也能还原动作,浙大团队把中国功夫做成3D数据

浙江大学、西湖大学、复旦大学和南京大学团队提出DirtyMoCap,直接处理稀疏、无序、会丢失也会冒出异常点的光学动捕数据。单一模型可适配不同标记布局,自定义CUDA求解器相对标准PyTorch实现最高加速100倍,并把传统中国武术录制恢复

浙江大学、西湖大学、复旦大学、南京大学等
文章封面
↑