UIUC、微软、DeepMind提出ReToken:一个可学习token让视觉检索大涨13个点
把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
把上百张图片或一小时长的视频塞给视觉语言模型,答案明明就在某一帧里,模型却常常答不对。上下文越长,干扰画面越多,成绩掉得越厉害;而把整段视觉序列全量处理,显存又先撑不住,全量微调的成本更是高昂。伊利诺伊大学厄巴纳-香槟分校(UIUC)联合微
视频生成正在变成一道长序列题:一段高分辨率视频摊成 token 后动辄十几万,扩散 Transformer 里的全注意力显存随帧数平方膨胀,训练账单越来越贵。Adobe Research 提出 Chimera,一套混合视觉扩散 Transf
会操作电脑的智能体,最缺的不是模型,而是能放手让它操作的软件。真实应用有登录门槛和真实用户,点错一步成本高昂,拿来训练又贵又慢、无法复现;可换成固定网页和截图当题库,模型又会很快把答案背下来。微软研究院(Microsoft Research
机器人要学会做家务,先得看懂人是怎么做家务的。可现有数据要么来自脚本化的实验室演示,要么是网络上没有动作真值的视频,规模与真实感很难兼得。南洋理工大学 S-Lab 与 ACE Robotics 给出的思路,是把真实公寓直接改造成录制棚:一套
面对一款规则完全陌生的网格益智游戏,大多数智能体的做法是"看一帧、走一步":靠反应式试错摸索规律,每走错一步都要在计分里留下代价。ARC-AGI-3把这类游戏做成了正式基准——64×64的彩色网格、没有文字说明、每一步操作都计入得分。德累斯
肠镜报告里写清了病灶的部位、大小和形态,却几乎不会注明这些描述对应检查中的哪一帧画面。复旦大学(附属中山医院)联合浙江大学、微软亚洲研究院、曼彻斯特大学等机构提出EndoCLIP,一个面向结肠镜检查的视觉语言基础模型:它直接复用医院档案库中
文生视频最容易露馅的地方,往往不是单帧画面,而是运动:手指突然融化、物体逐帧闪烁、转身时肢体结构错位。想靠偏好优化修正这些问题,传统做法要么请人逐条标注好坏视频,成本高昂;要么借助奖励模型打分,信号又常常不稳定。清华大学联合快手可灵团队(可
机器人学操作,最值钱的画面来自它"自己的眼睛":第一视角相机离夹爪和桌面最近,手与物体的接触关系看得最清楚。但这种数据恰恰最难收集——每条轨迹都要真机执行、人工重置、全程看护,失败还可能撞坏硬件。上海交通大学、阿里巴巴、天机芯智(Tianj
一张精美的二次元立绘,画师交稿后往往就静止了:想让它眨眼、转头、换装,得靠资深画师手工拆上数周。清华大学、南洋理工大学与SparcAI的研究团队提出Bunraku,首次实现从单张插图端到端生成可编辑的Live2D角色——有序图层、变形网格、
中国农业大学、北京师范大学和新加坡国立大学联合提出了TIDE(Tracking Identities with Dual-branch Elasticity),一种用于密集同质目标跟踪的双分支弹性框架。在MFT-Edge基准上,轻量L分支仅
AISLE联合中欧技术研究所和马萨里克大学推出了HoF-Bench,一个基于真实AI发现漏洞的基准测试。基准包含8个代码库的95个CVE(通用漏洞披露),在严格协议下,最便宜的配置只需66美元就找到了70个CVE,而GPT-5.6 luna
浙江大学、新加坡国立大学、上海交通大学和美团联合提出了SkillRise,一个面向跨任务技能演化的统一强化学习框架。在ALFWorld、WebShop和ScienceWorld三个基准上,SkillRise在Pass@1指标上相比最强基线提
香港中文大学和澳门理工大学联合发布了TREK(Travel Reasoning and Evaluation Kit),一个用于评估LLM智能体旅行规划能力的基准。在15个LLM智能体的评估中,即使是最强的GPT-5.6也只在46.2%的可
AI工作负载的快速增长正把数据中心变成大规模、波动大但时空灵活的电网负荷。北京邮电大学、国网辽宁电力和南洋理工大学联合提出了PowerAtlas,一个用于电-计算协同调度的LLM智能体框架。团队与中国某省级电力公司合作构建了实验性电-计算网
英伟达(NVIDIA)提出了Voice Memory,一种仅推理的语音识别纠错方案。核心思路不是让模型更聪明,而是让它在"什么时候该改、什么时候不该改"上做得更好。在10个领域的测试中,Voice Memory将加权词错误率从8.36%降至
苏黎世联邦理工学院、谷歌和微软联合提出了VidMap,一个用于任意未标定视频度量三维重建的系统。在LaMAR数据集上,VidMap的W-AUC@full达到88.5,而基线方法ViPE为76.6。系统结合了SLAM的序列约束与SfM的全局优
当被要求描述一张从未提供的医学图像时,前沿视觉语言模型不会弃权,而是会编造诊断结果。更关键的是,这些编造不是随机的——它高度依赖于患者的人口统计学特征。卡内基梅隆大学和亚马逊云科技的研究人员发现了这一现象,测试涉及Claude Opus-4
功能验证占据了集成电路前端工程的主要工作量——一个漏到流片阶段的bug,就可能导致数百万美元的重新设计成本。腾讯、北京大学和西南交通大学联合提出了GoGoTB,一个智能体式RTL验证框架,在8个RTL设计上无需任何人工干预,实现了100%的
快手科技影幻团队与香港中文大学MMLab联合提出AMFD(Amortized Fréchet Distance),一种用于视觉生成的分布匹配方法。在文本到图像生成任务上,AMFD训练的单步模型在GenEval基准上达到了0.846,超过了其
NVIDIA研究院和耶鲁大学的研究人员发表了Spatial-IQ,一个分层诊断框架,把堆叠三维结构中的物体计数拆成9个感知与认知子任务,按人类空间认知的发育阶段组织,外加心理旋转作为补充探针。诊断结论直白:最好的模型Qwen在人类基线任务上