最强AI读论文只拿62.6分,上海AI Lab等推出SciDocBench
香港中文大学、上海人工智能实验室、复旦大学和上海交通大学团队推出SciDocBench,用124道专家编写问题测试AI能否读懂完整科学论文;每题配四种文档表示,共496个实例。受测系统中最高得分为62.6/100。“最强”仅指论文表3所列系
香港中文大学、上海人工智能实验室、复旦大学和上海交通大学团队推出SciDocBench,用124道专家编写问题测试AI能否读懂完整科学论文;每题配四种文档表示,共496个实例。受测系统中最高得分为62.6/100。“最强”仅指论文表3所列系
北京大学与香港中文大学(深圳)团队提出Motion-Omni,让数字人在生成语音的同时生成面部表情和全身动作。Motion-Omni-Q7相对“语音模型再接动作模型”的级联系统响应快5.4倍,实时因子为0.78。实验说明联合生成能降低等待,
香港城市大学、苏黎世联邦理工学院提出KnowVis,把线性视频课程改排成概念图、知识单元和视觉摘要。团队整理10个学科的125段视频并生成1079份摘要,人体研究报告认知负担下降、学习与保持改善;样本规模有限,不能外推到所有课程和长期学习。
伊利诺伊大学厄巴纳-香槟分校、Meta联合提出PILL,让扩散语言模型补代码或文本时先预测缺口长度,再并行尝试附近候选。它在5种模型、8个基准上比最强基线快1.82倍,代码平均通过率提高4.8点、文本BLEU-2提高6.0点;结果不代表所有
约克大学、Vector研究院、Meta FAIR、麦吉尔大学联合逐层分析V-JEPA 2和VideoMAE-v2。两种视频模型的镜头运动探针ROC AUC超过90%,异常检测超过60%,直觉物理任务却接近随机水平。
微软研究院、伊利诺伊大学厄巴纳-香槟分校提出StudentSim,用少量个人学习记录训练个性化学生模拟器。评测覆盖国际象棋、英语写作和数学三类任务、60名学生,论文称StudentSim在行为保真度和指导响应性上均超过GPT-5.4。
通义千问团队、华中科技大学联合提出Qwen-Drive-1.0。这个4B视觉语言模型把3D感知、驾驶视觉问答和运动规划放进同一框架,并在开环、伪闭环和闭环设置中评估规划表现。
浙江大学和苹果提出PaperGym,把每篇论文转成一套研究计划训练环境,并发布2万条实例。按同一训练方案得到的Qwen3-8B在ResearchQA上达到73.48,高于论文所列的更大模型Kimi K2.6;这一比较只对应单项评测,不代表综
模型遇到新题时,通常只能多采样几次再投票,不能在没有标准答案的情况下可靠更新参数。浙江大学、阿里巴巴提出测试时策略优化TTPO,让模型把自己的多次解答分成“同意多数结果”和“反对多数结果”两组,用不同目标继续学习。
商家计划下周增加广告预算时,普通时间序列模型往往仍沿着历史销量往前画线。阿里巴巴、中国科学技术大学、香港科技大学(广州)提出CEDAR,直接学习“当前状态—商家行动—下一状态”的转换,再单独修正节日和热点带来的偏差。
“压低声音,带一点犹豫,像在嘈杂房间里提醒同伴”,这类描述比“悲伤”“兴奋”标签复杂得多。作业帮提出Poly-InstructTTS,用开放自然语言同时控制情绪、风格、口音和副语言行为。团队从影视视听素材构建1000小时指令标注语料,覆盖1
视频模型做强化学习时,一组采样答案可能全都不够好,模型只能在一堆错误里挑相对高分者。南开大学、西北工业大学、中科院自动化所和南开深圳研究院提出OraRL,把每条人工标注直接序列化成一条“标准轨迹”,同时保留模型自己的探索。Video-ORA
普通视频问答只要求模型看完片段再回答,实时助手的建议会改变用户下一步动作。南京大学、南开大学和滑铁卢大学联合构建OmniAssistBench,用连续视频片段测试模型能否记住历史、读懂手势、等待关键事件并在正确时间提醒。榜单中Gemini-
一张表单里,“项目名称”对应哪段长文本、一个字段是否连着多个值,传统流程通常先OCR,再做实体识别与关系抽取。IBM苏黎世研究院和苏黎世联邦理工提出端到端方案,微调2.56亿参数SmolDocling,直接从文档图片生成键、值、边界框和连接
音乐生成模型通常先把波形压进连续潜变量,再在潜空间生成。压缩率提高后,高频容易消失,左右声道空间感变窄,相位也会出现不连续。阿里巴巴通义千问、莫纳什大学提出ear-VAE2,直接在复杂频谱上编码,并按频段分别修正幅度和相位。
让视频模型把绳结解开、让齿轮按规则转动,或沿迷宫走到出口,画面好看不等于过程正确。微软研究院、清华大学、麻省理工学院、伊利诺伊大学厄巴纳-香槟分校等机构提出VGI-Bench,用27项任务、810个实例测试视频生成模型能否通过连续画面完成视
把数学、代码、指令遵循等多个强化学习专家蒸馏到一个学生模型,短答案任务可能先停滞,长答案领域却持续占用大部分Token更新。清华大学AIR、字节Seed提出Open-MOPD,在SmolLM3-3B-Base的受控实验中,把相对路由专家集合
没有标准答案时,让模型给自己打分很容易把原有偏见越练越强。埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等机构提出Co-RL,让多个不共享参数的模型互相提供强化学习奖励,并用不同模型家族、规模和训练样本降低共同犯错。
捷克理工大学视觉识别团队提出ReImageNet,重新检查ImageNet-1k的5万张验证图,发现约12%的原标签错误,33.3%的图片天然包含多个类别,还有3.8%根本找不到合适的ImageNet类别。换用新标签后,多模态大模型准确率普
一个月前把钥匙放在哪、某次做饭先拿了什么、不同日期见过谁——人会把零散经历串成长期记忆,多模态模型却常在短视频问答里被高估。华为、南京大学和天津大学推出EgoMonth,收集20名参与者跨20至120天的300多小时第一视角视频,用1443