arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

语言与多模态基础模型、推理、训练与能力评测。

2609.05141 大模型

最强AI读论文只拿62.6分,上海AI Lab等推出SciDocBench

香港中文大学、上海人工智能实验室、复旦大学和上海交通大学团队推出SciDocBench,用124道专家编写问题测试AI能否读懂完整科学论文;每题配四种文档表示,共496个实例。受测系统中最高得分为62.6/100。“最强”仅指论文表3所列系

香港中文大学、上海人工智能实验室、复旦大学、上海交通大学等
文章封面
2609.04250 视觉与生成

数字人边说边动快5.4倍,北大等团队做出Motion-Omni

北京大学与香港中文大学(深圳)团队提出Motion-Omni,让数字人在生成语音的同时生成面部表情和全身动作。Motion-Omni-Q7相对“语音模型再接动作模型”的级联系统响应快5.4倍,实时因子为0.78。实验说明联合生成能降低等待,

北京大学、香港中文大学(深圳)等
文章封面
2609.03742 更多前沿

港城大等把视频课改成知识地图,125段课程生成1079份视觉摘要

香港城市大学、苏黎世联邦理工学院提出KnowVis,把线性视频课程改排成概念图、知识单元和视觉摘要。团队整理10个学科的125段视频并生成1079份摘要,人体研究报告认知负担下降、学习与保持改善;样本规模有限,不能外推到所有课程和长期学习。

香港城市大学、苏黎世联邦理工学院等
文章封面
2609.02108 大模型

Meta等让扩散模型先猜长度再补代码:快1.82倍,通过率升4.8点

伊利诺伊大学厄巴纳-香槟分校、Meta联合提出PILL,让扩散语言模型补代码或文本时先预测缺口长度,再并行尝试附近候选。它在5种模型、8个基准上比最强基线快1.82倍,代码平均通过率提高4.8点、文本BLEU-2提高6.0点;结果不代表所有

伊利诺伊大学厄巴纳-香槟分校、Meta等
文章封面
2609.01551 视觉与生成

Meta研究发现:视频模型懂镜头运动,直觉物理却接近随机

约克大学、Vector研究院、Meta FAIR、麦吉尔大学联合逐层分析V-JEPA 2和VideoMAE-v2。两种视频模型的镜头运动探针ROC AUC超过90%,异常检测超过60%,直觉物理任务却接近随机水平。

约克大学、Vector研究院、Meta FAIR、麦吉尔大学等
文章封面
2609.01591 更多前沿

微软让AI模拟学生,三类任务两项指标都超过GPT-5.4

微软研究院、伊利诺伊大学厄巴纳-香槟分校提出StudentSim,用少量个人学习记录训练个性化学生模拟器。评测覆盖国际象棋、英语写作和数学三类任务、60名学生,论文称StudentSim在行为保真度和指导响应性上均超过GPT-5.4。

微软研究院、伊利诺伊大学厄巴纳-香槟分校等
文章封面
2609.00111 自动驾驶

Qwen下场做自动驾驶,一个4B模型同时感知、问答和规划

通义千问团队、华中科技大学联合提出Qwen-Drive-1.0。这个4B视觉语言模型把3D感知、驾驶视觉问答和运动规划放进同一框架,并在开环、伪闭环和闭环设置中评估规划表现。

通义千问团队、华中科技大学等
文章封面
2608.27448 大模型

阿里&浙大提出TTPO:无标签测试时训练让Qwen3-1.7B从38.0%升至45.2%

模型遇到新题时,通常只能多采样几次再投票,不能在没有标准答案的情况下可靠更新参数。浙江大学、阿里巴巴提出测试时策略优化TTPO,让模型把自己的多次解答分成“同意多数结果”和“反对多数结果”两组,用不同目标继续学习。

浙江大学、阿里巴巴等
文章封面
2608.25871 更多前沿

阿里、中科大等用3200万条商品轨迹训练CEDAR,让销量预测响应预算变化

商家计划下周增加广告预算时,普通时间序列模型往往仍沿着历史销量往前画线。阿里巴巴、中国科学技术大学、香港科技大学(广州)提出CEDAR,直接学习“当前状态—商家行动—下一状态”的转换,再单独修正节日和热点带来的偏差。

阿里巴巴、中国科学技术大学、香港科技大学(广州)等
文章封面
2608.20387 大模型

作业帮提出Poly-InstructTTS,用自然语言控制1000多种语音情绪与风格

“压低声音,带一点犹豫,像在嘈杂房间里提醒同伴”,这类描述比“悲伤”“兴奋”标签复杂得多。作业帮提出Poly-InstructTTS,用开放自然语言同时控制情绪、风格、口音和副语言行为。团队从影视视听素材构建1000小时指令标注语料,覆盖1

作业帮等
文章封面
2608.20492 大模型

南开&西工大等让视频模型省掉思维链,解码从4780毫秒降至130毫秒

视频模型做强化学习时,一组采样答案可能全都不够好,模型只能在一堆错误里挑相对高分者。南开大学、西北工业大学、中科院自动化所和南开深圳研究院提出OraRL,把每条人工标注直接序列化成一条“标准轨迹”,同时保留模型自己的探索。Video-ORA

南开大学、西北工业大学、中科院自动化所、南开深圳研究院等
文章封面
2608.21360 大模型

南大&南开等测试实时视频助手:Gemini-3-Pro最高仅得66.4分

普通视频问答只要求模型看完片段再回答,实时助手的建议会改变用户下一步动作。南京大学、南开大学和滑铁卢大学联合构建OmniAssistBench,用连续视频片段测试模型能否记住历史、读懂手势、等待关键事件并在正确时间提醒。榜单中Gemini-

南京大学、南开大学、滑铁卢大学等
文章封面
2608.20868 视觉与生成

IBM用2.56亿参数模型直接读表单,比Qwen2.5-VL小27倍、快5倍

一张表单里,“项目名称”对应哪段长文本、一个字段是否连着多个值,传统流程通常先OCR,再做实体识别与关系抽取。IBM苏黎世研究院和苏黎世联邦理工提出端到端方案,微调2.56亿参数SmolDocling,直接从文档图片生成键、值、边界框和连接

IBM苏黎世研究院、苏黎世联邦理工等
文章封面
2608.19843 大模型

阿里通义提出ear-VAE2,高压缩音乐重建Mel误差降低19.4%

音乐生成模型通常先把波形压进连续潜变量,再在潜空间生成。压缩率提高后,高频容易消失,左右声道空间感变窄,相位也会出现不连续。阿里巴巴通义千问、莫纳什大学提出ear-VAE2,直接在复杂频谱上编码,并按频段分别修正幅度和相位。

阿里巴巴通义千问、莫纳什大学等
文章封面
2608.19583 视觉与生成

微软、清华等发布VGI-Bench:最强视频模型视觉推理仅得51分

让视频模型把绳结解开、让齿轮按规则转动,或沿迷宫走到出口,画面好看不等于过程正确。微软研究院、清华大学、麻省理工学院、伊利诺伊大学厄巴纳-香槟分校等机构提出VGI-Bench,用27项任务、810个实例测试视频生成模型能否通过连续画面完成视

微软研究院、清华大学、麻省理工学院、伊利诺伊大学厄巴纳-香槟分校等
文章封面
2608.19098 大模型

字节Seed、清华提出Open-MOPD:多教师能力恢复率升至83.4%

把数学、代码、指令遵循等多个强化学习专家蒸馏到一个学生模型,短答案任务可能先停滞,长答案领域却持续占用大部分Token更新。清华大学AIR、字节Seed提出Open-MOPD,在SmolLM3-3B-Base的受控实验中,把相对路由专家集合

清华大学AIR、字节Seed等
文章封面
2608.17253 大模型

不用标准答案也能练推理?字节等提出Co-RL,多智能体互评最高提升8.6%

没有标准答案时,让模型给自己打分很容易把原有偏见越练越强。埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等机构提出Co-RL,让多个不共享参数的模型互相提供强化学习奖励,并用不同模型家族、规模和训练样本降低共同犯错。

埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等
文章封面
2608.13113 大模型

看完一个月生活视频,Gemini仍比人类低22.4分!华为南大推出EgoMonth

一个月前把钥匙放在哪、某次做饭先拿了什么、不同日期见过谁——人会把零散经历串成长期记忆,多模态模型却常在短视频问答里被高估。华为、南京大学和天津大学推出EgoMonth,收集20名参与者跨20至120天的300多小时第一视角视频,用1443

南京大学、天津大学等
EgoMonth跨月第一视角视频记忆基准文章封面
↑