arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

共 149 篇

从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。

2608.00803 cs.HC · cs.LG

康奈尔用超声眼镜读取无声说话,词汇量扩到5356个

康奈尔大学发布SoniSpeech,用带超声传感器的眼镜采集无声说话时的面部运动。数据集包含34小时、18000条话语和5356个独立单词,基线模型在开放词汇无声语音识别中的词错误率为26.3%。

康奈尔大学等
康奈尔用超声眼镜读取无声说话,词汇量扩到5356个文章封面
2608.01452 cs.CV · cs.LG

斯坦福中大让机器人看一次静态示范,学习抓移动物体

中山大学、斯坦福大学和东南大学团队发布DynamicManip,只用一次静态任务示范生成多种动态操作训练数据。与对照方法相比,系统在论文任务上的平均成功率提高18.4个百分点,策略查询延迟降低32.9%。

中山大学、斯坦福大学、东南大学等
斯坦福中大让机器人看一次静态示范,学习抓移动物体文章封面
2608.02603 cs.CV

20个世界模型参加反应力考试,视频逼真不代表世界会回应

中国科学院自动化研究所、香港中文大学、清华大学等团队发布WorldExam,用1474个案例评测20个可控视频与世界模型。没有一款模型同时覆盖大量任务并保持稳定高表现,画质好、指令完成度高,也不保证场景会作出合理反应。

中国科学院自动化研究所、香港中文大学、清华大学等
20个世界模型参加反应力考试,视频逼真不代表世界会回应文章封面
2608.01942 cs.CL · cs.CV

剑桥南洋理工给7款视频模型出文化考题,漂亮不等于懂

南洋理工大学、剑桥大学、新加坡管理大学和CentraleSupélec团队发布CultureVidBench,用1000条提示测试7款文本生成视频模型。结果显示,模型能生成语义相符、画质不错的视频,却常把服饰、文字、仪式步骤和声音线索做错。

南洋理工大学、新加坡管理大学、剑桥大学等
剑桥南洋理工给7款视频模型出文化考题,漂亮不等于懂文章封面
2608.00023 cs.AI · cs.CL

DeepMind与OpenAI测试275种AI角色,引导越强未必越像

Google DeepMind、OpenAI、牛津大学、佐治亚理工学院和伊利诺伊大学厄巴纳-香槟分校等机构研究人员测试了275种大模型角色。多数角色会随着激活引导增强而更贴近设定,但有38种角色在六项指标上全部下降。

佐治亚理工学院、伊利诺伊大学厄巴纳-香槟分校、牛津大学等
DeepMind与OpenAI测试275种AI角色,引导越强未必越像文章封面
2608.01078 cs.AI · cs.CL

英特尔中国把推理模型压到1.58比特,校准数据少100万倍

英特尔中国研究院发布ScaleQ-1.58,把推理大模型权重压缩为三值表示。Qwen3-1.7B版本只使用400万校准Token,在4项数学和代码任务上的平均表现达到BitNet b1.58 2B4T的90.52%以上,量化所需校准Toke

英特尔中国研究院等
英特尔中国把推理模型压到1.58比特,校准数据少100万倍文章封面
2608.00013 cs.AI · cs.CL

美团清华训练150多个VLM,选视觉底座可以提前算

美团与清华大学团队训练了150多个视觉语言模型,覆盖34个大语言模型和7个模型家族,尝试在多模态训练开始前预测哪一个LLM更适合做视觉底座。

美团、清华大学等
美团清华训练150多个VLM,选视觉底座可以提前算文章封面
2608.02580 cs.RO

阿里通义把人类视频变成18561小时机器人训练数据

阿里巴巴通义千问、中国人民大学、上海科技大学、北京通用人工智能研究院和北京航空航天大学团队发布Ego2Robot,把人类佩戴相机拍下的第一视角操作视频转换为机器人训练数据。整套数据达到18561小时,覆盖15种机器人形态。

上海科技大学、北京通用人工智能研究院、北京航空航天大学等
阿里通义把人类视频变成18561小时机器人训练数据文章封面
2607.29581 cs.CV

AI图片检测器拿到0.9999高分,实际可能只认出了文件格式

俄罗斯Sirius教育中心和高等经济大学团队用186527张电商评价图片训练AI生成检测器。产品完全隔离的测试集上,最强模型PR-AUC达到0.9999;把合成图重新编码成真实图片常见的格式后,成绩跌到0.7254。

高等经济大学等
AI图片检测器拿到0.9999高分,实际可能只认出了文件格式文章封面
2607.29254 cs.AI

清华等团队发现,给大模型一份工具说明可能削弱拒答信号

北京邮电大学、北京航空航天大学和清华大学研究人员发现,同一条危险请求加入结构化工具说明后,模型内部区分有害与无害输入的能力明显下降。Llama的AUROC从0.927降至0.740,Qwen从0.901降至0.786,Mistral从0.9

北京邮电大学、北京航空航天大学、清华大学等
清华等团队发现,给大模型一份工具说明可能削弱拒答信号文章封面
2607.28818 cs.AI · cs.CL

Salesforce审计2008段长对话,AI伴侣会出现人格漂移

Salesforce AI Research构建了2008段合成长对话,测试四款模型在85至130个会话中能否保持角色、边界、价值观和表达风格,同时记住长期发生的事件。没有一种模型与记忆配置在所有指标上都稳定领先。

Salesforce AI Research等
Salesforce审计2008段长对话,AI伴侣会出现人格漂移文章封面
2607.28908 cs.LG

亚马逊研究发现,大模型“再想一遍”经常不如人类修改

亚马逊研究人员让人类和五款大模型在相同条件下回答一次,再阅读自己或他人的答案进行第二次修改。人类在三项任务上整体提高,多数模型却没有稳定获益;面对电影评分这类主观任务,五款模型的第二次结果全部变差。

亚马逊等
亚马逊研究发现,大模型“再想一遍”经常不如人类修改文章封面
2607.29211 cs.CL

腾讯和中科院训练大模型“知道做不到”,无效推理率从65.5%降至7%

中国科学院软件研究所与腾讯微信AI团队研究了大模型的“无效推理”:题目超过能力范围时,模型仍生成很长、表面完整却含有关键错误的推导。Qwen3-8B经过CaRL训练后,Countdown任务的无效推理率从65.5%降至7%,准确率由59.6

中国科学院软件研究所等
腾讯和中科院训练大模型“知道做不到”,无效推理率从65.5%降至7%文章封面
2607.29320 cs.AI

蚂蚁把手机、电脑和网页智能体合成一个,平均成功率51.2%

蚂蚁集团团队提出MAGA,把分别擅长手机、桌面和网页操作的GUI智能体蒸馏到同一个Qwen3-VL模型中。8B版本在三套基准上的平均成功率为51.2%,比论文中最强的统一模型基线高2个百分点,接近三个领域教师模型50.9%的平均水平。

蚂蚁集团等
蚂蚁把手机、电脑和网页智能体合成一个,平均成功率51.2%文章封面
2607.29378 cs.CL · cs.LG

只看模型回答也能反推提示词,Adobe团队公布PTP方法

印度理工学院孟买分校与Adobe Research提出PTP,只读取大模型输出文本,就尝试重建产生这段回答的原始提示词。Qwen3-0.6B Chat实验中,提示词精确匹配指标达到64.77;换到跨模型和跨分词器设置后,精确恢复明显下降。

印度理工学院孟买分校等
只看模型回答也能反推提示词,Adobe团队公布PTP方法文章封面
2607.29627 cs.CV

一张产品图塞进视频还能跟着路线跑,FlexComposer公布结果

香港科技大学、浙江大学、香港中文大学和斯坦福大学团队发布FlexComposer。用户提供背景视频、前景图片或视频,再画一条移动轨迹,模型会把素材放进场景,同时生成遮挡、光照、阴影和反射变化。

香港科技大学、浙江大学、香港中文大学、斯坦福大学等
一张产品图塞进视频还能跟着路线跑,FlexComposer公布结果文章封面
2607.29172 cs.AI · cs.RO

Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%

加州大学伯克利分校、Google DeepMind和英伟达研究人员把Gemini Robotics On-Device部署到宇树Unitree G1上,只通过托管微调接口完成两轮闭环训练。三项实机操作的成功率分别升至100%、98%和96%

加州大学伯克利分校等
Gemini Robotics微调两轮,宇树G1三项任务最高成功率100%文章封面
2607.28627 cs.AI · cs.CV

微软与DeepMind团队只加一个Token,视觉检索提高13.4分

伊利诺伊大学厄巴纳-香槟分校、微软研究院和Google DeepMind研究人员提出ReToken,通过一个可学习的检索Token,从大量图片或长视频帧中筛选与问题相关的视觉信息。

伊利诺伊大学厄巴纳-香槟分校、微软研究院等
微软与DeepMind团队只加一个Token,视觉检索提高13.4分文章封面