HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis
HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音
专题命中 评测与基准 :language model(abstract)
AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音
专题命中 评测与基准 :language model(abstract)
AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。
DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型
机构 * Tsinghua University(清华大学) ; Xiaomi EV(小米汽车)
专题命中 评测与基准 :language model(abstract)
AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。
基于多视角可变形DETR的再制造大型白色家电视觉质量评分评估
机构 * Fraunhofer-Institut für Produktionsanlagen und Konstruktionstechnik (IPK)(弗劳恩霍夫生产设备和结构技术研究所)
专题命中 评测与基准 :pretraining(abstract)
AI总结 针对再制造中大型白色家电视觉质量评估依赖人工且难以处理小缺陷的问题,提出基于多视角可变形DETR的自动评分框架,通过自监督预训练和微调减少标注需求,实现精确评估与可解释性。
Comments Accepted to GCSM 2026
编码器胜者无法可靠跨VLA骨干网络规模迁移:一种冻结骨干嫁接诊断方法
机构 * Tsinghua University(清华大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出冻结骨干嫁接诊断方法,发现小规模VLA上最优的视觉编码器在大规模骨干上并非最优,编码器选择依赖于骨干网络规模。
Comments 23 pages, 5 figures, 8 tables
GeoHAT: 几何自适应混合动作Transformer用于移动操作
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出GeoHAT框架,通过轻量级傅里叶空间编码器注入几何信息,并采用混合全身动作解码器分解机械臂与基座动作,在ManiSkill-HAB基准上成功率提升23.7%。
SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影
机构 * Stanford University(斯坦福大学) ; Zhejiang University(浙江大学) ; The University of Queensland(昆士兰大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。
Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA
通过ESMC稀疏自编码器特征实现可解释的酶功能预测:跨越微生物蛋白质宇宙
专题命中 评测与基准 :language model(abstract)
AI总结 利用ESMC-6B蛋白质语言模型的稀疏自编码器特征,无需任务特定训练即可准确预测酶功能,在微生物酶基准上实现78.9% top-1准确率,并发现16.9万个暗酶候选。
Comments 17 pages, 5 figures, 3 tables
Tac-DINO:基于补丁对齐的视觉-触觉特征学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :pretraining(abstract)
AI总结 提出Tac-DINO方法,通过构建大规模触觉数据集和视觉-触觉全息匹配基准,利用补丁对齐学习局部到全局的视觉-触觉表征,性能优于无对齐方法。
冻结的基础模型嵌入在胸部X光检查中丢弃小病灶信号:对部署前评估的启示
机构 * Department of Biomedical Engineering and Informatics, Indiana University(印第安纳大学生物医学工程与信息学系) ; Department of Radiology and Imaging Sciences, Emory University(埃默里大学放射学与影像科学系)
专题命中 评测与基准 :pretraining(abstract)
AI总结 本研究系统量化了五种冻结的视觉Transformer基础模型在胸部X光检查中保留或丢失小尺度、低对比度信号的情况,发现全局聚合步骤会无声地抑制小尺度信号,但可从补丁令牌中恢复。
自然环境中机器人感知的跨模态基准测试
机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) ; University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) ; Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。
Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026
VL-DINO: 利用CLIP视觉-语言知识进行开放词汇目标检测
机构 * Chongqing University(重庆大学) ; City University of Hong Kong(香港城市大学)
专题命中 评测与基准 :language model(abstract)
AI总结 提出VL-DINO,通过QPSC模块构建高质量正样本增强视觉-语言对齐,VSE模块蒸馏CLIP视觉知识,ORSA模块对齐区域特征与文本嵌入,在LVIS零样本检测上达到36.3/38.1 AP。
从斑块到患者:数字病理学中斑块到全切片性能可迁移性的研究
机构 * Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎-萨克雷大学、中央理工-高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、IHU PRISM、癌症数据科学单元) ; Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎-萨克雷大学、中央理工-高等电力学院、MICS实验室)
专题命中 评测与基准 :foundation model(abstract)
AI总结 研究斑块级线性探测能否作为全切片级性能的可靠代理,通过19个基础模型在42个切片级和16个斑块级任务上的基准测试,发现斑块与切片性能高度相关,斑块级基准测试可有效筛选候选模型。
Comments Accepted to MICCAI 2026
MASTOR: 一种面向RESTful API的语义测试预言生成多智能体方法
专题命中 评测与基准 :prompting(abstract)
AI总结 提出MASTOR多智能体方法,通过分析源码上下文生成语义测试预言,包括状态字段预言和行为一致性预言,在13个开源项目上达到75.4%平均变异得分。
TestMap:基础模型辅助测试生成的证据基础设施
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出TestMap基础设施,自动化C#/.NET仓库的测试生成与验证,记录候选测试生命周期,支持多维度评估。
Comments 10 pages, 1 figure, 2 tables. Accepted to present at AIWare 2026 (arXiv Track)
DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估
机构 * University of California, Berkeley(加州大学伯克利分校) ; Roblox Corporation(Roblox公司)
专题命中 评测与基准 :language model(abstract)
AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。
Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face
DexPIE:基于真实世界经验的稳定灵巧策略改进
机构 * Hunan University(湖南大学)
专题命中 评测与基准 :post-training(abstract)
AI总结 提出DexPIE后训练框架,通过灵巧手适配干预系统、多阶段DAgger数据收集、相对动作空间异步推理和连续最优性指标条件化,在三个真实灵巧操作任务上成功率提升37%。
Comments Project website: https://siiuuuuuu.github.io/DexPIE
GD-MIL:用于前列腺癌多模态生化复发预测的等级解耦多实例学习
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :foundation model(abstract)
AI总结 针对前列腺癌生化复发预测,提出GD-MIL方法,通过梯度反转等级对抗训练实现H&E全切片图像特征与Gleason等级解耦,融合临床变量后C-index达0.704,显著优于临床基线。
DiffSight-Former:建模结构差异和时间动态用于青光眼进展预测
机构 * The University of Sydney(悉尼大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出DiffSight-Former框架,通过时间变异特征提取、多结构差异建模和时间感知Transformer,从序列眼底图像中预测青光眼进展,在SIGF和GRAPE数据集上取得高AUC和灵敏度。
Comments 12 pages, 6 figures
SIMPLE:基于仿真的人形机器人全身操作策略学习与评估
机构 * USC Physical Superintelligence (PSI) Lab(南加州大学物理超级智能实验室)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出SIMPLE仿真平台,结合MuJoCo动力学与IsaacSim渲染,包含60个全身任务、50个室内场景和1000+物体资产,支持自动化轨迹生成和VR遥操作数据采集,并集成多种主流策略,实验证明仿真与真实世界性能强相关,可实现零样本迁移。
从人类驾驶中学习:一种用于自动驾驶的人机协同在线行为克隆框架
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室)
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出人机协同在线行为克隆框架HiL-OBC,通过人类干预初始化策略、贝叶斯潜在行为建模和在线更新,结合大模型感知与人类驾驶智能,在CARLA基准上显著提升驾驶性能。
面向AI的QCD数据设计原则及其在桶形成像量热器中的应用
专题命中 评测与基准 :foundation model(abstract)
AI总结 提出面向AI的QCD数据设计框架,统一异构探测器数据结构,并在ePIC探测器桶形成像量热器模拟数据中验证,实现跨实验AI应用。
Comments 27 pages, 4 figure
PereStruct: 面向鲁棒历史文档解析的多模态语义组装
机构 * IGIC RAS(俄罗斯科学院信息传输问题研究所) ; Yandex Cloud ; National University of Science and Technology MISIS(莫斯科国立钢铁合金学院) ; Nekrasov Central Universal Scientific Library(涅克拉索夫中央综合科学图书馆)
专题命中 评测与基准 :language model(abstract)
AI总结 针对历史报纸复杂多栏布局的解析难题,提出结合微调YOLO与语义组装模块的多模态方法,在块到文章映射上F1达0.904,BLEU约0.96,显著优于通用视觉语言模型。
Comments Code and data available at https://github.com/makSShandybo/PereStruct
视觉语言模型能否感知传感器所感?一种可扩展的专家引导设计用于从街景评估轮椅可达性
机构 * University of Florida(佛罗里达大学) ; University of South Florida(南佛罗里达大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出专家引导的检索增强框架,利用视觉语言模型从谷歌街景图像识别轮椅可达性障碍,通过GPS轮椅停留行为验证,表明VLM评分与移动摩擦部分一致,但细粒度障碍识别有限。
SWARM-LLM:基于边缘的小语言模型的协同推理
专题命中 效率与部署 :LLM(title,title_cn);language model(title,abstract);small language model(title,abstract);SLM(summary_cn,abstract_cn)
AI总结 提出SWARM-LLM路由协作层,通过轻量级不确定性估计和安全信号,在边缘SLM、对等SLM协作和云端FM之间动态选择查询处理方式,实现精度、延迟和成本的平衡。
SLM、LLM 还是 Agentic AI?面向低空经济网络中智能无人机赋能WPT系统
专题命中 效率与部署 :LLM(title,title_cn);SLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 研究在资源受限动态环境下,利用小语言模型(SLM)和基于大语言模型(LLM)的Agentic AI框架优化无人机无线充电(WPT)路径与能量,实现低复杂度、低延迟和高能效。
Journal ref IEEE Journal on Selected Areas in Communications, 2026
BiSCo-LLM:用于极低比特大语言模型压缩的无查找表二进制球面编码
机构 * Nanjing University of Science and Technology(南京理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Huawei(华为)
专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 研究大语言模型部署时的压缩问题,提出BiSCo-LLM框架,通过将局部权重块映射到超球面二值化、编码重建误差、进行类别恢复蒸馏及设置保护通道路径等方法,实现极低比特权重压缩并减少存储开销。
面向基于小型语言模型(SLM)的GNSS欺骗检测的结构化驾驶状态叙事
专题命中 效率与部署 :SLM(title_cn,summary_cn);language model(title,abstract);small language model(title,abstract);large language model(abstract)
AI总结 本研究提出基于小型语言模型(SLM)的GNSS欺骗检测框架,通过对比多源驾驶状态的结构化叙事检测攻击,性能接近大模型且资源消耗更低,适用于车载平台。
Comments This work has been submitted to the Transportation Research Record: Journal of the Transportation Research Board for possible publication
缩小社会-语义差距:SPSD用于云LLM推理中的边缘端提示压缩
机构 * Indian School of Business(印度管理学院)
专题命中 效率与部署 :LLM(title,title_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对云LLM推理中提示词预填充阶段能耗高的问题,提出SPSD边缘端管道,利用4比特量化小语言模型压缩用户提示,在保持响应质量非劣效的前提下,平均节省99.9个输入token,每调用净节能70-270 uWh。
Comments 19 pages, 7 tables, 1 figure, includes appendix
TQLite:多大语言模型评审团引导的蒸馏用于实时MQM翻译质量评估
机构 * Netflix(网飞公司)
专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出TQLite蒸馏框架,通过多LRM评审团生成合成训练数据,使SLMs的MQM翻译质量评估性能远超普通SLM,成为LLM/LRM评估器的高性价比替代方案。
Comments 16 pages, 9 figures
从云端到人群:通过去中心化边缘协作实现面向检索增强生成(RAG)的大语言模型服务民主化
专题命中 效率与部署 :LLM(title,summary_cn);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 该研究提出DEFRAG系统,通过异构边缘设备的去中心化协作优化RAG的检索与生成,缩小SLM与LLM的准确率差距,大幅降低成本并提升吞吐量,助力边缘LLM服务民主化。
Comments 15 pages