arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

共收录 1818
2609.04201 2026-09-04 cs.CV 新提交

Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction

Scal3R:学习高效的多相对位姿查询以实现可扩展的在线三维重建

Chin-Yang Lin, Yang-Che Sun, Cheng Sun, Fu-En Yang, Min-Hung Chen, Yen-Yu Lin, Wei-Chen Chiu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) NVIDIA(英伟达公司)

AI总结 Scal3R将在线三维重建转化为多参考相对位姿查询,通过轻量可学习标记和位姿图优化抑制漂移,在多数据集上实现性能提升

Comments ECCV 2026. Project page: https://linjohnss.github.io/scal3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03350 2026-09-04 cs.LG cs.CL 新提交

From Zero to Hero: An Open LLM Ecosystem for Armenian

从零基础到卓越:面向亚美尼亚语的开源大语言模型生态系统

Erik Arakelyan, Khatun Avetisyan, Meri Davtyan, Heghine Grigoryan, Nane Khachatryan, Hayk Shahsuvaryan, Henrik Sergoyan, Vahan Martirosyan

机构 * NVIDIA(英伟达) COPA

AI总结 针对亚美尼亚语低资源问题,整理发布ArmWeb、ArmSTEM数据集,预训练得到首个带完整数据和方法的开源亚美尼亚语LLM arm-gemma-e4b,验证了STEM数据可弥补新闻预训练的知识损失,公开全部资源。

Comments 18 pages, 4 figures, 13 tables. Data and model: https://huggingface.co/collections/COPA-AI/armenian-llm-ecosystem. Code: https://github.com/COPATeam/armenian_llm_ecosystem

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03199 2026-09-04 cs.CV cs.RO 新提交

RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning

RoboTok:用于人类演示检索与灵巧操作学习的互联网规模数据引擎

Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul, Gaotian Wang, Bowen Wen, Chen Wei, Kaiyu Hang

机构 * Rice University(莱斯大学) NVIDIA(英伟达)

AI总结 RoboTok是用于人类演示检索与灵巧操作学习的互联网规模数据引擎,通过学习3D手部轨迹的潜在运动空间,从网络视频检索相关演示,提升了机器人策略的下游任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03107 2026-09-04 cs.SD cs.CR cs.LG 新提交

CRAW: Codec Robust Audio Watermarking

CRAW:编解码器鲁棒音频水印

David Chernin, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) NVIDIA(英伟达公司)

AI总结 针对现有音频水印方法在实际变换下鲁棒性不足的问题,提出CRAW框架,结合多种技术提升对神经编解码器等的鲁棒性,同时保持感知质量,达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02940 2026-09-04 cs.CL cs.AI 新提交

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

聆听隐态:基于隐态交互的大型音频语言模型自校正语音识别

Chan-Jan Hsu, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Hung-yi Lee, Carlos Busso

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(台湾大学)

AI总结 本研究针对现有 ASR 系统整合 LLM 的两种策略结合不足的问题,提出 Hybrid Search 针对性校正策略,利用 LoRA 适配场景下的基础 LLM 隐态交互特征优化目标 token,显著提升了 ASR 推理性能。

Comments 24 pages, 8 figures, 2 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09968 2026-09-04 cs.CV 版本更新

ReCoSplat: Online Feed-Forward Gaussian Splatting via Render-and-Compare

ReCoSplat: 基于渲染与比较的自回归前馈高斯点云生成

Freeman Cheng, Botao Ye, Xueting Li, Junqi You, Fangneng Zhan, Ming-Hsuan Yang

机构 * University of California Merced(加州大学默塞德分校) ETH Zurich(苏黎世联邦理工学院) NVIDIA Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 ReCoSplat通过引入渲染与比较模块,解决高斯点云生成中姿态误差问题,实现高效稳定的视角合成。

Comments v2: Corrected OF3GS evaluation results after fixing an implementation bug, added baseline evaluations, updated efficiency benchmarks following a codebase refactor, and added code and pretrained model release links

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21719 2026-09-04 cs.IT cs.AI eess.SP math.IT 版本更新

Sionna RT: Technical Report

Sionna RT:技术报告

Fayçal Aït Aoudia, Jakob Hoydis, Merlin Nimier-David, Baptiste Nicolet, Sebastian Cammerer, Alexander Keller

机构 * NVIDIA(英伟达公司)

AI总结 Sionna RT 是一个用于高效模拟无线电信号传播的开源射线追踪器,具备可微性以计算梯度,并通过改进算法提升速度和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02886 2026-09-03 cs.CV 新提交

SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

SolarWM:面向长时序视频世界模型的开放数据与可扩展训练

Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang

机构 * CUHK-SZ(香港中文大学(深圳)) SLAI(深圳先进人工智能研究院) NUS(新加坡国立大学) CUHK(香港中文大学) HKUST(香港科技大学) HKUST-GZ(香港科技大学(广州)) NVIDIA(英伟达公司) UCLA(加利福尼亚大学洛杉矶分校) MSRA(微软亚洲研究院)

AI总结 SolarWM是面向长时序视频世界模型的开放基础框架,通过多源数据引擎与适配框架实现异构数据训练,实例化多款5B至33B模型,仅用5秒序列训练即可支持长时序实时交互,为相关研究提供可复扩展的基础。

Comments https://junchao-cs.github.io/SolarWM-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02849 2026-09-03 cs.LG cs.AI cs.CL cs.MA cs.SE 新提交

Post-Training Language Models for Gold-Medal Performance in Coding Competitions

用于在编程竞赛中取得金牌级表现的训练后语言模型

Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA(英伟达)

AI总结 本研究提出结合SFT、RL及GenCorrect策略的训练后语言模型,在编程竞赛中超越人类选手,成为首个在IOI题集得分超最高人类参赛者的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02649 2026-09-03 cs.AI cs.CL cs.LG 新提交

Loom: Weaving Diagnostic Strands into Free-Text Consensus via Embedding-Space Reweighting

Loom:通过嵌入空间重加权将诊断线索编织为自由文本共识

Ron Begleiter, Katya Egert Berg, Gilad Saban, Gil Shabat

机构 * NVIDIA(英伟达)

AI总结 本文提出用于根因分析的Loom框架,通过嵌入空间重加权聚合模块化启发式的开放式假设,在OpenRCA基准上实现了准确率与效率的帕累托优化,为工业场景提供可靠共识方案。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01662 2026-09-03 cs.RO cs.AI 新提交

Not All Agreement Counts as Corroboration: Provenance-Conserving Multi-View Fusion for Typed Action Admission in Human-Robot Collaboration

并非所有一致性都算作印证:人机协作中用于类型化动作接纳的保留来源多视图融合

Zekai Jin, Hanrong Zhang, Yihong Tang, Fei Hu, Zhen Dong, Yi Shao

机构 * McGill University(麦吉尔大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Norwegian University of Science and Technology(挪威科技大学) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) NVIDIA Corporation(英伟达公司) University of British Columbia(不列颠哥伦比亚大学)

AI总结 该研究提出保留来源的多视图融合方法 PACT,用于人机协作的类型化动作接纳,经多组实验验证其在风险覆盖等指标上的优势,明确一致性需来源支持才构成印证。

Comments 35 pages, 8 figures, 11 tables. Code and supporting materials: https://github.com/ZekaiJ/PACT

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01659 2026-09-03 cs.CV cs.CL cs.RO 新提交

Beyond Textual Chain-of-Thought: A Survey on Action-Grounded Reasoning in Autonomous Driving

超越文本思维链:自动驾驶中基于动作的推理综述

Zhengxu Tang, Xiaozhou Zhang, Guofeng Cui, Ziyu Gong, Zi Wang, Yunfei Shi, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

机构 * NVIDIA(英伟达)

AI总结 本综述调研171篇文献,提出以表示为中心的分类法,将自动驾驶基于动作的推理方法分为四类13个子类型,指出其前沿为可关联现实世界、耦合实时动作且可安全验证的中间表示。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01284 2026-09-03 cs.LG cs.AI 版本更新

Training nGPT

训练nGPT

Ilya Loshchilov, Boris Ginsburg

机构 * NVIDIA(英伟达)

AI总结 本文提出nGPT的实用训练方案,含Logit梯度预条件等技术,在14B参数的混合MoE模型上训练时,仅需约一半训练token即可达到与非归一化模型相同的验证损失,方案具可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18216 2026-09-03 cs.CL 版本更新

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

近端策略优化区域:教师存在于提示中,而非梯度中

Byung-Kwan Lee, Ximing Lu, Shizhe Diao, Minki Kang, Saurav Muralidharan, Karan Sapra, Andrew Tao, Pavlo Molchanov, Yejin Choi, Yu-Chiang Frank Wang, Ryo Hachiuma

机构 * NVIDIA(英伟达)

AI总结 提出ZPPO方法,通过将教师知识注入提示而非策略梯度,解决小模型知识蒸馏中教师梯度主导和强化学习策略漂移问题,在多种规模模型上超越现有方法。

Comments Project page: https://byungkwanlee.github.io/ZPPO-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16077 2026-09-03 cs.LG 版本更新

MDM-Prime-v2: Binary Encoding and Index Shuffling Enable Scaling of Diffusion Language Models

MDM-Prime-v2:二进制编码和索引洗牌使扩散语言模型能够扩展

Chen-Hao Chao, Wei-Fang Sun, Junwei Quan, Chun-Yi Lee, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA AI Technology Center(NVIDIA AI技术中心) National Taiwan University(国立台湾大学)

AI总结 本文提出MDM-Prime-v2,通过二进制编码和索引洗牌技术改进扩散语言模型,解决了子分词器功能形式与BPE分词器结合导致的交叉熵损失增加以及子分词器粒度超参数选择缺乏工具的问题,从而提升了模型在常识推理基准上的零样本准确率。

Comments Published at EMNLP 2026 (Main). Code: https://github.com/chen-hao-chao/mdm-prime-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00924 2026-09-02 cs.CV cs.AI 新提交

Beyond the Image Plane: World-Grounded Queries for Multi-Object Tracking

超越图像平面:用于多目标跟踪的世界 grounding 查询

Orcun Cetintas, Guillem Brasó, Tim Meinhardt, Laura Leal-Taixé

机构 * NVIDIA(英伟达) Technical University of Munich(慕尼黑工业大学)

AI总结 针对单目视频多目标跟踪受图像平面模糊深度与空间关系的局限,提出端到端多目标跟踪器 PLANET,通过将二维跟踪数据集提升至三维并构建世界 grounding 查询等方法,在三个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00242 2026-09-02 cs.CV cs.AI cs.CL cs.RO 新提交

CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction

CoLT-Drive:用于驾驶 affordance 预测的反事实长尾基准测试与知识保留适应

Zhengxu Tang, Guofeng Cui, Ziyu Gong, Xiaozhou Zhang, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

机构 * NVIDIA(英伟达)

AI总结 本文针对自动驾驶长尾故障的决策级驾驶 affordance 预测问题,提出反事实长尾基准 CoLT-Drive 和知识保留适应框架 KPA,KPA 在 CoLT-Drive 上的动作对准确率达 60.8%,优于基线模型。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00428 2026-09-02 astro-ph.EP cs.LG 新提交

Accelerating Chemical Kinetics for Exoplanet Atmospheres using Neural Networks

使用神经网络加速系外行星大气的化学动力学

Isaac Malsky, Xi Zhang, Tiffany Kataria, Matthew Graham, Ziyu Huang, Boris Bonev, Shang-Min Tsai, Elspeth K. H. Lee

机构 * Jet Propulsion Laboratory, California Institute of Technology(加州理工学院喷气推进实验室) University of California Santa Cruz(加州大学圣克鲁兹分校) California Institute of Technology(加州理工学院) Georgia Institute of Technology(佐治亚理工学院) NVIDIA Corporation(英伟达公司) University of California, Riverside(加州大学河滨分校) Institute of Astronomy and Astrophysics, Academia Sinica(中央研究院天文及天文物理研究所) University of Bern(伯尔尼大学)

AI总结 本文提出基于残差流图架构的机器学习局部框化学动力学求解器,实现系外行星大气模拟的微秒级推理,精度达百分级,速度远超经典求解器,可覆盖宽参数空间,性能优于常用机器学习架构。

Comments 15 pages, 7 figures. Accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06183 2026-09-02 cs.AI 版本更新

MicroEvo: Knowledge-Guided LLM Sampling for Efficient Microarchitecture Design Space Exploration

MicroEvo:知识引导的大语言模型采样用于高效微架构设计空间探索

Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie

机构 * Southeast University(东南大学) National Center of Technology Innovation for EDA(国家EDA技术创新中心) NVIDIA Corporation(英伟达公司) Fudan University(复旦大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学)

AI总结 MicroEvo是结合LLM与MCTS的知识引导框架,用于多目标微架构优化,可提升帕累托前沿质量与搜索效率,具备工业级可扩展性。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29590 2026-09-01 cs.CV 新提交

Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models

强安全护栏下大型视觉语言模型的护栏无关社会偏见评估

Yusuke Hirota, Michael Ross Boone, Arun George Zachariah, Jibin Rajan Varghese, Yu-Chiang Frank Wang, Boyi Li, Ryo Hachiuma

机构 * NVIDIA(英伟达)

AI总结 本研究针对强护栏LVLMs的偏见评估难题,提出解耦人物属性推断的评估方法,发现20款LVLMs均存在不当使用用户人口统计信息的偏见,且专有模型偏见低于开源模型。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29374 2026-09-01 cs.CV 新提交

Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

思考、观察与修正:多模态大语言模型中基于不一致感知的视觉自我修正

Yu Cheng, Arushi Goel, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) NVIDIA Research(英伟达研究院)

AI总结 本研究针对工具增强型多模态推理中工具输出缺乏验证的问题,提出ReVISE框架,通过带监督反思的训练数据集与强化学习目标奖励,实现错误检测与修正,在多个基准上取得性能提升。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29057 2026-09-01 cs.LG math.DS 新提交

Sparse Koopman Autoencoders Identify Local Dynamical Regimes in Multibasin Systems

稀疏Koopman自编码器识别多盆系统中的局部动力学 regime

Aidan Li, Uday Kiran Reddy Tadipatri, Mahan Fathi, Sarath Chandar, Ross Goroshin

机构 * Chandar Research Lab(钱达尔研究实验室) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) University of Pennsylvania(宾夕法尼亚大学) NVIDIA(英伟达) Polytechnique Montréal(蒙特利尔理工学院)

AI总结 该研究提出稀疏Koopman自编码器(SKAEs),无需标签即可识别多盆系统的局部动力学 regime,其预测性能优于密隐KAEs,且隐支撑可有效识别吸引盆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-09-01 cs.CL 版本更新

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

Comments Accepted to EMNLP 2026 Main Conference. Code: https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/sherloc

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-09-01 cs.CV 版本更新

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15503 2026-09-01 cs.AR cs.DC cs.LG cs.PF 版本更新

DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures

DCC: 面向处理-内存架构的机器学习内核数据驱动编译

Peiming Yang, Sankeerth Durvasula, Ivan Fernandez, Mohammad Sadrosadati, Onur Mutlu, Gennady Pekhimenko, Christina Giannoula

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Barcelona Supercomputing Center(巴塞罗那超级计算中心) ETH Zürich(苏黎世联邦理工学院) Nvidia(英伟达) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

AI总结 针对PIM系统中数据重排与计算代码优化相互依赖的问题,提出数据驱动的编译器DCC,通过统一调优联合优化数据重排与计算代码,在HBM-PIM和AttAcc PIM上分别实现平均2.21倍和3.92倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28140 2026-08-31 cs.RO 新提交

Contact-Guided Exploration for Non-Prehensile Locomanipulation with Multi-Critic RL

基于多评论家强化学习的非抓取型移动操纵的接触引导探索

Simone Tolomei, Mayank Mittal, Franco Angelini, Manolo Garabini, Paolo Salaris, Marco Hutter

机构 * Centro di Ricerca E. Piaggio(E.皮亚焦研究中心) Università di Pisa(比萨大学) ETH Zürich(苏黎世联邦理工学院) NVIDIA(英伟达公司)

AI总结 针对非抓取型移动操纵的复杂混合动力学与接触稀疏性问题,提出多评论家RL框架下的接触引导探索策略,经四足移动操纵器实验验证可实现现实世界中的非抓取型操纵。

Comments project website: https://tolomeis.github.io/contact-guided-exp Accepted in IEEE Robotics and Automation Letter (RA-L) 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27548 2026-08-31 cs.AI 新提交

Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator

Nemotron 3.5 内容安全审核器:一款紧凑的多模态、多语言且具备推理能力的内容安全审核器

Varun Singh, Anuj Doshi, Makesh Narsimhan Sreedhar, Shaona Ghosh, Katherine Luna

机构 * NVIDIA(英伟达)

AI总结 本研究提出紧凑多模态多语言的Nemotron 3.5 CS安全审核器,兼具低计算成本与推理能力,可覆盖多场景安全审核,还发布配套安全数据集,验证其在多维度评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26403 2026-08-31 cs.CL 版本更新

ProfileFoundry: A Synthetic Person-Object Substrate for Privacy, Memory, and Tool-Use Evaluation in LLM Agent

ProfileFoundry: 用于LLM智能体隐私、记忆和工具使用评估的合成人物-对象基底

Sriram Selvam, Anneswa Ghosh

机构 * NVIDIA Corporation(英伟达公司)

AI总结 提出ProfileFoundry,一个确定性生成器,发布10万个合成成人人物对象,包含快照、家庭、雇主等字段及事件、关系边,用于下游基础模型评估中的记忆、隐私等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25701 2026-08-27 cs.CV 新提交

Skeleton-based Zero-Shot Spatio-Temporal Action Localization via Weakly-Supervised Pretraining

基于骨骼的零样本时空动作定位:弱监督预训练方法

Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii

机构 * Konica Minolta, Inc.(柯尼卡美能达公司) Keio University(庆应义塾大学) CyberAgent(CyberAgent公司) NVIDIA(英伟达公司)

AI总结 该研究提出基于骨骼的零样本时空动作定位方法,通过弱监督视觉-语言预训练与场景混合判别对比学习,解决标注限制问题,在四个公开数据集上验证了有效性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25080 2026-08-27 cs.LG cs.AI stat.ML 新提交

NVExplain: Explaining Time Series Forecasting with Latent Trajectory Analysis and Structure-Preserving Surrogates

NVExplain:基于潜在轨迹分析与结构保持替代模型的时间序列预测解释方法

Muyan Anna Li, Manikandan Ravikiran, Aditi Gautam

机构 * NVIDIA(英伟达)

AI总结 该研究提出模型无关的NVExplain框架,通过潜在轨迹分析与结构保持替代模型,提升时间序列预测解释的忠实性与效率,解释具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏