arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

共收录 1102
2608.18077 2026-08-19 cs.RO 新提交

Hydra-0: Action Flow for Generalist World Modeling and Control

Hydra-0:面向通用世界建模与控制的动作流

Hongyu Li, Bowen Wen, Xinghao Zhu, Yixuan Wang, Yilun Du, Yunzhu Li, George Konidaris, Stan Birchfield, Soha Pouya, Chenran Li, Yan Chang

机构 * NVIDIA(英伟达) Brown University(布朗大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学)

AI总结 本研究提出Hydra-0通用世界模型,以动作流为条件实现跨实体、任务等的通用建模控制,在RoboLab基准获高相关性,还涌现出逆模式,可助力机器人控制。

Comments Project page: this https URL (https://nvidia-isaac.github.io/video_to_data/hydra-0/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17129 2026-08-19 cs.CV cs.RO 新提交

PROBE: Manipulation-Grounded Visual Question Answering with VLM Agents

PROBE:基于操作的视觉问答(使用VLM智能体)

Vineet Bhat, Siyi Chen, Alex Zook, Xuning Yang, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA(英伟达)

AI总结 针对现实杂乱环境中需操作遮挡物体的视觉问答问题,提出PROBE框架,含模拟器、基准测试集及微调方案,提升VLM智能体性能并验证模拟到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07464 2026-08-19 cs.RO cs.AI cs.CV 版本更新

Planning-aligned Token Compression for Long-Context Autonomous Driving

面向长上下文自动驾驶的规划对齐令牌压缩

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16319 2026-08-18 cs.LG 新提交

Advancing Open and Reproducible Relational Learning: RelArena-$α$, TabPFN-Rel and RPI

推进开放且可复现的关系学习:RelArena-$α$、TabPFN-Rel与RPI

Adrian Hayler, Klemens Flöge, Alan Arazi, Rishabh Ranjan, Jure Leskovec, Felix Birkel, Brendan Roof, Anurag Garg, Kristina Collins, Lydia Sidhoum, Jonas Kübler, Siyuan Guo, Oscar Key, Jan Hendrik Metzen, Rylee Grace, David Salinas, Arthur Cahu, Simon Bing, Benjamin Jäger, Tuana Çelik, Mihir Manium, Vitor Monteiro, Jake Robertson, Jerry Chen, Eliott Kalfon, Tomás Pereda, Lilly Wehrhahn, Dominik Safaric, Tobias Schroeder, Georg Grab, Diana Kriuchkova, Clara Cornu, Philipp Singer, Nick Erickson, Vahid Balazadeh, Marie Salmon, Simone Alessi, Kürşat Kaya, Philipp Jund, Léo Grinsztajn, Yann LeCun, Bernhard Schölkopf, Madelon Hulsebos, Lennart Purucker, Sauraj Gambhir, Frank Hutter, Noah Hollmann

机构 * Prior Labs Stanford University(斯坦福大学) NVIDIA(英伟达) University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

AI总结 Prior Labs开源RelArena-$α$、TabPFN-Rel与RPI三款关系学习工具,解决领域内方法比较不可靠问题,TabPFN-Rel在RelArena-$α$暂居第一,为关系学习提供开放可复现的研究基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16211 2026-08-18 cs.AI 新提交

BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics

BaT:构建具备阶段式评分标准的自演化医学研究智能体

Junqi Liu, Yufan He, Yexiao He, Pengfei Guo, Dong Yang, Andriy Myronenko, Can Zhao, Hanrong Ye, Tianhao Qi, Yuyin Zhou, Daguang Xu, Yucheng Tang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达)

AI总结 本文提出BaT系统,结合Stage Bank与BiCuRL方法,使医学研究智能体在AutoMedBench-Lite上得分大幅提升,BaT-9B性能优于Claude Opus 4.6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16058 2026-08-18 cs.RO 新提交

SurgVIL: Scaling Surgical Robot Imitation Learning with Open-source Surgical Videos

SurgVIL:利用开源外科视频扩展外科机器人模仿学习

Xinhao Chen, JuoTung Chen, Nigel Nelson, Antony Goldenberg, Jesse Haworth, Sean D. Huver, Axel Krieger

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) NVIDIA(英伟达公司)

AI总结 SurgVIL框架结合带运动学标签的体模机器人演示与开源外科视频,以弱监督补充运动学标签,在达芬奇机器人任务上提升了策略对真实组织等场景的泛化能力,为外科机器人模仿学习提供了可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14870 2026-08-18 cs.AI 新提交

JarvisBench: Always-on Intelligence Between Humans and Agents

JarvisBench:人类与智能体间的始终在线智能

Chen Chen, Zhehuai Chen

机构 * NVIDIA(英伟达)

AI总结 JarvisBench针对人类与智能体间的双向注意力协调问题,构建含45个任务实例的基准,可评估中间件的双向协调能力,为智能体能力提升提供稳定评估目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09860 2026-08-18 cs.RO cs.AI 版本更新

RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies

RoboLab:一种高保真模拟基准,用于分析任务通用策略

Jenai Xuning Yang, Rishit Dagli, Alex Zook, Hugo Hadfield, Ankit Goyal, Stan Birchfield, Fabio Ramos, Jonathan Tremblay

机构 * NVIDIA University of Toronto(多伦多大学) The University of Sydney(悉尼大学)

AI总结 RoboLab通过高保真模拟环境评估任务通用策略的真实泛化能力,提供120个任务的视觉、程序和关系能力测试,揭示当前最佳模型的性能差距。

Journal ref Robotics: Science and Systems XXII, Sydney, Australia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13929 2026-08-17 cs.CV cs.GR 新提交

RGBX-Next: Towards Realistic Generative Rendering from G-Buffers

RGBX-Next:基于G-buffers的真实感生成式渲染

Zheng Zeng, Marco Salvi, Lifan Wu, Jan Novák, Daqi Lin, Saeed Hadadan, Yichen Sheng, Robert Pottorff, Shiqiu Liu, Ravi Ramamoorthi, Ling-Qi Yan, Miloš Hašan

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) NVIDIA(英伟达公司) University of California, San Diego(加利福尼亚大学圣迭戈分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出RGBX-Next框架,将扩散Transformer(DiT)微调为正向与反向渲染器,可从图像等估算G-buffers或从G-buffers渲染真实感内容,在相关任务中表现优异,将公开模型并推动领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13719 2026-08-17 cs.AI cs.RO 新提交

Coverage Aware Active Evaluation for Failure Discovery with Paired Systems

面向配对系统故障发现的覆盖率感知主动评估

Anjali Parashar, Rachel Luo, Apoorva Sharma, Sushant Veer, Edward Schmerling, Carson Sobolewski, Mingxin Yu, Chuchu Fan, Marco Pavone

机构 * Laboratory of Information & Decision Systems (LIDS), MIT(麻省理工学院信息与决策系统实验室(LIDS)) NVIDIA Research(英伟达研究院)

AI总结 该研究针对自主系统故障发现难题,提出结合代理评估与残差建模、支持感知互信息目标的自适应方法,在三类任务中发现的故障数是基线的两倍。

Comments 9 main pages followed by Appendix, total 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00033 2026-08-17 cs.RO cs.AI cs.CV 版本更新

Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration

利用人类演示的接触力引导学习灵巧操作

Xinghao Zhu, Zixi Liu, Shalin Jain, Chenran Li, Milad Noori, Michael Andres Lin, Huihua Zhao, John Welsh, Mrinal Verghese, Wei Liu, Tingwu Wang, Xingye Da, Zhengyi Luo, Vishal Kulkarni, Naema Bhatti, Yuke Zhu, Linxi Fan, Bowen Wen, Danfei Xu, Soha Pouya, Yan Chang

机构 * NVIDIA(英伟达)

AI总结 提出CHORD框架,通过物体中心的接触力空间引导,利用人类演示的力和力矩信息增强强化学习,在包含4739个双臂灵巧操作任务的大规模基准上平均成功率82.12%,并泛化到全身操作和真实世界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13391 2026-08-14 cs.CV 新提交

Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

上下文匹配蒸馏:用于自回归视频蒸馏的教师因果性

Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi Cao, Ruilong Li, Bryan Chu, Sanja Fidler, Yi-Zhe Song, Zian Wang

机构 * NVIDIA(英伟达) University of Surrey(萨里大学)

AI总结 本文提出上下文匹配蒸馏(CMD)框架,解决现有视频蒸馏中教师监督与学生因果信息集不一致的问题,实现了自回归视频生成的最先进性能及对相机控制的更好依从性。

Comments Project Page: https://hmrishavbandy.github.io/cmd-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12629 2026-08-14 cs.LG 新提交

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

CAKE:面向前沿核函数演进的编译器-智能体协同设计

Zihao Ye, Yingyi Huang, Hongyi Jin, Bohan Hou, Junru Shao, Zhongming Yu, Jinqi Chen, Meghan Cowan, Shiyi Cao, Shanli Xing, Hanfeng Chen, Vinod Grover, Tianqi Chen, Luis Ceze

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达公司)

AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27616 2026-08-14 cs.CV cs.AI

Not All NVFP4 QAT Recipes Are Equal: How Architecture and Scale Shape Model Quality for Anomaly Segmentation

并非所有 NVFP4 QAT 配方都相同:架构和规模如何影响异常分割的模型质量

Zijian Du, Oleg Rybakov

机构 * NVIDIA

AI总结 本研究通过统一协议评估多种架构、规模和 FP4 量化感知训练 (QAT) 配方在脑肿瘤异常分割任务中的交互作用,发现架构选择对量化鲁棒性影响最大,注意力机制架构对配方选择具有显著韧性,而 CNN 在大规模下受梯度量化配方影响性能下降。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, June 2026, pp. 7713-7721

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07820 2026-08-14 cs.RO cs.AI cs.CV cs.GR cs.SY eess.SY 版本更新

SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control

SONIC:为自然人形全身体控进行超大规模运动追踪

Zhengyi Luo, Ye Yuan, Tingwu Wang, Chenran Li, Fernando Castañeda, Sirui Chen, Zi-Ang Cao, Jiefeng Li, David Minor, Qingwei Ben, Jinhyung Park, David Sami, Zi Wang, Xingye Da, Runyu Ding, Cyrus Hogg, Lina Song, Edy Lim, Eugene Jeong, Tairan He, Haoru Xue, Wenli Xiao, Simon Yuen, Jan Kautz, Yan Chang, Umar Iqbal, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA

AI总结 本文提出了一种超大规模运动追踪方法,通过扩大模型容量、数据和计算资源,实现了一种能够产生自然且稳健全身体态的通用人形控制器,并展示了其在运动追踪任务中的可扩展性及在下游任务中的应用价值。

Comments Project page: https://nvlabs.github.io/SONIC/

Journal ref Science Robotics 11 (117), eaed4592 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18733 2026-08-14 cs.LG 版本更新

A Prior-Aware Metric for Efficiently Distinguishing Memorization from Generalization in Large Language Models

先验意识记忆:一种区分记忆与泛化在大语言模型中的高效度量标准

Trishita Tiwari, Ari Trachtenberg, G. Edward Suh

机构 * Cornell University(康奈尔大学) Boston University(波士顿大学) NVIDIA(英伟达)

AI总结 本文提出Prior-Aware Memorization,一种基于模型先验的轻量级度量标准,用于区分大语言模型中的真实记忆与统计上常见序列,揭示低频率不足以证明记忆,强调需考虑模型先验以评估数据泄露风险。

Comments COLM 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12099 2026-08-13 cs.SD cs.CL 新提交

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

RT-SEMamba:基于渐进式知识蒸馏的实时语音增强Mamba模型

Rong Chao, Sung-Feng Huang, Moreno La Quatra, Sabato Marco Siniscalchi, Wen-Huang Cheng, Szu-Wei Fu, Yu Tsao

机构 * Academia Sinica(中央研究院) National Taiwan University(台湾大学) Kore University of Enna(恩纳科雷大学) University of Palermo(巴勒莫大学) NVIDIA(英伟达公司)

AI总结 该研究提出基于因果时频Mamba模块的全因果语音增强模型RT-SEMamba,通过渐进式知识蒸馏压缩模型,在Voicebank-DEMAND数据集上实现了高质量与低延迟的实时语音增强,速度较教师模型提升2.75倍。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11612 2026-08-13 cs.LG cs.AI 新提交

Dion3: Full-Stack Orthogonal Updates

Dion3:全栈正交更新

Noah Amsel, Jack Zhang, Kwangjun Ahn, Ali Naeimi, Austin Feng, Berlin Chen, Tri Dao, John Langford

机构 * Microsoft Research(微软研究院) New York University(纽约大学) Princeton University(普林斯顿大学) NVIDIA(英伟达) Yale University(耶鲁大学)

AI总结 Dion3是针对Muon优化器开销的改进版本,通过全栈优化降低了正交化、通信等开销,步长时间最多降6倍,可作为Muon的即插即用替代方案。

Comments 37 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20895 2026-08-13 cs.CL cs.LG 版本更新

LLM Router: Rethinking Routing with Prefill Activations

LLM Router: 重新思考预填激活的路由

Tanay Varshney, Annie Surla, Michelle Xu, Gomathy Venkata Krishnan, Maximilian Jeblick, David Austin, Neal Vaidya, Davide Onofrio

机构 * NVIDIA(英伟达)

AI总结 本文提出基于预填激活的路由方法,通过分离编码器和目标模型,提升路由性能,实验显示其在成本和准确性上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10995 2026-08-12 cs.CV 新提交

HNDiff: Haze-Noise Diffusion for Image Dehazing

HNDiff:用于图像去雾的雾霾-噪声扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立政治大学) NVIDIA(英伟达)

AI总结 本文提出嵌入大气散射模型的HNDiff扩散框架,通过雾霾感知噪声调度器关联正向退化物理机制,反向同步去雾去噪,改进主流去雾骨干网络并在基准数据集达最优结果。

Comments Accepted to ECCV 2026. Project Page: https://jin-ting-he.github.io/HNDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10835 2026-08-12 cs.CV cs.LG 新提交

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

UniProbe:基于多结构内部表征的可学习大视觉语言模型(VLM) token 级幻觉检测器

Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron

机构 * NVIDIA Research(英伟达研究院) Technion(以色列理工学院) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

AI总结 UniProbe 是基于 LVLM 异构计算轨迹的可学习 token 级幻觉检测器,通过多结构模块交互实现 SOTA 检测性能,解码时可降 55% 对象幻觉且延迟仅增 6%

Comments Project Page: https://research.nvidia.com/labs/par/uniprobe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10317 2026-08-12 cs.CV 新提交

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench

Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

机构 * NVIDIA(英伟达) Santa Clara University(圣克拉拉大学)

AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10056 2026-08-12 cs.RO cs.AI cs.LG cs.SY eess.SY 新提交

Navigating the Proximity-Safety Balance: Constraint Decomposition for Human Following in Pedestrian Crowds

权衡 proximity 与安全:人群中跟随目标行人的约束分解方法

Shiting Gong, Jianpeng Yao, Jinfeng Wang, Marco Pavone, Jiachen Li

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Riverside(加州大学河滨分校) Stanford University(斯坦福大学) NVIDIA Research(英伟达研究院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 该研究针对人群中行人跟随的 proximity 与安全平衡问题,提出多约束强化学习框架,量化行人运动不确定性以增强安全性,经实验和真实机器人部署验证了方法的有效性。

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026); Project Website: https://nav-ps-balance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19378 2026-08-12 cs.LG cs.CV stat.ML 版本更新

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

通过输入依赖的长卷积实现原生多维次二次算子

David R. Wessels, Farhad Ramezanghorbani, Alireza Moradzadeh, David W. Romero, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

机构 * AMLab, University of Amsterdam(阿姆斯特丹大学AMLab) NVIDIA(英伟达) Cartesia AI(Cartesia人工智能公司) New Theory AI(新理论人工智能公司)

AI总结 研究针对多维数据应用注意力机制次二次替代方案的权衡问题,提出HyenaND算子,通过特定卷积直接作用于多维数据原生几何结构,CUDA实现nSubQ加速,实验表明其在多领域表现出色,纯堆栈匹配基线,混合配置更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11470 2026-08-12 cs.CL 版本更新

The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

LLM推理的周期表:推理范式、方法与失败模式的结构化综述

Avinash Anand, Mahisha Ramesh, Avni Mittal, Ashutosh Kumar, Rishitej Reddy Vyalla, Erik Cambria, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工大学) Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) Owl Autonomous Imaging, Inc.(Owl自主成像公司) College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)

AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17162 2026-08-12 cs.AI q-bio.GN 版本更新

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNA:通过联合嵌入预测架构夯实基因组基础模型

Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

机构 * Applied AI Architecture, NVIDIA, Israel(NVIDIA应用人工智能架构,以色列) Worldwide Field Ops, NVIDIA, Israel(NVIDIA全球现场运营,以色列) Developer Programs, NVIDIA, Israel(NVIDIA开发者计划,以色列) Cancer Research Center and Wohl Institute of Translational Medicine, Sheba Medical Center, Tel Hashomer, Israel(癌症研究中心和Wohl转化医学研究所,Sheba医疗中心,Tel Hashomer,以色列) Windreich Department of AI and Human Health, Icahn School of Medicine at Mount Sinai, New York, USA(AI与人类健康风reich部门,Mount Sinai医学中心,纽约,美国)

AI总结 提出JEPA-DNA框架,将联合嵌入预测架构与生成式目标结合,通过潜在空间监督全局序列嵌入,实现从令牌恢复到语义对齐的转变,在17项基因组基准任务上提升线性探测和零样本性能,达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏