arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 4205
2609.04141 2026-09-04 cs.AI 新提交

Efficient Test-Time Adaptation through Human-AI Interaction

通过人机交互实现高效的测试时自适应

Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao, Aspen Chen, Jonas Mueller, Zhiqi Liang, Jett Chen, Michael Ryan, Qianou Ma, Luxi He, Zhoujun Cheng, Andre He, Seungone Kim, Jiayi Geng, Mingqian Zheng, Weiwei Sun, Zheyuan Zhang, Xinran Zhao, Yike Wang, Abe Hou, Liwei Jiang, Pang Wei Koh, Diyi Yang, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Handshake AI(汉德shake人工智能公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究提出TAHI方法,通过人机交互将跨会话信号整合到智能体中,针对30位用户的600项任务自适应后,单独任务成功率提升4.5-20.9%,还可跨用户提升最高8.8%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04094 2026-09-04 cs.AI cs.LG cs.SE 新提交

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

DRACO:面向长视界智能体训练的基于动态规则的细粒度信用分配

Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk

机构 * Carnegie Mellon University(卡内基梅隆大学) IBM Research(IBM研究院)

AI总结 针对长视界智能体训练中缺乏可验证奖励的问题,提出DRACO方法,通过动态生成规则并重新分配判断结果,在AppWorld和Tau-Bench上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03927 2026-09-04 cs.RO 新提交

Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models

迈向统一机器人学习:联结表征、视觉-语言-动作(VLA)与世界模型

Shaunak A. Mehta, Ananya Hazarika, Haochen Zhang, Fan Yang, Ryo Moriyama, Wenkai Li, Yash Patel, Kanata Suzuki

机构 * Fujitsu Research of America(美国富士通研究院) Carnegie Mellon University(卡内基梅隆大学) Fujitsu Limited(富士通株式会社)

AI总结 本综述提出统一机器人学习视角,梳理表征、VLA模型与世界模型三类方法,分析其交互与局限,展望未来集成化、物理接地的概率化机器人学习方向。

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03497 2026-09-04 cs.RO cs.AI 新提交

BRIDGE: An Open-Source Humanoid Platform via Morphology-Control Co-Design for Physical AI

BRIDGE:面向物理AI的、通过形态-控制协同设计实现的开源人形机器人平台

Jianren Wang, Letian Qian, Zikai Wang, Weiwei Wu, Junjie Zong, Abhinav Gupta, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Huazhong University of Science and Technology(华中科技大学) JoyIn AI(追觅科技)

AI总结 针对人形机器人开发中硬件与控制分离的问题,提出数据驱动的形态-控制协同设计框架,实现开源人形机器人平台Bridge,其性能优于Bumi等基准机器人,可高保真捕捉人类运动并完成多种动态动作

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03493 2026-09-04 cs.AI 新提交

Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models

让每一次工具调用都发挥作用:面向智能体视觉语言模型的必要工具-证据路径奖励

Xingming Long, Yu Liu, Zhiwei Yang, Hanqi Feng, Shaojie Zhang, Barnabas Poczos, Chao Jiang, Zhenbo Luo, Lei Jiang, Pei Fu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 针对智能体视觉语言模型工具调用监督不足的问题,提出NTEP标注方案与NTEP-R监督机制,在7个基准上验证了NTEP-8B可提升搜索准确率与工具使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03153 2026-09-04 cs.CV 新提交

VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

VeriPhy:用于世界模型评估与优化的智能体物理推理系统

Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学) Adobe Research(奥多比研究院)

AI总结 本文提出可审计的物理验证系统VeriPhy,通过纯文本规划器编译物理义务,结合冻结低级专家与三值状态裁决,在1500片段语料库评估中缺陷识别效果优于对比方法,可用于世界模型评估优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03102 2026-09-04 cs.CV 新提交

WireSeg-32K: A Physics-Grounded Synthetic Dataset for Wire Instance Segmentation

WireSeg-32K:用于导线实例分割的基于物理的合成数据集

Zilin Dai, Lehong Wang, Yi Yang, Xiang Fei

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对导线等可变形线性物体分割难、真实场景标注成本高的问题,提出含32000张图像的WireSeg-32K合成数据集,开发DeformX协同仿真流水线生成数据,经LoRA微调SAM3后真实场景mAP@75提升10.2%,验证了该合成数据的迁移价值。

Comments Synthetic Data for Computer Vision @ CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02987 2026-09-04 cs.LG stat.ML 新提交

Tail-Likelihood Reinforcement Learning

尾似然强化学习

Shrinivas Ramasubramanian, Daman Arora, Fahim Tajwar, Guanning Zeng, Qingyang Wu, Zhongzhu Zhou, Chenfeng Xu, Haiwen Feng, Yuda Song, Aarti Singh, Ruslan Salakhutdinov, J. Andrew Bagnell, Jeff Schneider, Andrea Zanette

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Impossible, Inc.(Impossible公司) Together AI Aurora Innovation

AI总结 针对强化学习优化平均奖励的局限,提出TailRL方法,通过最大化超过随机奖励阈值的对数概率,利用稀有高奖励样本提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02940 2026-09-04 cs.CL cs.AI 新提交

Listen to the Latents: Self-Correcting Speech Recognition in Large Audio Language Models Through Hidden-State Interactions

聆听隐态:基于隐态交互的大型音频语言模型自校正语音识别

Chan-Jan Hsu, Jaeyeon Kim, Chao-Han Huck Yang, Shinji Watanabe, Hung-yi Lee, Carlos Busso

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(台湾大学)

AI总结 本研究针对现有 ASR 系统整合 LLM 的两种策略结合不足的问题,提出 Hybrid Search 针对性校正策略,利用 LoRA 适配场景下的基础 LLM 隐态交互特征优化目标 token,显著提升了 ASR 推理性能。

Comments 24 pages, 8 figures, 2 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19491 2026-09-04 cs.LG cs.CL math.OC stat.ML 版本更新

Activation-Keyed Momentum: An Anisotropic Momentum Update via the Delta Rule

DeltaMomentum:基于键值结构的Delta规则各向异性动量更新

Euijin Hong, Guannan Qu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 DeltaMomentum将方向感知融入动量更新,可作为优化器动量缓冲器的即插即用替代,在预训练中减少AdamW步数,在多模型和数据集上验证了其有效性。

Comments This version (v2) changes the algorithm name from DeltaMomentum to Activation-Keyed Momentum (AK-Momentum) to avoid confusion with an existing algorithm named Delta Momentum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15565 2026-09-04 cs.CV cs.AI cs.LG eess.IV 版本更新

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

问两次,看两次:提示回声解决视觉语言模型中的问题优先悖论

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究视觉语言模型中问题优先提示的悖论,发现问题前置虽能引导感知但后续答案生成阶段难关注到问题。提出问题回声方法,即在图像两侧重复问题,解决了悖论,在多基准测试中表现出色且无需训练等。

Comments Accepted at the eXCV Workshop, ECCV 2026. Project page: https://rakshanda-cmu.github.io/ask-twice-look-twice/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16276 2026-09-04 cs.AI 版本更新

SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data

SpecAlign: 通过合成数据实现高效的大语言模型规范对齐

Wenjie Wang, Yue Huang, Zhengqing Yuan, Han Bao, Shiyi Du, Yuchen Ma, Yue Zhao, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Carnegie Mellon University(卡内基梅隆大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

AI总结 提出规范对齐新范式,通过从规范文档合成数据(SpecAlign框架),结合结构化规则标注、可控规范实例化和多智能体对抗数据合成,生成细粒度偏好对,提升规则遵守度且不损害通用能力。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13706 2026-09-04 cs.CR cs.AI cs.CY cs.NI 版本更新

Identifying AI Web Scrapers Using Canary Tokens

通过信标令牌识别人工智能网络爬虫

Steven Seiden, Triss Ren, Caroline Zhang, Taein Kim, Enze Liu, Emily Wenger

机构 * Duke University(杜克大学) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种自动识别与大型语言模型相关的网络爬虫的方法,通过动态网站和信标令牌验证爬虫身份,实验表明能可靠识别多个未公开的爬虫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11119 2026-09-04 cs.RO 版本更新

ASIP-Planner: Adaptive Planning for UAV Surface Inspection in Partially Known Indoor Environments

ASIP-Planner: 面向部分已知室内结构的自适应规划

Hanyu Jin, Zhefan Xu, Haoyu Shen, Xinming Han, Kanlong Ye, Kenji Shimada

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

AI总结 本文提出ASIP-Planner框架,通过全局覆盖规划与局部视角调整模块,提升无人机在部分已知室内环境中的表面检测效率与适应性。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08348 2026-09-04 cs.CL 版本更新

How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

电路能告诉我们多少?测量语言模型电路的一致性和特异性

Michael Li, Nishant Subramani

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, Pennsylvania, USA(语言技术研究所,卡内基梅隆大学,匹兹堡,宾夕法尼亚州,美国)

AI总结 研究通过分析六个任务和七个模型的电路重用情况,发现任务内电路重用高且共享组件对性能至关重要,但电路不具任务特异性,这引发了对电路支持针对性理解和干预的质疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20721 2026-09-04 cs.CL cs.AI cs.HC 版本更新

User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios

用户感知与代理LLM评判:隐私与帮助性在隐私敏感场景中的LLM响应

Xiaoyuan Wu, Roshni Kaushik, Wenkai Li, Lujo Bauer, Koichi Onoue

机构 * Fujitsu Research of America Inc.(富士通美国研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究发现用户对LLM响应的隐私和帮助性感知与代理LLM评判存在显著差异,需加强用户为中心的评估以提升隐私保护与实用性平衡。

Comments Published as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02413 2026-09-03 cs.GR cs.RO 新提交

WildFab: Multi-Axis 3D Printing from Models in the Wild

WildFab:面向野外模型的多轴3D打印

Jiasheng Qu, Zhikai Shen, Chenyu Xu, Hailin Sun, Chengkai Dai, Yuhu Guo, Junpeng Wang, Yeung Yam, Guoxin Fang

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Carnegie Mellon University(卡内基梅隆大学) Technical University of Denmark(丹麦技术大学)

AI总结 本研究提出WildFab框架,结合UDF与reg-GWN的混合查询表示,实现多轴3D打印的无支撑制造,可直接处理含非流形结构的各类“野外”模型,提升设计到3DP工作流的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02358 2026-09-03 cs.RO cs.LG cs.SY eess.SY 新提交

Humanoid Safe Stop via Learned Stoppability Value

基于可停止性值学习的人形机器人安全停止

Junfeng Long, Pieter Abbeel, Koushil Sreenath, Roberto Horowitz, Guanya Shi, C. Karen Liu

机构 * UC Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 该研究针对人形机器人紧急停止问题,提出Safe-Stop框架,结合学习的停止策略与互补的可停止性估计器,实现无需重训练的跨任务迁移,在鲁棒性与反应性间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02210 2026-09-03 cs.CV 新提交

Asymmetric Paired-Annotation Learning for Multi-Structure ULF Pediatric Brain MRI Segmentation

面向多结构超低场(ULF)儿科脑部MRI分割的非对称配对标注学习

Ha-Hieu Pham, Dang P. M. Cao, Minh Hoang Pham, Khanh Nguyen Vo Ngoc, Thanh-Huy Nguyen, Ulas Bagci, Huy-Hieu Pham

机构 * VinUniversity College of Engineering & Computer Science, VinUniversity(VinUniversity工程与计算机科学学院) Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) Center for Innovations in Health Sciences, VinUniversity(VinUniversity健康科学创新中心)

AI总结 针对0.064 T ULF儿科脑部MRI分割难题,提出基于nnU-Net的非对称监督策略AURA,利用两类非等效标注训练,在16例数据上取得优于基线的分割性能。

Comments Accepted at LISA Challenge, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02085 2026-09-03 cs.LG cs.CV 新提交

TC-Next: Zero-Shot Multimodal Cyclone Forecasting

TC-Next:零样本多模态热带气旋预测模型

Zhe Wang, Sijie Chen, Yiming Luo, Daehyun Kim, Chien-Yi Chang

机构 * Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔大学) Durham University(杜伦大学)

AI总结 TC-Next是一种多模态深度学习模型,仅在西太平洋GraphCast预报数据上训练,零样本应用于多种气象模型预报数据时,均优于传统规则追踪器,可提升热带气旋路径与强度预测性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25202 2026-09-03 cs.SE cs.AI 版本更新

SpecMine: A Large-Scale Corpus of Spec-Driven Development Artifacts

SPECMINE:一个大规模的规范驱动开发制品语料库

Shyam Agarwal, Anmol Singhal, Travis Breaux, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 SPECMINE是一个大规模语料库,通过两次普查收集公共GitHub仓库中的规范驱动开发制品,含大量文件、PR及引用数据,助力研究AI智能体时代软件的规范过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15861 2026-09-03 cs.LG 版本更新

TransfHAR: Self-Supervised Wrist Representations for On-Demand Activity Recognition

TransfHAR:用于按需活动识别的自监督手腕表征

Aidan Bradshaw, Riku Arakawa, Xin Liu, Karan Ahuja

机构 * Northwestern University(西北大学) Carnegie Mellon University(卡内基梅隆大学) Google(谷歌)

AI总结 TransfHAR是一种自监督手腕IMU框架,可通过学习粗粒度运动先验实现按需细粒度活动识别,在跨数据集评估及用户研究中均优于或匹配全监督基线,为该领域提供了有效基础。

Comments Accepted to the ACM Symposium on User Interface Software and Technology (UIST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22365 2026-09-03 cs.DM cs.LG 版本更新

Towards Solving the Gilbert-Pollak Conjecture via Large Language Models

通过大语言模型解决吉尔伯特-波拉克猜想

Yisi Ke, Tianyu Huang, Yankai Shu, Di He, Jingchu Gai, Liwei Wang

机构 * School of EECS, Peking University(北京大学电子工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(北京大学通用人工智能国家重点实验室) Carnegie Mellon University, Machine Learning Department(卡内基梅隆大学机器学习系)

AI总结 本文提出一种新的AI系统,通过生成受规则约束的几何引理并构建专用函数,以获得更紧的Steiner比下界,展示了大语言模型在高级数学研究中的强大潜力。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15602 2026-09-03 cs.CL 版本更新

GroupDPO: Memory-Efficient Group-Wise Direct Preference Optimization

GroupDPO:内存高效的组级直接偏好优化

Jixuan Leng, Si Si, Hsiang-Fu Yu, Vinod Raman, Inderjit S. Dhillon

机构 * CMU(卡内基梅隆大学) Google Deepmind(谷歌DeepMind) Google(谷歌)

AI总结 本文提出GroupDPO,通过解耦样本和保留梯度实现高效的组级偏好优化,减少内存使用,提升大规模训练效果,且在离线和在线对齐中均优于单对训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18851 2026-09-03 cs.LG cs.AI math.OC stat.ML

Applications of 0-1 Neural Networks in Prescription and Prediction

Vrishabh Patil, Kara Hoppe, Yonatan Mintz

机构 * Tepper School of Business, Carnegie Mellon University(卡内基梅隆大学泰珀商学院) Maternal-Fetal Medicine University of Wisconsin – Madison(威斯康星大学麦迪逊分校母胎医学系) Industrial and Systems Engineering, University of Wisconsin – Madison(威斯康星大学麦迪逊分校工业与系统工程系)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01257 2026-09-02 cs.AI 新提交

Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations

衡量长时程人类活动模拟的行为保真度

Yi Fei Cheng, Fan Yang, Iremsu Bas, Koichiro Niinuma, Narishige Abe, David Lindlbauer

机构 * Human-Computer Interaction Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院人机交互研究所) Fujitsu Ltd.(富士通有限公司) Fujitsu Research of America(富士通美国研究院)

AI总结 本研究提出评估长时程人类活动模拟行为保真度的框架,通过43小时办公活动数据集对比不同条件机制,发现统计先验最贴近真实行为但存在缺陷,推动了更全面的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00727 2026-09-02 cs.SD cs.AI 新提交

Heard but Not Heeded: Paralinguistic Information Encoding and Loss in Audio-Language Models

听见却未留意:音频-语言模型中的副语言信息编码与丢失

Bhuvan Koduru, Dareen Safar B Alharthi, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究分析四种开源音频-语言模型的副语言信息编码与丢失,发现模型虽在音频编码器顶层强编码说话风格,但信息在输出前退化,模型分内容、声学驱动两类,揭示了模型编码与使用信息的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00658 2026-09-02 cs.CV 新提交

Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning

教视觉-语言模型使用给定的尺度:用于度量物理推理的无标签等变训练

Kaizhen Tan, Yang Feng, Heqing Du, Siru Tao, Xin Xu, Hanzhe Hong

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究针对视觉-语言模型在度量物理推理中利用尺度信息不足的问题,提出无标签等变训练方法EquiSD,通过利用物理对称性实现无监督微调,提升了模型的度量接地能力与跨尺度泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00641 2026-09-02 cs.RO 新提交

AM-Bench: A Modular Simulation Suite and Benchmark for Aerial Manipulation Policy Learning

AM-Bench:面向空中操作策略学习的模块化仿真套件与基准

Yutong Wang, Dongjae Lee, Xiaofeng Guo, Yuanzhu Zhan, Yufei Jiang, Bavin Saravanan, Muqing Cao, Jia Xie, Chenyang Mao, Sebastian Scherer, Junyi Geng, Guanya Shi

机构 * The Robotics Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院机器人研究所) Department of Aerospace Engineering, Pennsylvania State University(宾夕法尼亚州立大学航空航天工程系) School of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程学院)

AI总结 该研究提出AM-Bench模块化仿真套件与基准,用于多旋翼空中操作策略学习,可系统评估实体、控制等因素的相互作用,经仿真与硬件测试验证其诊断价值。

Comments 28 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00291 2026-09-02 cs.CV 新提交

StreamScout: Learning When to Look Deeper for Streaming Video Understanding

StreamScout:学习何时深入探究以实现流视频理解

Ce Zhang, Jing Bi, Jinxi He, Jianshu Zhang, Jingyang Lin, Yunzhong Xiao, Minghao Fu, Yaqi Xie, Zhentao Xie, Weicong Chen, Katia Sycara, Ming Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学) Northwestern University(西北大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) TikTok(字节跳动旗下TikTok)

AI总结 StreamScout是自适应流视频理解框架,通过分级视觉视图与优化的停止策略提升性能,在多基准测试中优于现有方法,降低推理成本与令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏