arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

共收录 1992
2609.04141 2026-09-04 cs.AI 新提交

Efficient Test-Time Adaptation through Human-AI Interaction

通过人机交互实现高效的测试时自适应

Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao, Aspen Chen, Jonas Mueller, Zhiqi Liang, Jett Chen, Michael Ryan, Qianou Ma, Luxi He, Zhoujun Cheng, Andre He, Seungone Kim, Jiayi Geng, Mingqian Zheng, Weiwei Sun, Zheyuan Zhang, Xinran Zhao, Yike Wang, Abe Hou, Liwei Jiang, Pang Wei Koh, Diyi Yang, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Handshake AI(汉德shake人工智能公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究提出TAHI方法,通过人机交互将跨会话信号整合到智能体中,针对30位用户的600项任务自适应后,单独任务成功率提升4.5-20.9%,还可跨用户提升最高8.8%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25390 2026-09-04 cs.LG cs.AI cs.CR 版本更新

Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks

弃权几何反映弃权训练:多样的弃权前缀可提升稳定秩并削弱弃权向量消融攻击

Andrey Labunets

机构 * UC San Diego(加州大学圣迭戈分校)

AI总结 本研究以OLMo-2-0425-1B-Instruct为对象,揭示弃权几何与弃权训练的关联,发现多样弃权起始可提升梯度稳定秩,削弱弃权向量消融攻击,为提升AI模型弃权鲁棒性提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31002 2026-09-04 cs.AI cs.CL cs.LO 版本更新

Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization

超越编译:评估从自然语言到Lean的忠实语句形式化

Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy, Yi Xie, Zhi Wang, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of Arizona(亚利桑那大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 提出忠实语句形式化评估方法,结合Lean编译、跨模型语义判断和人类专家校准,发现编译通过但语义不忠实的29.0%差距,并分解形式化流程中的关键干预因素。

Comments Revised version: adds expanded human calibration, a same-sample comparison with LeanScorer, independent-judge and threshold-sensitivity analyses, and a BEq formal cross-check; reframes the main contribution around semantic-faithfulness evaluation. 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21047 2026-09-04 cs.AI cs.CL cs.LG 版本更新

Grammar-Aligned Decoding

语法对齐解码

Kanghee Park, Jiayu Wang, Taylor Berg-Kirkpatrick, Nadia Polikarpova, Loris D'Antoni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出语法对齐解码(GAD)方法,通过适应性采样与近似期望未来(ASAp)算法,提升语法约束下生成输出的质量和概率匹配度。

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07761 2026-09-04 cs.RO 版本更新

High-Altitude Balloon Station-Keeping with First Order Model Predictive Control

基于一阶模型预测控制的高空气球驻留控制

Myles Pasetsky, Jiawei Lin, Bradley Guo, Sarah Dean

机构 * Cornell University(康奈尔大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文针对高空气球驻留控制问题,开发了一阶模型预测控制(FOMPC),其无需离线训练,性能优于现有最优强化学习策略,实现半径内时间提升24%,在线规划在多种配置下均有效。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02191 2026-09-03 cs.AI 新提交

Examining the Vulnerability of Multi-Agent Medical Systems to Human Interventions for Clinical Reasoning

探究多智能体医疗系统在临床推理中对人为干预的脆弱性

Benjamin C Liu, Dillon Mehta, Rishi Malhotra, Adam Zobian, Yong Ying Tan, Samir Chopra, Daniella Rand, Natalie Pang, Abhiram Gudimella, Kevin Zhu

机构 * Stanford University(斯坦福大学) Jordan High School(乔丹高中) UC San Diego(加利福尼亚大学圣迭戈分校) Winchester High School(温彻斯特高中) James Logan High School(詹姆斯·洛根高中) Rutgers University(罗格斯大学) Foothill–De Anza College(福希尔-德安扎学院) Fordham University(福特汉姆大学) Chapman University(查普曼大学) UC Berkeley(加利福尼亚大学伯克利分校)

AI总结 该研究针对多智能体医疗系统,借助MedQA数据集分析人为干预对其临床推理的影响,发现正确干预可提升诊断准确率、错误干预会降低性能,还揭示了模拟智能体与现实临床的认知偏见相似性,为提升系统诊断鲁棒性提供思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06973 2026-09-03 cs.CL 版本更新

LLMs Can't Play Hangman: On the Necessity of a Private Working Memory for Language Agents

LLMs无法玩井字游戏:关于语言代理所需私人工作记忆的必要性

Davide Baldelli, Ali Parviz, Amal Zouaq, Sarath Chandar

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔大学) University of California, San Diego(加州大学圣地亚哥分校) LAMA-WeST Lab(LAMA-WeST实验室) Chandar Research Lab(Chandar研究实验室)

AI总结 本文提出私人状态交互任务(PSITs)并证明标准LLMs无法在交互任务中保持秘密和一致性,提出包含显式私人工作记忆的架构以恢复一致性。

Comments Accepted at the Conference on Lifelong Learning Agents (CoLLAs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01552 2026-09-02 cs.AI cs.LG 新提交

Can LLMs Discover Scientific Laws in Real and Parallel Worlds?

大型语言模型(LLM)能否在真实世界与平行世界中发现科学定律?

Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang

机构 * University of California San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学欧文分校) Cushing Academy(卡欣学院) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 本研究推出科学定律发现基准SCILAWS-BENCH,通过真实与平行双设置评估LLM的科学定律发现能力,发现预测拟合与科学有效性背离、记忆影响公式复现及存在选择瓶颈等现象,为相关评估提供新视角。

Comments 42 pages, 16 figures. Project page: https://yiyihum.github.io/SciLaws-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01158 2026-09-02 cs.LG cs.AI 新提交

Superposed Latent Autoencoder

叠加式潜在自编码器

Quanling Zhao, Jiaying Yang, Tianqi Zhang, Ziyang Hao, Fatemeh Asgarinejad, Flavio Ponzina, Tajana Rosing

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of California Riverside(加利福尼亚大学河滨分校) San Diego State University(圣迭戈州立大学)

AI总结 提出叠加式潜在自编码器(SLAE),通过学习叠加共享存储,在相同内存预算下改善重构-内存权衡,降低重构误差,还提升下游分类性能,为表示压缩提供新原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00291 2026-09-02 cs.CV 新提交

StreamScout: Learning When to Look Deeper for Streaming Video Understanding

StreamScout:学习何时深入探究以实现流视频理解

Ce Zhang, Jing Bi, Jinxi He, Jianshu Zhang, Jingyang Lin, Yunzhong Xiao, Minghao Fu, Yaqi Xie, Zhentao Xie, Weicong Chen, Katia Sycara, Ming Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学) Northwestern University(西北大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) TikTok(字节跳动旗下TikTok)

AI总结 StreamScout是自适应流视频理解框架,通过分级视觉视图与优化的停止策略提升性能,在多基准测试中优于现有方法,降低推理成本与令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00051 2026-09-02 cs.CL cs.AI cs.CY 新提交

From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling

从检测到弃权:通过电路引导的权重缩放实现更安全的大语言模型(LLMs)

Kuan-Lin Chu, Chung-En Sun, Tsui-Wei Weng

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) Halıcıoğlu Data Science Institute, University of California San Diego(加利福尼亚大学圣迭戈分校哈利乔格鲁数据科学学院)

AI总结 本文从机制可解释性视角刻画LLM的多阶段安全电路,通过电路引导的权重缩放提升6个LLM在对抗攻击下的安全率26.5%,仅造成1.7%的准确率下降,为LLM安全提供了电路级解释。

Comments Accepted to Findings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00048 2026-09-02 cs.CL cs.AI 新提交

GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments

GUI-CC:将GUI世界模型作为智能体环境对其上下文一致性进行基准测试

Lin Fu, Zheyuan Yang, Tianhui Zhang, Jinbiao Wei, Guo Gan, Boxu Liu, Yilun Zhao, Yu Rong

机构 * Yale University(耶鲁大学) Zhejiang University(浙江大学) China University of Geosciences(中国地质大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Tongji University(同济大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 研究针对GUI世界模型作为智能体环境评估的不匹配问题,提出GUI-CC基准,含两个赛道及对应任务,评估四项指标,发现当前模型单步生成合理但多步上下文一致性不足。

Comments EMNLP 26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07775 2026-09-02 cs.CV

Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

滚动汇:在有限时间训练和开放-ended测试之间架桥

Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。

Comments Project page: https://rolling-sink.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13880 2026-09-02 cs.AI 版本更新

LifeAgentBench: Benchmarking LLMs for Long-Horizon, Cross-Dimensional Lifestyle Health Reasoning

LifeAgentBench: 一个多维基准和代理用于数字健康中的个人健康助手

Ye Tian, Zihao Wang, Onat Gungor, Xiaoran Fan, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) Google Research(谷歌研究)

AI总结 本文提出LifeAgentBench多维基准和代理,用于评估LLM在长周期、跨维度健康推理中的能力,并通过实验识别关键瓶颈,提出基线代理LifeAgent实现显著改进。

Comments Accepted to EMNLP26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30260 2026-09-01 cs.CL cs.AI cs.LG 新提交

Using Prosody to Predict Syntactic Structure

用韵律预测句法结构

Junghyun Min, Alex Warstadt, Tamar I. Regev, Tiago Pimentel, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

AI总结 该研究从信息论视角提出通用框架,利用多模态语言模型量化韵律与句法的互信息,发现韵律可降低自然对话中10.2%的句法不确定性,为相关理论提供实证支持。

Comments 15 pages, 4 figures. EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30110 2026-09-01 cs.CL cs.AI 新提交

Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators

大语言模型(LLM)能否监测经济状况?对宏观经济指标的LLM实时预报的评估

Xinyue Zhao, Ruiyi Zhang, Liqin Ye, Rui Cao, Pengtao Xie, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究推出抗污染基准LiveMacroEval,对比多类基准发现,具备网络搜索能力的LLM智能体对美国16项宏观经济指标的实时预报准确性与专业基准相当,展现出宏观经济实时估算潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29739 2026-09-01 cs.CV 新提交

Drift Calibration in Geometric Eye Tracking Systems

几何眼动追踪系统中的漂移校准

Jiaqi Liu, Zixuan Wang, Yuhong Zhang, Dingkang Liang, Jane Hanqi Li, Tzyy-Ping Jung, Gert Cauwenberghs

机构 * Institute for Neural Computation, University of California San Diego(加州大学圣地亚哥分校神经计算研究所)

AI总结 本文针对几何眼动追踪系统的残留校准误差,构建专用数据集评估校正函数,提出轻量级神经细化器,实验显示其可降低平均角度误差,为注视交互建模提供可复现基准。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29459 2026-09-01 cs.AI 新提交

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

面向潜在语言模型技能的引导与优化:一项实证研究

Xunyi Jiang, Junda Wu, Yuxin Xiong, Sheldon Yu, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley, Hongyi Wen

机构 * New York University(纽约大学) Adobe Research(奥多比研究院) UC San Diego(加州大学圣迭戈分校)

AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29063 2026-09-01 cs.AI 新提交

Agent2UCB: Agentic System for Generative Engine Optimization

Agent2UCB:用于生成式引擎优化的智能系统

Sheldon Yu, Rui Wang, Tong Yu, Sungchul Kim, Doga Dogan, Junda Wu, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(奥多比研究院)

AI总结 该研究提出智能GEO系统Agent2UCB,通过评估9种策略并结合多臂老虎机策略优化内容,在GEO-Bench实验中实现可见性提升且保留SEO质量,还提供SEO评估与演示功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28784 2026-09-01 cs.CV 新提交

ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement

ClearText-Video:连接视频修复与场景文本增强的大规模以文本为中心的视频数据集

Jinlong Li, Jiaming Ding, Dingfu Lu, Malcolm Hsiu, Chuang Ke, Kangning Yang, Bochen Guan, Lan Fu, Jie Cai, Huiming Sun, Zibo Meng

机构 * OPPO US AI Center(OPPO美国人工智能中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 研究团队推出ClearText-Video数据集,评估发现视觉增强未必提升文本推理,仅OCR管道远逊于多模态推理,为相关系统提供基础。

Comments This paper is accepted by 2026 Proceedings of the European Conference on Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29789 2026-09-01 math.OC cs.LG cs.SY eess.SY 新提交

A Unified Perspective on Conformal Prediction and Wasserstein Distributionally Robust Optimization for Uncertainty Quantification

不确定性量化的共形预测与Wasserstein分布鲁棒优化的统一视角

Kehan Long, Yiqi Zhao, Pol Mestres, Lars Lindemann, Nikolay Atanasov, Jorge Cortés

机构 * Contextual Robotics Institute, University of California San Diego(加州大学圣迭戈分校语境机器人研究所) University of Southern California(南加州大学) California Institute of Technology(加州理工学院) ETH Zürich(苏黎世联邦理工学院)

AI总结 该研究建立了共形预测与Wasserstein分布鲁棒优化的统一概率视角,分析了两者校正经验分位数的不同方式、构造差异及尾部表现,指出DRO可避免CP的过冲问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27339 2026-09-01 cs.LG cs.CL cs.IT math.IT 版本更新

Beyond Parallel Blindness: Information Floors and Model Gaps in Block Drafting

超越并行盲性:块式生成中的信息下限与模型差距

Xinwei Qiang, Xiang Fang, Chang Chen, Yue Guan, Yufei Ding

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 该研究针对块式生成的拒绝率,提出信息下限与模型差距的分离方法,在多领域目标上揭示了模型性能瓶颈,明确了短距离条件作用与生成质量的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24721 2026-09-01 cs.LG cs.AI 版本更新

Enhancing Bayesian Optimization and Active Learning Through Kernel Diversity

通过核多样性增强贝叶斯优化与主动学习

Heng Zhang, Haotian Xiang, Konstantinos D. Polyzos, Tara Javidi, Qin Lu

机构 * University of Georgia(佐治亚大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本文提出KENDO框架,将集成高斯过程与分歧感知获取策略结合,实例化KENDO-BO和KENDO-AL,在单/多目标优化及主动学习任务上,兼具更优性能与更高计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-09-01 cs.LG q-bio.GN 版本更新

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-09-01 cs.CL cs.CV 版本更新

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00685 2026-09-01 cs.AI 版本更新

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

HumanStudy-Bench: 向参与者模拟的AI代理设计迈进

Xuan Liu, Haoyang Shang, Zizhang Liu, Xinyan Liu, Yunze Xiao, Yiwen Tu, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22707 2026-09-01 cs.IR cs.AI 版本更新

CoFiRec: Coarse-to-Fine Tokenization for Generative Recommendation

CoFiRec: 生成推荐中的粗到细分词

Tianxin Wei, Xuying Ning, Xuxing Chen, Ruizhong Qiu, Yupeng Hou, Yan Xie, Shuang Yang, Zhigang Hua, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta University of California San Diego(加州大学圣地亚哥分校)

AI总结 CoFiRec通过粗到细分词提升生成推荐效果,有效捕捉用户意图演变。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27719 2026-08-31 cs.LG q-bio.NC 新提交

Leveraging a Foundation Model for the EEG-Based Diagnosis of Alzheimer's Disease

利用基础模型实现基于脑电图的阿尔茨海默病诊断

Maggie Lin, Chung-Lin Hou, Tzyy-Ping Jung

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) HippoScreen Neurotech Corp.(HippoScreen神经科技公司) Swartz Center for Computational Neuroscience(Swartz计算神经科学中心)

AI总结 本研究针对阿尔茨海默病诊断挑战,采用预训练于2500小时脑电图的大型脑模型LaBraM,结合随机森林分类器,仅用8秒脑电片段即达89.36%的ROC-AUC,优于传统方法,可提取临床相关生物标志物。

Comments 7 pages, 9 figures, 1 table. Accepted and presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27384 2026-08-28 cs.RO 新提交

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLA:用于快速异步VLA推理的流式动作解码

Zekai Li, Jiaming Tang, Zhijian Liu

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院)

AI总结 FlashVLA是一种流式动作解码框架,通过分块因果注意力维护动作缓冲,实现低延迟、平稳异步的VLA推理,在单GPU上达≥30Hz控制频率且任务性能优异。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26671 2026-08-28 cs.CV 新提交

RECAP-Forcing: Retaining Content Appearances for Long Video Generation

RECAP-Forcing:保留内容外观以实现长视频生成

Haiyang Xu, Zheng Ding, Zhuowen Tu

机构 * UC San Diego(加州大学圣迭戈分校)

AI总结 针对长自回归视频生成的内存挑战,提出按外观新颖性组织内存的RECAP-Forcing方法,通过注意力汇和光流新颖性库统一机制,免训练且无额外参数,提升视频质量与语义保真度,优于现有内存方法。

Comments Project page: https://xxuhaiyang.github.io/RECAP-Forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏