arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 549
2608.15705 2026-08-18 cs.CV 新提交

PixelControl: Fine-Grained Condition Fidelity in Text-to-Image Diffusion

PixelControl:文本到图像扩散中的细粒度条件保真度

Xin Lin, Haodong Li, Zhifei Zhang, Yutong Yang, Haitian Zheng, Juanxi Tian, Zhe Lin, Truong Nguyen

机构 * Adobe Research(奥多比研究院) Nanyang Technological University(南洋理工大学) University of California San Diego(加州大学圣迭戈分校)

AI总结 针对可控文本到图像扩散模型细粒度结构保真度不足的问题,提出PixelControl框架,通过结构感知控制注入与多尺度金字塔循环损失等设计,提升了边界及中/小区域的结构保真度。

Comments The project homepage can be found: https://linxin0.github.io/pixelcontrol_homepage/pixelcontrol-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14881 2026-08-18 cs.AI cs.CL 新提交

Personalized Auto-Research: Towards a True AI Co-Scientist

个性化自动研究:迈向真正的AI合作科学家

Bo Ni, Franck Dernoncourt, Hongjie Chen, Yu Wang, Nesreen K. Ahmed, Zhengzhong Tu, Tyler Derr, Ryan A. Rossi

机构 * Vanderbilt University(范德堡大学) Adobe Research(奥多比研究院) Dolby Laboratories(杜比实验室) University of Georgia(佐治亚大学) Cisco AI Research(思科人工智能研究院) Texas A&M University(德克萨斯农工大学)

AI总结 针对现有AI合作科学家忽略个体研究者的问题,提出个性化自动研究框架,通过图基研究者表示、全流程个性化及个体评估,解决一刀切模式的隐性知识缺失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21219 2026-08-18 cs.CL cs.AI 版本更新

Reasoning-Based Personalized Generation for Users with Sparse Data

基于推理的稀疏数据用户个性化生成

Bo Ni, Branislav Kveton, Samyadeep Basu, Subhojyoti Mukherjee, Leyao Wang, Franck Dernoncourt, Sungchul Kim, Seunghyun Yoon, Zichao Wang, Ruiyi Zhang, Puneet Mathur, Jihyung Kil, Jiuxiang Gu, Nedim Lipka, Yu Wang, Ryan A. Rossi, Tyler Derr

机构 * Vanderbilt University(范德比尔特大学) Adobe Research(Adobe研究) Yale University(耶鲁大学) University of Oregon(俄勒冈大学)

AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-08-17 cs.IR cs.AI cs.LG 版本更新

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Yuchen Zhuang, Wenqi Shi, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15158 2026-08-17 cs.CV 版本更新

RefGC-SR$^2$: Reference-guided Super-Resolution and Refinement of AI Generated Content

RefGC-SR$^2$: 参考引导的生成内容超分辨率与精炼

Jeahun Sung, Dahyeon Kye, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) Adobe Research(Adobe 研究院)

AI总结 针对生成管道中参考图像下采样导致细节丢失和伪影问题,提出RefGC-SR$^2$任务,利用原始高分辨率参考图像同时恢复细节、精炼伪影并提升分辨率,构建首个真实三元组数据生成管道并设计频率感知扩散Transformer模型。

Comments The first two authors contributed equally to this work. The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/RefGC-SR2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13205 2026-08-14 cs.CV 新提交

HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Xuanlang Dai, Shengyuan Ding, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Dahua Lin, Xingang Pan

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(奥多比研究院) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(InnoHK下属CPII机构)

AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。

Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12442 2026-08-14 cs.CV 新提交

MV2: Multi-View Multi-Vehicle Driving Dataset for Novel View Synthesis

MV2:用于新视角合成的多视角多车辆驾驶数据集

Sanjay Bhargav Dharavath, Hanvitha Saraswathi Mukkamala, Faizan Farooq Khan, Ioannis Kakogeorgiou, Aditya Arun, C V Jawahar, Zakaria Laskar

机构 * International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) IIT, National Centre for Scientific Research “Demokritos”(德谟克利特国家科学研究中心 IIT) Adobe MDSR, India(奥多比印度MDSR部门) Indian Institute of Science Education and Research, Thiruvananthapuram(特里凡得琅印度科学教育与研究学院)

AI总结 针对驾驶场景新视角合成的难题,提出含50个场景12000张图像的MV2多车辆数据集,经严格配准验证,基准测试显示视角差异增大NVS性能下降,前馈位姿估计器弱于优化方法。

Comments 18 pages, 7 figures, ECCV accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01134 2026-08-14 cs.GR cs.CV 版本更新

RealMat: Realistic Materials with Diffusion and Reinforcement Learning

RealMat:结合扩散模型与强化学习的真实材质生成器

Xilong Zhou, Pedro Figueiredo, Miloš Hašan, Valentin Deschaintre, Paul Guerrero, Yiwei Hu, Nima Khademi Kalantari

机构 * Max Planck Institute for Informatics Saarbrücken Germany Texas A\&M University College Station USA Adobe Research San Jose USA Adobe Research London UK Max Planck Institute for Informatics Texas A\&M University Adobe Research

AI总结 针对材质生成的合成数据真实感不足、真实数据规模有限的问题,提出结合SDXL微调与强化学习的RealMat,有效提升了生成材质的真实性。

Comments 12 pages, 12 figures

Journal ref Computer Graphics Forum 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10928 2026-08-12 cs.AI 新提交

ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling

ThinkRetrieve:用于测试时缩放的检索增强推理轨迹

Vaibhav Singh, Soumya Suvra Ghosal, Sarvesh Gharat, Soumyabrata Pal, Ramasuri Narayanam, Dinesh Manocha

机构 * IIT Bombay(印度理工学院孟买分校) University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(奥多比研究院)

AI总结 针对大型推理模型测试时缩放的负面效果,提出ThinkRetrieve框架,通过每步动态检索已解决示例注入推理轨迹,在四个数据集上对五个模型实现最高60%的相对准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10091 2026-08-12 cs.CV 新提交

Signpost Watermarking: Joint Optimization for Visual Watermark Coexistence

路标水印:面向视觉水印共存的联合优化

Shruti Agarwal, Vishal Asnani, John Collomosse

机构 * Adobe Research(奥多比研究院) University of Surrey(萨里大学)

AI总结 该研究提出路标水印的联合优化方法,使视觉水印可与其他水印共存,提升解码鲁棒性,支持内容真实性与版权的分层溯源信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09926 2026-08-11 cs.CV 新提交

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

学习世界如何演化:基于潜动态推理的外推视频世界模型

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker

机构 * UCSD(加利福尼亚大学圣迭戈分校) Adobe(奥多比公司)

AI总结 针对主流视频扩散模型未建模像素时间转换的问题,提出LDR方法,在PhyWorld基准上实现更优动态外推,参数更少、速度更快,是首个能泛化至训练分布外的视频世界模型

Comments Project page: https://lat-dyn-reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08389 2026-08-11 cs.AI cs.IR cs.MA 新提交

Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents

不值得再增加一个Token:面向高效深度研究智能体的边际价值估计

Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(奥多比研究院)

AI总结 该研究针对长周期研究智能体的上下文冗余问题,系统比较不同阶段的剪枝策略,发现早期剪枝可大幅降本,轻量级启发式方法能减73%Token用量且质量损失小,为高效智能体设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08119 2026-08-11 cs.LG 新提交

TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity

TSDS-Toolbox:用于测量时间序列数据集相似度的工具箱

Yen-Ku Liu, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Dolby Laboratories(杜比实验室) Adobe Research(奥多比研究院)

AI总结 该研究针对现有时间序列数据集相似度基准实现零散难扩展的问题,提出TSDS-Toolbox工具箱,支持系统比较、灵活扩展与一致评估,经实验验证有效且公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06751 2026-08-10 cs.CV cs.AI 新提交

Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation

超越《星夜》:面向艺术家基础的文本到图像生成的捷径感知控制状态规划

Kuan Xing, Ye Wang, Changyi Gan, Yuheng Li, Thao Nguyen, Yi Chang, Yilin Wang

机构 * Jilin University(吉林大学) Adobe(奥多比公司) University of Wisconsin(威斯康星大学)

AI总结 该研究针对艺术家基础的文本到图像生成存在的捷径偏差问题,提出 Atelier 框架,结合 ArtIntentBench 基准测试,提升了风格保真度与结构保留度,减少了捷径替换。

Comments 47 pages, 13 figures, including appendices. Kuan Xing and Ye Wang contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04424 2026-08-06 cs.CV 新提交

Thinking with Anchors: Grounded and Efficient Document Reasoning

基于锚点思考:接地且高效的文档推理

Sichen Zhu, Yuchen Zhu, Wenzhuo Xu, Jason Kuen, Wanrong Zhu, Jing Shi, Xuan Shen, Quanyi Wang, Yiwei Wang, Yujun Cai, Bing Shuai, Qin Zhang, Yongxin Chen, Shilong Liu, Molei Tao, Jiuxiang Gu

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学) Adobe(奥多比公司) ZJU(浙江大学) NUIST(南京信息工程大学) SEU(东南大学) Physion Labs(Physion实验室) Columbia University(哥伦比亚大学)

AI总结 该研究提出面向推理的ADOPD 2026数据集,将多类文档元素转化为视觉锚点,支持区域语义标注、统一视觉-语言接地等能力,解决现有模型在文档计数任务上的不足,推动文档理解向锚点接地的智能方向发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02907 2026-08-05 cs.LG 新提交

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02604 2026-08-05 cs.AI cs.IR 新提交

ISEE: Interactive Semantic Enrichment for Database Fields

ISEE:数据库字段的交互式语义丰富

Yuan Tian, Yiru Chen, Rakesh R. Menon, Zifan Liu, Ting Cai, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sridevi Aishwariya Ganesan, Kun Qian, Yunyao Li

机构 * Purdue University(普渡大学) Adobe(奥多比公司)

AI总结 该研究提出ISEE系统,通过评分、收集领域知识并与用户协作丰富数据库字段语义,可降低认知负荷、提升描述质量并增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27670 2026-08-05 cs.CV cs.AI 版本更新

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

JigShape:通过拼图任务评估视觉语言模型的视觉几何推理能力

Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao

机构 * University of Southern California(南加州大学) National University of Singapore(新加坡国立大学) Adobe Research(奥多比研究院) Texas A&M University(德克萨斯农工大学) Rice University(莱斯大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本研究提出JigShape拼图基准,发现零样本VLM大多缺乏几何推理能力,所有模型在大尺寸拼图上均出现性能崩塌,将可扩展几何推理确立为VLM的开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01774 2026-08-05 cs.LG cs.AI 版本更新

FLARE: Diffusion for Hybrid Language Model

FLARE: 混合语言模型的扩散方法

Yuchen Zhu, Jing Shi, Chongjian Ge, Hao Tan, Yiran Xu, Wanrong Zhu, Jason Kuen, Koustava Goswami, Rajiv Jain, Yongxin Chen, Molei Tao, Jiuxiang Gu

机构 * Adobe Research(Adobe研究院) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出FLARE框架,通过结合自回归和扩散目标、硬件感知内核和统一推理,将混合注意力LLM转换为支持并行解码的扩散模型,在保持能力的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09112 2026-08-04 cs.CV 版本更新

GimbalDiffusion: Gravity-Aware Camera Control for Video Generation

GimbalDiffusion:基于重力的摄像机控制用于视频生成

Frédéric Fortier-Chouinard, Yannick Hold-Geoffroy, Valentin Deschaintre, Matheus Gadelha, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Adobe

AI总结 本文提出GimbalDiffusion框架,通过物理坐标系实现摄像机运动的精确控制,引入null-pitch conditioning策略以避免冲突提示内容干扰,并建立新基准评估重力感知摄像机控制视频生成能力。

Comments Accepted at ECCV 2026. Project page: https://lvsn.github.io/GimbalDiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29378 2026-08-03 cs.CL cs.LG 新提交

PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction

PTP:基于前序令牌预测的大语言模型反演方法,用于近精确提示重构

Pirzada Suhail, Nagasai Saketh Naidu, Atanu R Sinha, Amit Sethi

机构 * IIT Bombay(印度理工学院孟买分校) Adobe Research(奥多比研究中心)

AI总结 提出PTP方法,在黑盒场景下从零训练逆语言模型,通过前序令牌预测实现近精确提示重构,泛化性与迁移性良好,性能优于现有LLM反演工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23802 2026-08-03 cs.AI 版本更新

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19350 2026-08-03 cs.GR cs.LG 版本更新

CompoSE: Compositional Synthesis and Editing of 3D Shapes via Part-Aware Control

CompoSE:通过部分感知控制进行3D形状的组合合成与编辑

Habib Slim, Shariq Farooq Bhat, Mohamed Elhoseiny, Yifan Wang, Mike Roberts

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Adobe Research(Adobe研究)

AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27660 2026-07-31 cs.LG cs.AI cs.CV 新提交

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective

基于表示学习的子模信息测度目标:方差与分离视角的理解

Rishabh Iyer, Truong Pham, Anay Majee

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe(奥多比公司)

AI总结 本研究构建统一理论框架揭示子模信息测度(SIMs)的几何与统计特性,通过控制合成实验验证,为选择设计基于SIMs的表示学习目标提供原则性指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26637 2026-07-30 cs.CL cs.AI 新提交

Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

面向LLM智能体的基于文件系统的内存:组织、演化与可持续性

Sizhe Zhou, Sheldon Yu, Hui Wei, Junda Wu, Siru Ouyang, Yizhu Jiao, Shijia Pan, Julian McAuley, Yu Zhang, Tong Yu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Merced(加利福尼亚大学默塞德分校) Adobe Research(奥多比研究院) Texas A&M University(德克萨斯农工大学)

AI总结 本研究首次系统探索面向LLM智能体的基于文件系统的内存,定义三个智能体角色开展实验,发现有组织存储可减半检索成本,但多数智能体组织会退化,工具集对存储形态的影响与更换模型相当,将文件系统设为智能体内存的设计空间。

Comments 59 pages, 12 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10761 2026-07-30 cs.CV

EditDuet: A Multi-Agent System for Video Non-Linear Editing

Marcelo Sandoval-Castaneda, Bryan Russell, Josef Sivic, Gregory Shakhnarovich, Fabian Caba Heilbron

机构 * Adobe Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University(捷克信息学、机器人学与自动化技术研究所,捷克技术大学)

Comments SIGGRAPH 2025

Journal ref SIGGRAPH Conference Papers '25, Article 2, 1-11, ACM, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26037 2026-07-29 cs.CV cs.GR 新提交

Wonder: Video World Model Done Better

Wonder:改进的视频世界模型

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei

机构 * Adobe Research(Adobe研究院) Johns Hopkins University(约翰·霍普金斯大学)

AI总结 Wonder是用于实时相机可控世界探索的通用视频世界模型,通过系统级协同设计,包括新型相机条件设定、高效内存机制等,能合成多样视频,支持视频条件生成,保持长时间的连贯视觉效果。

Comments Project Page: https://wonder-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏