arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-03-24 至 2026-03-24 共收录 8
2603.22283 2026-03-24 cs.CV cs.AI cs.GR cs.LG

End-to-End Training for Unified Tokenization and Latent Denoising

端到端训练用于统一的标记化和潜在去噪

Shivam Duggal, Xingjian Bai, Zongze Wu, Richard Zhang, Eli Shechtman, Antonio Torralba, Phillip Isola, William T. Freeman

机构 * Massachusetts Institute of Technology(麻省理工学院) Adobe(Adobe公司)

AI总结 本文提出UNITE模型,通过端到端训练实现统一的标记化和潜在扩散,无需对抗损失或预训练编码器,在图像和分子领域达到接近SOTA的性能。

Comments First two authors contributed equally. Project: https://xingjianbai.com/unite-tokenization-generation/ Code: https://github.com/ShivamDuggal4/UNITE-tokenization-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22125 2026-03-24 cs.CV

DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

DA-VAE:通过细节对齐实现扩散模型的插件式潜在压缩

Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出DA-VAE,通过轻量级调整预训练扩散模型,实现潜在空间压缩,使1024×1024图像生成使用32×32 tokens,比原模型减少40%,并支持2048×2048生成,保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18173 2026-03-24 cs.CL

Moneyball with LLMs: Analyzing Tabular Summarization in Sports Narratives

Moneyball with LLMs: 分析体育叙事中的表格摘要

Ritam Upadhyay, Naman Ahuja, Rishabh Baral, Aparna Garimella, Vivek Gupta

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) Adobe Research, India(印度Adobe研究)

AI总结 本文通过SPORTABSET基准测试,分析长上下文表格摘要中多实体记忆的瓶颈,揭示分解策略在多实体干扰下的表现及模型鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03744 2026-03-24 cs.CV

DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation

DAGE:用于高效和细粒度几何估计的双流架构

Tuan Duc Ngo, Jiahui Huang, Seoung Wug Oh, Kevin Blackburn-Matzen, Evangelos Kalogerakis, Chuang Gan, Joon-Young Lee

机构 * UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究) TU Crete(希腊技术大学)

AI总结 DAGE提出双流变压器架构,通过分离全局一致性与细节,实现高效且细粒度的几何估计与相机姿态估计,支持高分辨率和长序列输入。

Comments CVPR 2026. Project page: https://ngoductuanlhp.github.io/dage-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06476 2026-03-24 cs.CL

Knowing What's Missing: Assessing Information Sufficiency in Question Answering

知晓缺失:在问答中评估信息充分性

Akriti Jain, Aparna Garimella

机构 * Adobe Research(Adobe研究院)

AI总结 本文提出了一种结构化框架,通过识别和验证缺失信息来提高问答系统中信息充分性的评估准确性。

Comments Accepted to EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13001 2026-03-24 cs.LG cs.AI

Better Generative Replay for Continual Federated Learning

更高效的生成性重放用于持续联邦学习

Daiqing Qi, Handong Zhao, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Adobe Research(Adobe研究)

AI总结 本文提出FedCIL模型,通过模型整合和一致性约束解决持续联邦学习中非IID数据导致的训练不稳定问题,实验显示其在多个数据集上优于基线方法。

Journal ref ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20470 2026-03-24 cs.AI

DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成

Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, Jun Liu

机构 * Lancaster University(兰卡斯特大学) University of Bristol(布里斯托大学) Adobe Research(Adobe研究院)

AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。

Comments CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏