arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

2026-07-15 至 2026-07-15 共收录 3
2607.12800 2026-07-15 cs.CV 新提交

UniVR: Thinking in Visual Space for Unified Visual Reasoning

UniVR:用于统一视觉推理的视觉空间思考

Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动)

AI总结 UniVR旨在从纯视觉演示中同时学习复杂推理、物理动力学和长期规划,核心是VR-GRPO强化学习范式。构建VR-X基准进行训练和评估,在VR-X上有25%的提升,还提高了多模态理解基准性能,相关资源已开源。

Comments Code and models are released at: https://maverickren.github.io/UniVR.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11327 2026-07-15 cs.LG cs.AI 版本更新

PRISM Edit: One Vector for All Temporal Answers

PRISM Edit:适用于所有时间答案的单一向量

Chen Huang, Qi Zheng, Ruiqin Zheng, Long Zeng, Yuantong Xu

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 研究针对大语言模型时间事实更新问题,基于因果追踪发现其内部计算支持新旧答案区分,进而引入PRISM Edit,通过优化单一多义词表示及利用固有调制路径,在新基准上评估,相比基线提升了时间一致性等指标且速度更快。

Comments Chen Huang and Qi Zheng contributed equally. Corresponding authors: Long Zeng, Yuantong Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19632 2026-07-15 cs.CV 版本更新

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

CreatiParser: 从位图图形设计生成可编辑的图层

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ByteDance Intelligent Creation(字节跳动智能创作) School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏