arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

2026-09-01 至 2026-09-01 共收录 12
2608.31111 2026-09-01 cs.CL 新提交

Aspire: Can Models Self-Evolve from Vague Goals?

ASPIRE:模型能否从模糊目标中实现自我进化?

Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang, Shen Yan, Wenhao Huang, Ge Zhang

机构 * ByteDance Seed(字节跳动 Seed) Singapore University of Technology and Design(新加坡科技设计大学) M-A-P

AI总结 本文提出ASPIRE基准,探究模型能否从模糊目标实现自我进化,实验发现当前智能体虽能完成基础循环,但权重提升不稳定,最强进化harness仍低于Qwen-Agent基准。

Comments https://self-developing-agents.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31100 2026-09-01 cs.CL 新提交

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

S3Gym:大型语言模型能否将自我测试与自我判断转化为自我提升?

Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang

机构 * ByteDance Seed(字节跳动Seed) M-A-P

AI总结 本研究推出交互式基准S³Gym,评估LLM通过自我测试、自我判断、自我提升能力实现的自我提升,发现其效果依赖任务结构,参数训练等途径各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28771 2026-09-01 cs.LG 新提交

ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

ERR+: 用于高效且果断的LLM推理的顺序熵分辨率

Xin Jiang, Minhao Wang, Wen Wu, Zhentao Xie, Shangheng Du, Jinxin Shi, Jiabao Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ByteDance(字节跳动)

AI总结 该研究针对RLVR方法对推理过程质量指导不足的问题,提出两阶段RLVR框架ERR+,通过顺序优化熵缓解奖励与稳健相对效率奖励,在五个数据集上实现了LLM推理准确率与简洁性的提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28698 2026-09-01 cs.CV 新提交

State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models

面向文档视觉语言模型中细粒度感知的状态条件视觉证据检索

Mingxu Chai, Chenyu Liu, Ziyu Shen, Jiazheng Zhang, Kaidi Zhang, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ByteDance, LarkAI(字节跳动 LarkAI) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室)

AI总结 针对现有VLM文档解析方法效率低的问题,提出SCVER方法,通过状态条件检索高分辨率区域,结合SGLO稳定训练,提升了低输入分辨率下的鲁棒性与准确率-效率权衡。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26849 2026-09-01 cs.AI cs.CY cs.MA 版本更新

LiveSim: Simulating Environment-Shaped Users in Multi-Agent Live-Stream Ecosystems

LiveSim:在多智能体直播生态系统中模拟环境塑造的用户

Jiaqi Xu, Yiran Qiao, Jing Chen, Qiwei Zhong, Xiang Ao, Xueqi Cheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance China(字节跳动中国)

AI总结 该研究提出基于LLM的LiveSim框架,通过环境塑造的动态用户行为模拟,在真实直播风控数据实验中验证其可提升用户级行为保真度并支持生态系统级分析。

Comments 20 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23124 2026-09-01 cs.CL cs.AI 版本更新

LITERARYBIGFIVE: Author-Personalized Text Generation in a Unified Interpretable Space

LITERARYBIGFIVE:统一可解释空间中的作者个性化文本生成

Jinghui Zhang, Lang Gao, Ao Li, Mingzhe Li, Ruihong Zeng, Zirui Song, Kentaro Inui, Xiuying Chen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shandong University(山东大学) ByteDance(字节跳动) Tohoku University(东北大学) RIKEN(理化学研究所)

AI总结 针对现有作者个性化文本生成方法成本高、难解释、泛化差的问题,提出LiteraryBigFive框架,将作者写作特征映射到统一可解释空间,结合可解释引导机制实现个性化生成,提升表达力且符合文学共识。

Comments EMNLP 2026 Findings, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-09-01 cs.MM cs.AI cs.CV cs.GR 版本更新

When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Haoyu Wang, Yangchen Zeng, Jiaqi Zhang, Li Jiuxing, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin, Alexander Lim Han Yang, Yusen Wu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) ByteDance(字节跳动) Nankai University(南开大学) JD Research, JD.com, Inc.(京东研究院(京东有限公司)) Zhejiang University(浙江大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) The University of Hong Kong(香港大学)

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11327 2026-09-01 cs.LG cs.AI 版本更新

PRISM Edit: One Vector for All Temporal Answers

PRISM Edit:适用于所有时间答案的单一向量

Chen Huang, Qi Zheng, Ruiqin Zheng, Long Zeng, Yuantong Xu

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 研究针对大语言模型时间事实更新问题,基于因果追踪发现其内部计算支持新旧答案区分,进而引入PRISM Edit,通过优化单一多义词表示及利用固有调制路径,在新基准上评估,相比基线提升了时间一致性等指标且速度更快。

Comments Chen Huang and Qi Zheng contributed equally. Corresponding authors: Long Zeng, Yuantong Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00994 2026-09-01 cs.AI 版本更新

Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

推理与工具使用在智能体强化学习中的竞争:从量化干扰到解耦调优

Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Bytedance Inc.(字节跳动公司)

AI总结 本文通过引入能力效应归因(CEA)量化推理与工具使用行为之间的干扰,并提出解耦动作-推理调优(DART)框架,通过分离参数更新来提升智能体强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16861 2026-09-01 cs.CV cs.AI 版本更新

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

前缀自适应块扩散用于高效的文档识别

Mingxu Chai, Ziyu Shen, Chenyu Liu, Jihua Kang, Tao Gui, Qi Zhang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University, Shanghai, China(复旦大学计算与人工智能创新学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ByteDance, Shanghai, China(字节跳动,上海,中国)

AI总结 本文提出前缀自适应块扩散模型(PA-BDM),通过改进块内去噪和缓存机制,提升文档识别的效率和准确性。

Comments 16pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19305 2026-09-01 cs.RO cs.AI cs.CV 版本更新

PhyGile: Physics-Prefix Guided Motion Generation for Agile General Humanoid Motion Tracking

PhyGile: 面向敏捷通用人形运动跟踪的物理前缀引导运动生成

Jiacheng Bao, Haoran Yang, Yucheng Xin, Junhong Liu, Yuecheng Xu, Han Liang, Pengfei Han, Xiaoguang Ma, Dong Wang, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) ByteDance(字节跳动) Northeastern University(东北大学)

AI总结 提出PhyGile框架,通过物理前缀引导的机器人原生运动生成,结合课程混合专家训练和后训练,解决文本生成运动在机器人上物理不可行的问题,实现敏捷全身运动跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏