arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ByteDance(字节跳动)

共收录 1106
2609.04096 2026-09-04 cs.RO cs.AI cs.CV 新提交

Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

基于可组合基础先验与通用抓取合成的自适应视觉-语言抓取

Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan, Fan Huang, Haoxuan Li, Yongkang Li, Yuhan Li, Bencheng Liao, Zeyu Zhang, Wenyu Liu, Hangxin Liu, Xinggang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) KEENON Robotics Co., Ltd.(科语机器人有限公司) Suzhou Silicon Era Intelligent Technology Co., Ltd.(苏州硅时代智能科技有限公司) College of Materials, Xiamen University(厦门大学材料学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ByteDance(字节跳动) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室) Hubei Automation Institute(湖北省自动化研究所)

AI总结 本文提出AdaRoboVLG框架,通过解耦物理抓取合成与任务依赖理解,结合可组合基础先验实现自适应通用抓取,在仿真与真实实验中展现出高效学习、跨机械臂泛化及应对复杂环境的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02529 2026-09-03 cs.CV cs.AI 新提交

Fine-Grained Anomaly Perception in Wild UGC-Enhanced Images: A Comprehensive Dataset and Difference-Fusion Framework

野生UGC增强图像中的细粒度异常感知:综合数据集与差异融合框架

Yan Zhong, Gefei Chen, Qiufang Ma, Zhen Wang, Zhiwei Fan, Lei Shi, Tingting Jiang

机构 * ByteDance(字节跳动)

AI总结 本文针对野生UGC增强图像的异常感知问题,定义了UEAP任务,构建了UEAP-4k数据集,提出DFAP-UGC方法及LADTP训练策略,实验表明其性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02253 2026-09-03 cs.AI cs.CL 新提交

APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering

APEx:用于自适应深度研究问答的智能体程序经验蒸馏

Jie Ding, Rui Sun, Xinyuan Zhang, Zeyu Zhang, Xin Liu

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance Inc.(字节跳动公司) Chinese Academy of Sciences(中国科学院)

AI总结 APEx是分层经验利用框架,通过三阶段交替GRPO训练优化Executor、Distiller、Planner模块,经7个基准测试性能超GPT-5.4和最强记忆增强基线,实现自适应深度研究问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19686 2026-09-03 cs.CL cs.LG 版本更新

Multi-Mask Diffusion Language Models for Few-Step Generation

用于少步生成的多掩码扩散语言模型

Sijin Chen, Yinuo Ren, Heyang Zhao, Ziheng Cheng, Quanquan Gu, Lexing Ying

机构 * ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校)

AI总结 研究针对掩码扩散模型少步生成难的问题,提出多掩码扩散模型MultiMDM,通过特定前向过程使反向过程有起草能力,推导训练目标并制定蒸馏方案,经实验验证其为少步生成提供了有效基础。

Comments 38 pages; Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00448 2026-09-03 cs.CV 版本更新

MMTryon: Multi-Modal Multi-Reference Control for High-Quality Fashion Generation

MMTryon:用于高质量时尚生成的多模态多参考试穿控制

Xujie Zhang, Ente Lin, Michael Kampffmeyer, Zhenyu Xie, Jiang Li, Ting Liu, Xiaochao Qu, Luoqi Liu, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Bytedance(字节跳动) UiT The Arctic University of Norway(挪威北极大学)

AI总结 MMTryon是一种多模态多参考虚拟试穿框架,通过多模态多参考注意力机制和无需分割的设计,解决现有虚拟试穿方法的多单品支持、风格定制及分割依赖问题,性能优于SOTA方法,为时尚领域研究开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01343 2026-09-02 cs.LG 新提交

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

SMELT:计算匹配型MoE循环Transformer的缩放定律

Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu, Jiaheng Liu, Wenhao Huang, Shen Yan, Jian Li

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动Seed) M-A-P

AI总结 该研究在严格匹配关键预算指标的前提下,提出SMELT方案,通过循环MoE Transformer中间层,提升了模型性能并节省了训练FLOPs,为Transformer架构优化提供了实用方案。

Comments 35 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01240 2026-09-02 cs.IR cs.AI cs.LG 新提交

From Language to Behavior: Scaling Sequence Transformers for Industrial Recommendation Ranking with Rec-Native Designs

从语言到行为:采用推荐原生设计的工业推荐排序序列Transformer缩放

Jie Chen, Xiangqian Yu, Yanchao Lian, Tan Lu, Run Yang, Zhengchun Shang, Xing Wang, Cheng Chen, Ke Hu, Qiang Li, Tianjiu Yin, Xiaobing Liu

机构 * ByteDance(字节跳动)

AI总结 本研究针对工业推荐排序中行为序列建模的挑战,提出推荐原生Transformer框架ReST,通过双门控注意力等设计优化信号质量,分解排序结构解决计算不对称性,经测试提升广告平台AUC与核心收入指标并已部署生产。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31111 2026-09-01 cs.CL 新提交

Aspire: Can Models Self-Evolve from Vague Goals?

ASPIRE:模型能否从模糊目标中实现自我进化?

Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang, Shen Yan, Wenhao Huang, Ge Zhang

机构 * ByteDance Seed(字节跳动 Seed) Singapore University of Technology and Design(新加坡科技设计大学) M-A-P

AI总结 本文提出ASPIRE基准,探究模型能否从模糊目标实现自我进化,实验发现当前智能体虽能完成基础循环,但权重提升不稳定,最强进化harness仍低于Qwen-Agent基准。

Comments https://self-developing-agents.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31100 2026-09-01 cs.CL 新提交

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

S3Gym:大型语言模型能否将自我测试与自我判断转化为自我提升?

Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang, Zhoujun Li, Shen Yan, Wenhao Huang, Ge Zhang

机构 * ByteDance Seed(字节跳动Seed) M-A-P

AI总结 本研究推出交互式基准S³Gym,评估LLM通过自我测试、自我判断、自我提升能力实现的自我提升,发现其效果依赖任务结构,参数训练等途径各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30821 2026-09-01 cs.CV cs.AI 新提交

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Lucida:用于可组合真实到仿真场景建模的解析、生成与放置

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li

机构 * ByteDance Seed(字节跳动Seed) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 Lucida是一种可组合真实到仿真场景建模方法,通过重新分配流程要求,在三个步骤中利用真实采集的可靠信息,结合GizmoAct策略提升了场景建模相关任务的性能。

Comments Project Page: https://lucida-r2s.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28771 2026-09-01 cs.LG 新提交

ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning

ERR+: 用于高效且果断的LLM推理的顺序熵分辨率

Xin Jiang, Minhao Wang, Wen Wu, Zhentao Xie, Shangheng Du, Jinxin Shi, Jiabao Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) ByteDance(字节跳动)

AI总结 该研究针对RLVR方法对推理过程质量指导不足的问题,提出两阶段RLVR框架ERR+,通过顺序优化熵缓解奖励与稳健相对效率奖励,在五个数据集上实现了LLM推理准确率与简洁性的提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28698 2026-09-01 cs.CV 新提交

State-Conditioned Visual Evidence Retrieval for Fine-Grained Perception in Document Vision-Language Models

面向文档视觉语言模型中细粒度感知的状态条件视觉证据检索

Mingxu Chai, Chenyu Liu, Ziyu Shen, Jiazheng Zhang, Kaidi Zhang, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ByteDance, LarkAI(字节跳动 LarkAI) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室)

AI总结 针对现有VLM文档解析方法效率低的问题,提出SCVER方法,通过状态条件检索高分辨率区域,结合SGLO稳定训练,提升了低输入分辨率下的鲁棒性与准确率-效率权衡。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26849 2026-09-01 cs.AI cs.CY cs.MA 版本更新

LiveSim: Simulating Environment-Shaped Users in Multi-Agent Live-Stream Ecosystems

LiveSim:在多智能体直播生态系统中模拟环境塑造的用户

Jiaqi Xu, Yiran Qiao, Jing Chen, Qiwei Zhong, Xiang Ao, Xueqi Cheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance China(字节跳动中国)

AI总结 该研究提出基于LLM的LiveSim框架,通过环境塑造的动态用户行为模拟,在真实直播风控数据实验中验证其可提升用户级行为保真度并支持生态系统级分析。

Comments 20 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23124 2026-09-01 cs.CL cs.AI 版本更新

LITERARYBIGFIVE: Author-Personalized Text Generation in a Unified Interpretable Space

LITERARYBIGFIVE:统一可解释空间中的作者个性化文本生成

Jinghui Zhang, Lang Gao, Ao Li, Mingzhe Li, Ruihong Zeng, Zirui Song, Kentaro Inui, Xiuying Chen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shandong University(山东大学) ByteDance(字节跳动) Tohoku University(东北大学) RIKEN(理化学研究所)

AI总结 针对现有作者个性化文本生成方法成本高、难解释、泛化差的问题,提出LiteraryBigFive框架,将作者写作特征映射到统一可解释空间,结合可解释引导机制实现个性化生成,提升表达力且符合文学共识。

Comments EMNLP 2026 Findings, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-09-01 cs.MM cs.AI cs.CV cs.GR 版本更新

When Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Haoyu Wang, Yangchen Zeng, Jiaqi Zhang, Li Jiuxing, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin, Alexander Lim Han Yang, Yusen Wu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) ByteDance(字节跳动) Nankai University(南开大学) JD Research, JD.com, Inc.(京东研究院(京东有限公司)) Zhejiang University(浙江大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) The University of Hong Kong(香港大学)

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11327 2026-09-01 cs.LG cs.AI 版本更新

PRISM Edit: One Vector for All Temporal Answers

PRISM Edit:适用于所有时间答案的单一向量

Chen Huang, Qi Zheng, Ruiqin Zheng, Long Zeng, Yuantong Xu

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 研究针对大语言模型时间事实更新问题,基于因果追踪发现其内部计算支持新旧答案区分,进而引入PRISM Edit,通过优化单一多义词表示及利用固有调制路径,在新基准上评估,相比基线提升了时间一致性等指标且速度更快。

Comments Chen Huang and Qi Zheng contributed equally. Corresponding authors: Long Zeng, Yuantong Xu

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00994 2026-09-01 cs.AI 版本更新

Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

推理与工具使用在智能体强化学习中的竞争:从量化干扰到解耦调优

Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Bytedance Inc.(字节跳动公司)

AI总结 本文通过引入能力效应归因(CEA)量化推理与工具使用行为之间的干扰,并提出解耦动作-推理调优(DART)框架,通过分离参数更新来提升智能体强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16861 2026-09-01 cs.CV cs.AI 版本更新

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

前缀自适应块扩散用于高效的文档识别

Mingxu Chai, Ziyu Shen, Chenyu Liu, Jihua Kang, Tao Gui, Qi Zhang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University, Shanghai, China(复旦大学计算与人工智能创新学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ByteDance, Shanghai, China(字节跳动,上海,中国)

AI总结 本文提出前缀自适应块扩散模型(PA-BDM),通过改进块内去噪和缓存机制,提升文档识别的效率和准确性。

Comments 16pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19305 2026-09-01 cs.RO cs.AI cs.CV 版本更新

PhyGile: Physics-Prefix Guided Motion Generation for Agile General Humanoid Motion Tracking

PhyGile: 面向敏捷通用人形运动跟踪的物理前缀引导运动生成

Jiacheng Bao, Haoran Yang, Yucheng Xin, Junhong Liu, Yuecheng Xu, Han Liang, Pengfei Han, Xiaoguang Ma, Dong Wang, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) ByteDance(字节跳动) Northeastern University(东北大学)

AI总结 提出PhyGile框架,通过物理前缀引导的机器人原生运动生成,结合课程混合专家训练和后训练,解决文本生成运动在机器人上物理不可行的问题,实现敏捷全身运动跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28065 2026-08-31 cs.AI 新提交

Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning

基于离线模型强化学习的激励式广告激励分配学习

Zilin Zhao, Han Yang, Tianpei Yang, Fangsheng Huang, Yanfei Cui, Kan Peng, Yi Li, Yiming Zong, Hao Zhang, Yinsong Xue

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance(字节跳动) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究针对激励式广告的序列激励分配问题,提出离线模型强化学习框架,实验显示MB-IQL可显著提升人均净利润,验证了该框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-08-31 cs.AI cs.HC 版本更新

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26794 2026-08-28 cs.CV 新提交

Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion

环强制法:面向自回归视频扩散模型的精准长期记忆

Bowen Xue, Brandon Y. Feng, Chenguo Lin, Yuchen Lin, Yujia Zeng, Lvmin Zhang, Maneesh Agrawala, Honglei Yan, Panwang Pan

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ByteDance(字节跳动)

AI总结 针对自回归视频扩散模型的长期记忆瓶颈,提出Ring Forcing框架,通过环形训练策略、压缩与时间步组合策略及稀疏RoPE机制,实现分钟级视频生成的优异连贯性与物体恒常性,性能优于现有方法。

Comments Project page: https://ringforcing.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26656 2026-08-28 cs.CV cs.AI 新提交

CoGeo-GS: Concept-Driven and Geometry-Aware Multi-Object Removal in 3D Scenes

CoGeo-GS:3D场景中基于概念驱动与几何感知的多物体移除方法

Yuanxiang Ni, Xianliang Huang, Chenhang Ma, Chen Xiao, Yuewen Ma, Ruxin Wang, Hao Zhang

机构 * Southern University of Science and Technology(南方科技大学) ByteDance(字节跳动) Zhejiang University(浙江大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 针对3D场景多物体移除的挑战,提出CoGeo-GS框架,通过概念感知语义标签与几何感知补全流水线实现可控多物体移除,在视觉质量与重建保真度上优于现有方法。

Comments 6 pages, 4 figures, accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18475 2026-08-28 cs.LG cs.AI 版本更新

GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

GAMMA:在任意预算下为混合精度模型进行全局位分配

Zhangyang Yao, Haiyan Zhao, Haoyu Wang, Xu Han

机构 * Beihang University(北航) Tsinghua University(清华) ByteDance Inc(字节跳动)

AI总结 本文提出GAMMA框架,通过后训练流水线学习模块级精度偏好,优化教师强制隐藏状态重建目标并利用整数规划实现精确预算分配,从而在任意预算下提升大语言模型的精度,优于固定精度基线和搜索基混合精度方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13427 2026-08-28 cs.GR cs.AI cs.CV 版本更新

A Unified Conditional Flow for Motion Generation, Editing, and Intra-Structural Retargeting

一种统一的条件流用于运动生成、编辑和内部结构重定向

Junlin Li, Xinhao Song, Siqi Wang, Haibin Huang, Yili Zhao

机构 * ByteDance(字节跳动)

AI总结 本文提出一种统一的条件流框架,用于运动生成、编辑和内部结构重定向,通过条件传输实现文本驱动的运动编辑和结构重定向,提升结构一致性。

Comments 16 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25661 2026-08-27 cs.SE cs.AI 新提交

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

从通用智能体到RCA专家:一种用于根因分析的自演化框架

Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 该研究提出自演化RCA框架OpsHarness,复用通用智能体能力,通过双门验证演化,在基准与工业场景中大幅提升RCA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-08-27 cs.LG cs.CV 版本更新

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06156 2026-08-27 cs.CV cs.AI cs.CL 版本更新

MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control

MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制

Yuchi Wang, Dingkang Yang, Haiyang Yu, Weikang Bian, Jiefeng Long, Xiao Liang, Chao Feng, Hongsheng Li

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ByteDance(字节跳动)

AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2026-08-27 cs.CL cs.SE 版本更新

Scalable Supervision for Software Agents via Patch Reasoning

基于补丁推理的软件智能体可扩展监督

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

AI总结 针对现有基于测试的软件智能体监督可扩展性不足的问题,提出R4P推理方法,在SWE-bench补丁验证中准确率达72.2%,训练的Mini-SE在Pass@1上较Qwen3-32B提升10.0%至26.2%。

Comments EMNLP'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏