Enhancing Rubric-based RL via Self-Distillation
通过自蒸馏增强基于评分标准的强化学习
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中探索有限问题,提出标准蒸馏策略优化(CriPO),通过策略内自蒸馏同时解决未探索标准和被抑制标准问题,在医学和科学基准测试中表现出色,减少优化步骤并提升性能。
大厂专区
通过自蒸馏增强基于评分标准的强化学习
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动)
AI总结 研究基于评分标准的强化学习中探索有限问题,提出标准蒸馏策略优化(CriPO),通过策略内自蒸馏同时解决未探索标准和被抑制标准问题,在医学和科学基准测试中表现出色,减少优化步骤并提升性能。
依赖引导的代码生成:结构化矩阵分解与一致性引导的细化
机构 * University of the Chinese Academy of Sciences(中国科学院大学) ; ByteDance Inc.(字节跳动公司) ; Zhejiang University(浙江大学) ; National Taiwan University(台湾国立大学) ; Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Liaoning Technical University(辽宁技术大学)
AI总结 针对现有代码生成方法无法充分捕捉代码实体依赖关系的问题,提出依赖感知代码生成框架,通过结构化矩阵分解和一致性引导细化生成代码,经实验验证该方法能生成语义对齐和结构保真度更高的代码。
Comments 12 pages
Workflow-GYM:面向真实世界专业领域的长周期计算机使用代理任务评估
机构 * ByteDance Seed(字节跳动Seed) ; M-A-P ; Humanlaya
AI总结 提出Workflow-GYM基准,评估AI代理在专业软件中执行长周期、高价值工作流的能力,发现最强模型成功率仅略超30%,揭示当前代理在长周期工作流一致性方面的严重不足。
MSQA:一个原生来源的多语言多文化SimpleQA基准
机构 * M-A-P ; ByteDance Seed(字节跳动Seed) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Nanjing University(南京大学)
AI总结 提出MSQA基准,包含1064个原生问题覆盖11种语言和5个文化维度,评估18个LLM发现文化能力随预训练暴露程度下降,且推理时补救措施无效。
Comments Due to the company's data approval issue, we need to withdraw the article
ME-IQA: 通过重新排序增强的记忆图像质量评估
机构 * City University of Hong Kong(香港城市大学) ; ByteDance Inc.(字节跳动公司)
AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。
Comments Published as a conference paper at ECCV 2026
ShortOPD:通过短到长的策略蒸馏恢复剪枝后的语言模型
机构 * ByteDance(字节跳动) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 研究结构化剪枝在语言模型自由形式生成任务中存在的问题,提出ShortOPD方法,通过短到长的策略蒸馏,检测重复后缀,合理分配展开预算,有效提升压缩模型分数,减少训练时间和展开令牌,推动结构化剪枝接近可部署的生成质量。
通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动)
AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。
UniVR:用于统一视觉推理的视觉空间思考
机构 * Beijing Jiaotong University(北京交通大学) ; ByteDance(字节跳动)
AI总结 UniVR旨在从纯视觉演示中同时学习复杂推理、物理动力学和长期规划,核心是VR-GRPO强化学习范式。构建VR-X基准进行训练和评估,在VR-X上有25%的提升,还提高了多模态理解基准性能,相关资源已开源。
Comments Code and models are released at: https://maverickren.github.io/UniVR.github.io/
PRISM Edit:适用于所有时间答案的单一向量
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动)
AI总结 研究针对大语言模型时间事实更新问题,基于因果追踪发现其内部计算支持新旧答案区分,进而引入PRISM Edit,通过优化单一多义词表示及利用固有调制路径,在新基准上评估,相比基线提升了时间一致性等指标且速度更快。
Comments Chen Huang and Qi Zheng contributed equally. Corresponding authors: Long Zeng, Yuantong Xu
智能体不仅会认同,还会记忆:对有状态个人智能体中持续谄媚行为的基准测试
机构 * City University of Hong Kong(香港城市大学) ; ByteDance(字节跳动) ; Yale University(耶鲁大学) ; Fudan University(复旦大学) ; Hong Kong Baptist University(香港浸会大学) ; Dalian University of Technology(大连理工大学)
AI总结 研究有状态个人智能体中的持续谄媚行为,引入PASB基准测试,评估真实智能体。通过特定方法隔离写入过程,发现提交边界是关键转折点,提交声明有三种模式,表明智能体谄媚行为是状态写入治理问题,PASB确定相关写入时控制。
CreatiParser: 从位图图形设计生成可编辑的图层
机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ; ByteDance Intelligent Creation(字节跳动智能创作) ; School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)
AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。
读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型
机构 * The University of Hong Kong(香港大学) ; ByteDance Seed(字节跳动Seed) ; Peking University(北京大学)
AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。
自我进化临床系统之路:将医疗智能体从辅助扩展到自主
机构 * Hunan University(湖南大学) ; ByteDance(字节跳动) ; Duke University(杜克大学) ; Westlake University(西湖大学) ; The University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Macau(澳门大学) ; The Ohio State University(俄亥俄州立大学)
AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。
Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents
FARS:一个大规模部署的全自动研究系统
机构 * Analemma ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; University College Dublin(都柏林大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; ByteDance(字节跳动) ; ShanghaiTech University(上海科技大学) ; University of Warwick(华威大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; Tencent(腾讯) ; The University of Hong Kong(香港大学) ; Shanghai Innovation Institute(上海创新研究院) ; Nex-AGI Team(Nex-AGI团队)
AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。
AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型
机构 * School of Computer Science, Peking University(北京大学计算机学院) ; ByteDance Inc.(字节跳动公司) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。
Comments Accepted by ECCV 2026
GeoWorld:提供全帧几何特征以促进3D场景生成
机构 * VCIP & AAIS, Nankai University(VCIP与AAIS,南开大学) ; ByteDance Inc.(字节跳动公司) ; Renmin University of China(中国人民大学) ; NKIARI, Shenzhen Futian(NKIARI,深圳福田)
AI总结 针对视频模型用于图像到3D场景生成时的几何失真等问题,提出两阶段GeoWorld方法,先由视频模型和多视图几何模型生成全帧几何特征辅助第二阶段,还提几何损失和适配模块,能生成更高保真3D场景且更快。
DreamCharacter-1:从3D生成基础模型到产品就绪的角色生成
机构 * ByteDance(字节跳动)
AI总结 研究提出DreamCharacter-1框架,基于3D基础主干,通过几何后期训练、纹理后期训练和推理加速三个组件,将预训练模型校准用于3D角色生成,实验证明该框架能生成高质量角色资产,超越现有方法。
Comments Official Page: https://dreamcharacter-x.github.io/
video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; University of Cambridge(剑桥大学)
AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。
EasyLens: 一种无需训练的即插即用型微病变表示放大器,用于医学视觉语言模型
机构 * Jilin University(吉林大学) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; ByteDance(字节跳动) ; Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院)
AI总结 提出EasyLens,一种无需训练的即插即用模块,通过构建病理-解剖原型空间、反事实推理选择病变相关补丁以及形态引导残差增强,放大医学视觉语言模型对微病变的表示能力。
CriterAlign: 以标准为中心的推理对齐用于代码偏好判断
机构 * KAUST(卡塔尔人工智能研究 institute) ; ByteDance(字节跳动)
AI总结 本文提出CriterAlign,一种以标准为中心的推理对齐框架,通过直接的标准级 pairwise 判断、tie-driven 标准细化、swap-consistency 过滤和最终 pairwise 合成,改进了代码偏好判断的准确性,同时引入Human-Preference-Aligned Guidance (HPAG)来提升性能。
Tessera:通过内核粒度解耦解锁异构GPU
机构 * Peking University(北京大学) ; Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute for AI Industry Research, Tsinghua University(清华大学人工智能研究院) ; Tsinghua University(清华大学) ; University of Leeds(利兹大学) ; ByteDance(字节跳动)
AI总结 Tessera通过内核粒度解耦提升异构GPU上的大模型推理性能和成本效率,利用离线分析与在线适应结合,实现计算与硬件能力的匹配。
UP:用于打破探索-稳定性困境的无界正不对称优化
机构 * ByteDance Seed(字节跳动种子) ; Michigan State University(密歇根州立大学)
AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。
通过直接在线策略蒸馏实现弱到强泛化
机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华-字节跳动联合研究中心SIA实验室) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Peking University(北京大学)
AI总结 针对可验证奖励RL在大模型上成本高的问题,提出Direct-OPD方法迁移小模型RL的策略偏移,无需在大模型上跑RL即可实现性能提升。
Comments Project Page: https://bytedtsinghua-sia.github.io/Direct-OPD/
DanceOPD:在策略生成场蒸馏
机构 * ByteDance Seed(字节跳动Seed) ; NUS(新加坡国立大学) ; UMD(马里兰大学) ; HKUST(香港科技大学)
AI总结 提出DanceOPD框架,通过将每个样本路由到能力场并查询低噪声学生诱导状态,用速度MSE损失训练流匹配模型,实现文本到图像、局部编辑和全局编辑的多能力组合,提升目标能力同时保持生成质量。
Comments Technical Report; 40 pages, 13 figures, 9 tables; Project Page at https://danceopd.github.io/ GitHub Repo at https://github.com/worldbench/DanceOPD
U-TTT:通过测试时训练实现可泛化的PET图像去噪
机构 * School of Biological Science and Medical Engineering, Beihang University(北京航空航天大学生物科学与医学工程学院) ; Department of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) ; School of Aerospace Engineering, Tsinghua University(清华大学航天航空学院) ; ByteDance Inc.(字节跳动有限公司)
AI总结 针对PET图像去噪模型在分布偏移下性能退化的问题,提出U-TTT模型,集成测试时训练(TTT)层,通过自监督动态调整参数,并设计双域自适应机制(空间和频率TTT层),在未见剂量水平和扫描仪下实现最优去噪和泛化。
Comments This paper introduces the first TTT-based model for image restoration
生成细化网络用于视觉合成
机构 * ByteDance(字节跳动)
AI总结 本文提出生成细化网络(GRN),通过近无损分层二进制量化解决离散化瓶颈,结合全局细化机制和熵引导采样策略,提升图像生成质量与效率。
Comments code: https://github.com/bytedance/GRN
标签层次转换:深入研究类层次结构以增强深度分类器
机构 * School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(数学与统计学学院和教育部智能网络与网络安全重点实验室,西安交通大学) ; Tencent AI Lab(腾讯AI实验室) ; ByteDance(字节跳动) ; SINGPATH AI Lab, SingPath Medical Technology Pte. Ltd.(SingPath AI实验室,SingPath医疗科技私人有限公司) ; School of Mathematics and Statistics, Xidian University(数学与统计学学院,西安电子科技大学) ; College of Biomedical Engineering, Sichuan University(生物医学工程学院,四川大学) ; School of Mathematics and Statistics, Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(数学与统计学学院和教育部智能网络与网络安全重点实验室,西安交通大学) ; Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科技大学)
AI总结 研究针对层次分类中现有方法未充分利用类别相关性的问题,提出基于深度学习的LHT统一概率框架,由转换网络和混淆损失构成,实验证明其优于现有方法,还扩展到皮肤病变诊断任务展现潜力。
EdgeBench:揭示从真实环境中学习的缩放定律
机构 * ByteDance(字节跳动)
AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。
基于高斯点云的语义引导渐进式物体移除
机构 * PICO, ByteDance Inc.(字节跳动公司PICO) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Fudan University(复旦大学)
AI总结 提出结合语义引导块匹配与区域渐进式细化的框架用于3D物体移除。利用DINOv2编码语义指导,通过RPR策略分区域优化,基于高斯点云实现高效重建,在物体移除上性能优于现有高斯方法。
Comments 8 pages, 4 figures
APeB:大型语言模型智能体个性化能力基准测试
机构 * The Chinese University of Hong Kong(香港中文大学) ; ByteDance(字节跳动)
AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。
Comments NA