Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning
Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架
机构 * StepFun(阶跃星辰) ; Fudan University(复旦大学)
AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。
大厂专区
Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架
机构 * StepFun(阶跃星辰) ; Fudan University(复旦大学)
AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。
ContestTrade:一种基于内部竞争机制的多智能体交易系统
机构 * Stepfun ; FinStep
AI总结 针对基于LLM的智能体在金融交易中决策受市场信息影响的问题,提出ContestTrade多智能体交易系统,通过“量化 - 预测 - 分配”竞争机制及两个专业团队协作,在A股回测中取得较好收益和风险调整绩效。
超越前缀局部性的混合强化学习回滚调度
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; StepFun(阶跃星辰)
AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。
CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT
机构 * South China University of Technology(南方科技大学) ; StepFun ; Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。
Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026
MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; StepFun(阶跃星辰) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) ; School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)
AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。
Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page
iMontage:统一、多功能、高度动态的多对多图像生成
机构 * Nanyang Technological University(南洋理工大学) ; StepFun ; Shanghai Jiao Tong University(上海交通大学)
AI总结 iMontage通过整合视频模型的先验知识与图像数据的多样性,实现了统一、多功能且动态的多对多图像生成。
Comments Our homepage: https://kr1sjfu.github.io/iMontage-web/
ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测
机构 * StepFun(阶跃星辰) ; NTU(南洋理工大学) ; PKU(北京大学) ; UNSW(新南威尔士大学) ; SJTU(上海交通大学) ; USTC(中国科学技术大学)
AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。
Comments 14 pages, 3 figures, 4 tables
金融研究基准II:一个具有共识衍生黄金标准的深度研究基准,用于区分财务报告质量
机构 * StepFun(步趣) ; FinStep(鳍步) ; University of Adelaide(阿德莱德大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 该研究针对深度研究代理生成财务报告的大规模评估瓶颈,提出可扩展管道生成高质量标准。通过构建基准、合成候选标准、比较大语言模型与人类评估,经两个过滤器得出黄金标准集,用于评估10个深度研究系统,实现可扩展的基准评估等研究。
BabyVision:超越语言的视觉推理
机构 * UniPat AI ; xbench ; Alibaba Group(阿里巴巴集团) ; MoonShot AI ; StepFun ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Princeton University(普林斯顿大学) ; Nanyang Technological University(南洋理工大学) ; G Labs Equal Core Contributors(0G Labs 等核心贡献者)
AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。
Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision
PerceptionRubrics:将多模态评估校准至人类感知
机构 * Johns Hopkins University(约翰霍普金斯大学) ; StepFun ; Tsinghua University(清华大学) ; Independent Researcher(独立研究者)
AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。
Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics
JetFlow: 通过并行树草稿突破推测解码的缩放上限
机构 * UC San Diego(加州大学圣地亚哥分校) ; Zhejiang University(浙江大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Nanjing University(南京大学) ; StepFun(阶跃星辰)
AI总结 提出JetFlow框架,通过因果并行草稿头结合树推测解码,将更大草稿预算转化为更长接受前缀和更高端到端加速,在Qwen3模型上实现最高9.64倍加速。
HauntAttack:当攻击如影随形地跟随推理
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; StepFun ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Institute of Artificial Intelligence, Beihang University(北航人工智能研究院)
AI总结 提出HauntAttack黑盒对抗攻击框架,通过将有害指令嵌入推理问题,引导大型推理模型逐步产生不安全输出,在11个模型上平均攻击成功率超70%。
ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导
机构 * Fudan University(复旦大学) ; StepFun
AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。
Comments Project Page:https://lijayutnt.github.io/ShutterMuse
CLI-Universe:面向终端代理的可验证任务合成引擎
机构 * Nanjing University(南京大学) ; StepFun(阶跃星辰) ; ZODA ; Shanghai AI Lab(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 提出CLI-Universe引擎,通过多维能力分类采样和证据引导研究生成终端代理任务,经多阶段可执行验证流水线筛选,构建高质量数据集CLI-Universe-6K,微调Qwen3-32B在Terminal-Bench 2.0上达到33.4%的SOTA。
Comments 20 pages, 5 figures, 3 tables. Preprint
FreeStyle: 从社区LoRA挖掘中实现风格-内容双参考生成的自由控制
机构 * Fudan University(复旦大学) ; StepFun ; Westlake University(西湖大学) ; University of Hong Kong(香港大学)
AI总结 提出FreeStyle框架,利用社区LoRA作为锚点,通过两阶段课程学习(注意力级约束和频率感知RoPE调制)解决双参考生成中的内容泄露问题,并引入新基准和评估指标,实现风格对齐、内容保持与泄露抑制的平衡。
Comments 35 pages, 26figures. Project page: https://github.com/Blue2Giant/FreeStyle
面向GUI代理的技能引导延续蒸馏
机构 * StepFun ; University of Science and Technology Beijing(北京科技大学) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
AI总结 提出技能引导延续蒸馏(SGCD)框架,通过技能引导策略生成成功延续轨迹,弥补专家轨迹中未覆盖的状态监督缺失,在OSWorld-Verified上将三个基础模型成功率从30%左右提升至50%以上。
Frontier: 向全面且准确的LLM推理模拟迈进
机构 * The Chinese University of Hong Kong(香港中文大学) ; Anuttacon ; StepFun
AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。
新时代的视觉生成:从原子映射到智能世界建模的演进
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; University of Hong Kong(香港大学) ; National University of Singapore(新加坡国立大学) ; University of Waterloo(滑铁卢大学) ; StepFun ; MiroMind ; Baidu(百度) ; Fudan University(复旦大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; LMMs-Lab(LMMs实验室)
AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。
Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation
全双工口语对话语言模型中的时间顺序思考
机构 * Nanyang Technological University(南洋理工大学) ; StepFun ; Mila
AI总结 提出Chronological Thinking机制,让全双工对话模型在听用户说话时增量推理,不增加延迟,提升响应质量。
Comments Accepted by SIGDIAL 2026
MemoryVLA++:通过记忆与想象在视觉-语言-动作模型中进行时间建模
机构 * Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Dexmal ; StepFun
AI总结 提出MemoryVLA++框架,通过工作记忆、感知-认知记忆库和想象未来状态的世界模型,实现完整时间建模,在模拟和真实机器人任务上显著提升长时域和依赖记忆与想象的任务性能。
Comments The project is available at https://shihao1895.github.io/MemoryVLA-PP-Web
SenseJudge: 以人为中心的偏好驱动判断框架
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) ; StepFun ; Xi’an Jiaotong University(西安交通大学)
AI总结 提出SenseJudge框架和SenseBench基准,通过融入用户偏好实现个性化判断和模型排名,实验证明其优于现有方法。
Comments ACL 2026 Findings
ShareVerse:面向共享世界建模的多智能体一致视频生成
机构 * Shanghai Jiao Tong University China(上海交通大学中国) ; Fudan University China(复旦大学中国) ; StepFun China(StepFun中国)
AI总结 提出ShareVerse框架,通过构建多智能体交互数据集、空间拼接策略和跨智能体注意力机制,实现多智能体共享世界的一致视频生成。
从知道到做到:面向LLM股票市场交易智能体的记忆控制基准
机构 * Tsinghua University(清华大学) ; Stepfun ; FinStep ; Shanghai Jiao Tong University(上海交通大学) ; Adelaide University(阿德莱德大学)
AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。
AndroidDaily: 面向真实世界闭源应用的可验证移动GUI智能体基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; StepFun ; Waseda University(早稻田大学)
AI总结 针对闭源应用无法获取内部状态导致自动验证困难的问题,提出AndroidDaily基准(350个日常任务)和GRADE评估器(基于可观察外部指南的三层系统),实现无需内部状态的可验证评估,最强模型成功率为62.0%。
Comments 11 pages, 6 figures. Preprint
视见过滤模型作为图像生成的通用标记器
机构 * University of Hong Kong(香港大学) ; StepFun
AI总结 本文提出了一种基于冻结视见过滤模型(VFM)的通用图像标记器VFMTok,通过区域自适应量化框架和语义重建目标,提升了图像生成的质量和效率,同时在离散和连续潜在空间中实现了高保真度的类别条件合成。
Comments 4 figures and 14 tables
专家混合模型可在严格相等资源下超越密集语言模型
机构 * Fudan University(复旦大学) ; StepFun ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学)
AI总结 本文研究在资源相等条件下MoE模型是否能超越密集模型,提出优化框架并验证了在最优激活率下MoE模型性能更优,且该区域在不同模型规模下一致,通过数据重用解决数据量增加的权衡问题。
Comments Published as a conference paper at ICLR 2026
强制头部:通过头部异质性实现长自回归视频生成
机构 * AGI Lab, Westlake University University of California at Merced StepFun
AI总结 本文提出Head Forcing框架,通过差异化分配KV缓存策略提升长视频生成质量,实现分钟级生成并支持多提示交互。
提升多模态语言模型:带有视觉偏见评估的分阶段训练
机构 * StepFun-Audio Team(StepFun-Audio团队)
AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。
Comments Project page: https://cheliu-computation.github.io/omni/
有意识说话:一种双脑方法用于语音语言模型中的实时推理
机构 * StepFun ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学)
AI总结 本文提出Mind-Paced Speaking方法,通过双脑架构实现语音语言模型的实时推理,显著提升推理性能并降低延迟。
重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; University of Science and Technology of China(中国科学技术大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; StepFun Inc(StepFun公司)
AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。
Comments 16 pages, 4 figures