arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

StepFun(阶跃星辰)

共收录 63
2603.08652 2026-08-07 cs.AI 版本更新

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02817 2026-08-04 cs.CV 版本更新

MMPhysVideo: Physically Plausible Video Generation Through Joint RGB-Perception Modeling

MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性

Shubo Lin, Xuanyang Zhang, Wei Cheng, Weiming Hu, Gang Yu, Jin Gao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) StepFun(阶跃星辰) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)

AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。

Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20635 2026-08-04 cs.CV 版本更新

iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation

iMontage:统一、多功能、高度动态的多对多图像生成

Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun Shanghai Jiao Tong University(上海交通大学)

AI总结 iMontage通过整合视频模型的先验知识与图像数据的多样性,实现了统一、多功能且动态的多对多图像生成。

Comments Our homepage: https://kr1sjfu.github.io/iMontage-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29279 2026-08-03 cs.SD 新提交

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测

Qingjian Lin, Yuxin Li, Haoyang Zhang, Jun Chen, Yechang Huang, Feng Tian, Xie Li, Xiangyu Tony Zhang, Daijiao Liu, Yuxin Zhang, Jinglan Gong, Bo Zhao, Fei Tian, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

机构 * StepFun(阶跃星辰) NTU(南洋理工大学) PKU(北京大学) UNSW(新南威尔士大学) SJTU(上海交通大学) USTC(中国科学技术大学)

AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。

Comments 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12252 2026-07-16 cs.CL 版本更新

FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality

金融研究基准II:一个具有共识衍生黄金标准的深度研究基准,用于区分财务报告质量

Beidi Luan, Rui Sun, Sinuo Wang, Yan Gu, Chao Li, Zhenliang Xiong, Jing Li, Zuo Bai

机构 * StepFun(步趣) FinStep(鳍步) University of Adelaide(阿德莱德大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对深度研究代理生成财务报告的大规模评估瓶颈,提出可扩展管道生成高质量标准。通过构建基准、合成候选标准、比较大语言模型与人类评估,经两个过滤器得出黄金标准集,用于评估10个深度研究系统,实现可扩展的基准评估等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00554 2026-07-09 q-fin.TR cs.CL q-fin.CP 版本更新

ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism

ContestTrade:一种基于内部竞争机制的多智能体交易系统

Rui Sun, Li Zhao, Zuoyou Jiang, Bo Yang, Yuxiao Bai, Mengting Chen, Jing Li, Zuo Bai

机构 * Stepfun FinStep

AI总结 针对基于LLM的智能体在金融交易中决策受市场信息影响的问题,提出ContestTrade多智能体交易系统,通过“量化 - 预测 - 分配”竞争机制及两个专业团队协作,在A股回测中取得较好收益和风险调整绩效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06521 2026-07-08 cs.CV cs.CL 版本更新

BabyVision: Visual Reasoning Beyond Language

BabyVision:超越语言的视觉推理

Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li

机构 * UniPat AI xbench Alibaba Group(阿里巴巴集团) MoonShot AI StepFun Peking University(北京大学) Tsinghua University(清华大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学) G Labs Equal Core Contributors(0G Labs 等核心贡献者)

AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。

Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28322 2026-07-01 cs.CV 新提交

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

PerceptionRubrics:将多模态评估校准至人类感知

Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) StepFun Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。

Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18394 2026-06-26 cs.CL 新提交

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

JetFlow: 通过并行树草稿突破推测解码的缩放上限

Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Peng Zhao, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

机构 * UC San Diego(加州大学圣地亚哥分校) Zhejiang University(浙江大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Nanjing University(南京大学) StepFun(阶跃星辰)

AI总结 提出JetFlow框架,通过因果并行草稿头结合树推测解码,将更大草稿预算转化为更长接受前缀和更高端到端加速,在Qwen3模型上实现最高9.64倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07031 2026-06-26 cs.CR cs.AI cs.CL 版本更新

HauntAttack: When Attack Follows Reasoning as a Shadow

HauntAttack:当攻击如影随形地跟随推理

Jingyuan Ma, Rui Li, Zheng Li, Junfeng Liu, Heming Xia, Lei Sha, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) StepFun Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Institute of Artificial Intelligence, Beihang University(北航人工智能研究院)

AI总结 提出HauntAttack黑盒对抗攻击框架,通过将有害指令嵌入推理问题,引导大型推理模型逐步产生不安全输出,在11个模型上平均攻击成功率超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25763 2026-06-25 cs.CV 新提交

ShutterMuse: Capture-Time Photography Guidance with MLLMs

ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导

Jiayu Li, Yixiao Fang, Tianyu Hu, Wei Cheng, Ping Huang, Zheheng Fan, Gang Yu, Xingjun Ma

机构 * Fudan University(复旦大学) StepFun

AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。

Comments Project Page:https://lijayutnt.github.io/ShutterMuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22883 2026-06-23 cs.AI 新提交

CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

CLI-Universe:面向终端代理的可验证任务合成引擎

Zhanbo Hua, Yifan Yao, Weihao Xie, Yongchi Zhao, Minghao Liu, Ruizhi Qiu, Zhewei Huang, Zun Wang, Yiyan Ji, Yunhai Ye, Letian Zhu, Xinping Lei, Han Li, Zhiyuan Ma, Zili Wang, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) StepFun(阶跃星辰) ZODA Shanghai AI Lab(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出CLI-Universe引擎,通过多维能力分类采样和证据引导研究生成终端代理任务,经多阶段可执行验证流水线筛选,构建高质量数据集CLI-Universe-6K,微调Qwen3-32B在Terminal-Bench 2.0上达到33.4%的SOTA。

Comments 20 pages, 5 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20506 2026-06-19 cs.CV cs.AI 新提交

FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining

FreeStyle: 从社区LoRA挖掘中实现风格-内容双参考生成的自由控制

Jinghong Lan, Wei Cheng, Yunuo Chen, Ziqi Ye, Peng Xing, Yixiao Fang, Rui Wang, Yufeng Yang, Xuanyang Zhang, Xianfang Zeng, Difan Zou, Gang Yu, Chi Zhang

机构 * Fudan University(复旦大学) StepFun Westlake University(西湖大学) University of Hong Kong(香港大学)

AI总结 提出FreeStyle框架,利用社区LoRA作为锚点,通过两阶段课程学习(注意力级约束和频率感知RoPE调制)解决双参考生成中的内容泄露问题,并引入新基准和评估指标,实现风格对齐、内容保持与泄露抑制的平衡。

Comments 35 pages, 26figures. Project page: https://github.com/Blue2Giant/FreeStyle

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18890 2026-06-18 cs.AI 新提交

Skill-Guided Continuation Distillation for GUI Agents

面向GUI代理的技能引导延续蒸馏

Zhimin Fan, Hongwei Yu, Yeqing Shen, Haolong Yan, Guozhen Peng, Tianhao Peng, Yudong Zhang, Xiaowen Zhang, Kaijun Tan, Zheng Ge, Xiangyu Zhang, Daxin Jiang

机构 * StepFun University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 提出技能引导延续蒸馏(SGCD)框架,通过技能引导策略生成成功延续轨迹,弥补专家轨迹中未覆盖的状态监督缺失,在OSWorld-Verified上将三个基础模型成功率从30%左右提升至50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21312 2026-06-16 cs.DC cs.AI cs.LG 版本更新

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

Frontier: 向全面且准确的LLM推理模拟迈进

Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Anuttacon StepFun

AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28185 2026-06-16 cs.CV 版本更新

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

新时代的视觉生成:从原子映射到智能世界建模的演进

Keming Wu, Zuhao Yang, Kaichen Zhang, Shizun Wang, Haowei Zhu, Sicong Leng, Zhongyu Yang, Qijie Wang, Sudong Wang, Ziting Wang, Zili Wang, Hui Zhang, Haonan Wang, Hang Zhou, Yifan Pu, Xingxuan Li, Fangneng Zhan, Bo Li, Lidong Bing, Yuxin Song, Ziwei Liu, Wenhu Chen, Jingdong Wang, Xinchao Wang, Xiaojuan Qi, Shijian Lu, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) StepFun MiroMind Baidu(百度) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LMMs-Lab(LMMs实验室)

AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。

Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05150 2026-06-15 cs.CL cs.AI 版本更新

Chronological Thinking in Full-Duplex Spoken Dialogue Language Models

全双工口语对话语言模型中的时间顺序思考

Donghang Wu, Haoyang Zhang, Chen Chen, Tianyu Zhang, Fei Tian, Xuerui Yang, Gang Yu, Hexin Liu, Nana Hou, Yuchen Hu, Eng Siong Chng

机构 * Nanyang Technological University(南洋理工大学) StepFun Mila

AI总结 提出Chronological Thinking机制,让全双工对话模型在听用户说话时增量推理,不增加延迟,提升响应质量。

Comments Accepted by SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09827 2026-06-09 cs.RO cs.CV 新提交

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

MemoryVLA++:通过记忆与想象在视觉-语言-动作模型中进行时间建模

Hao Shi, Weiye Li, Bin Xie, Yulin Wang, Renping Zhou, Tiancai Wang, Xiangyu Zhang, Ping Luo, Gao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Dexmal StepFun

AI总结 提出MemoryVLA++框架,通过工作记忆、感知-认知记忆库和想象未来状态的世界模型,实现完整时间建模,在模拟和真实机器人任务上显著提升长时域和依赖记忆与想象的任务性能。

Comments The project is available at https://shihao1895.github.io/MemoryVLA-PP-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03189 2026-06-05 cs.CL

SenseJudge: Human-Centric Preference-Driven Judgment Framework

SenseJudge: 以人为中心的偏好驱动判断框架

Rui Li, Junfeng Liu, Xiangwen Kong, Linhai Xu, Zhifang Sui

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) StepFun Xi’an Jiaotong University(西安交通大学)

AI总结 提出SenseJudge框架和SenseBench基准,通过融入用户偏好实现个性化判断和模型排名,实验证明其优于现有方法。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02697 2026-06-04 cs.CV cs.AI

ShareVerse: Multi-Agent Consistent Video Generation for Shared World Modeling

ShareVerse:面向共享世界建模的多智能体一致视频生成

Jiayi Zhu, Jianing Zhang, Yiying Yang, Wei Cheng, Xiaoyun Yuan

机构 * Shanghai Jiao Tong University China(上海交通大学中国) Fudan University China(复旦大学中国) StepFun China(StepFun中国)

AI总结 提出ShareVerse框架,通过构建多智能体交互数据集、空间拼接策略和跨智能体注意力机制,实现多智能体共享世界的一致视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27761 2026-05-28 cs.CV cs.SE

AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

AndroidDaily: 面向真实世界闭源应用的可验证移动GUI智能体基准

Yifan Sui, Xin Huang, Hongbing Li, Fang Xu, Jiahe Lv, Haolong Yan, Yeqing Shen, Litao Liu, Zhimin Fan, Ziyang Meng, Jia Wang, Junbo Qi, Kaijun Tan, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Osamu Yoshie

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) StepFun Waseda University(早稻田大学)

AI总结 针对闭源应用无法获取内部状态导致自动验证困难的问题,提出AndroidDaily基准(350个日常任务)和GRADE评估器(基于可观察外部指南的三层系统),实现无需内部状态的可验证评估,最强模型成功率为62.0%。

Comments 11 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18390 2026-05-19 cs.CV

Vision Foundation Models as Generalist Tokenizers for Image Generation

视见过滤模型作为图像生成的通用标记器

Anlin Zheng, Qi Han, Xin Wen, Chuofan Ma, Lanxi Gong, Gang Yu, Xiangyu Zhang, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) StepFun

AI总结 本文提出了一种基于冻结视见过滤模型(VFM)的通用图像标记器VFMTok,通过区域自适应量化框架和语义重建目标,提升了图像生成的质量和效率,同时在离散和连续潜在空间中实现了高保真度的类别条件合成。

Comments 4 figures and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12119 2026-05-19 cs.CL cs.AI

Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource

专家混合模型可在严格相等资源下超越密集语言模型

Houyi Li, Ka Man Lo, Shijie Xuyang, Ziqi Wang, Wenzhen Zheng, Haocheng Zhang, Zhao Li, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

机构 * Fudan University(复旦大学) StepFun University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

AI总结 本文研究在资源相等条件下MoE模型是否能超越密集模型,提出优化框架并验证了在最优激活率下MoE模型性能更优,且该区域在不同模型规模下一致,通过数据重用解决数据量增加的权衡问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14487 2026-05-15 cs.CV cs.AI

Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

强制头部:通过头部异质性实现长自回归视频生成

Jiahao Tian, Yiwei Wang, Gang Yu, Chi Zhang

机构 * AGI Lab, Westlake University University of California at Merced StepFun

AI总结 本文提出Head Forcing框架,通过差异化分配KV缓存策略提升长视频生成质量,实现分钟级生成并支持多提示交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12034 2026-05-15 cs.MM cs.AI cs.CV

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

提升多模态语言模型:带有视觉偏见评估的分阶段训练

Che Liu, Lichao Ma, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Xuerui Yang, Fei Tian

机构 * StepFun-Audio Team(StepFun-Audio团队)

AI总结 本文研究了多模态基准在视觉偏见评估下的表现,提出OmniBoost三阶段训练方法,通过混合双模SFT、混合模态RLVR和自蒸馏数据SFT提升模型性能,验证了小模型在分阶段训练下的有效性。

Comments Project page: https://cheliu-computation.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09592 2026-05-12 cs.CL

Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models

有意识说话:一种双脑方法用于语音语言模型中的实时推理

Donghang Wu, Haoyang Zhang, Jun Chen, Xiangyu, Zhang, Hexin Liu, Eng Siong Chng, Fei Tian, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

机构 * StepFun Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出Mind-Paced Speaking方法,通过双脑架构实现语音语言模型的实时推理,显著提升推理性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28547 2026-03-31 cs.CV

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

GEditBench v2:一个对齐人类的通用图像编辑基准

Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) StepFun Southeast University(东南大学)

AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。

Comments 30 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24862 2026-03-31 cs.CV

ViStoryBench: Comprehensive Benchmark Suite for Story Visualization

ViStoryBench:故事可视化全面评估基准套件

Cailin Zhuang, Ailin Huang, Yaoqi Hu, Jingwei Wu, Wei Cheng, Jiaqi Liao, Hongyuan Wang, Xinyao Liao, Weiwei Cai, Hengyuan Xu, Xuanyang Zhang, Xianfang Zeng, Zhewei Huang, Gang Yu, Chi Zhang

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) AGI Lab, Westlake University(西湖大学AGI实验室)

AI总结 本文提出ViStoryBench,一个全面评估故事可视化模型的基准套件,通过多维度指标评估叙事结构、视觉风格和角色设定,结合人类验证确保一致性与真实性,推动视觉叙事技术发展。

Comments Accepted by CVPR 2026. 44 Pages, Project Page: https://vistorybench.github.io, Code: https://github.com/vistorybench/vistorybench, Dataset: https://huggingface.co/datasets/ViStoryBench/ViStoryBench

详情

展开后加载摘要…

URL PDF HTML 收藏