arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Baidu(百度)

2026-06-23 至 2026-06-23 共收录 4
2606.23623 2026-06-23 cs.RO 新提交

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23344 2026-06-23 cs.CV 新提交

RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild

RT-DocLayout:野外文档的实时端到端文档布局分析与阅读顺序

Cheng Cui, Tingquan Gao, Xueqing Wang, Changda Zhou, Hongen Liu, Ting Sun, Yubo Zhang, Zelun Zhang, Jiaxuan Liu, Manhui Lin, Yue Zhang, Suyin Liang, Yiqing Xiang, Yi Liu

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)

AI总结 提出RT-DocLayout,一个33M参数的端到端框架,通过统一的多任务查询解码器同时进行分类、检测、分割和阅读顺序预测,在公共基准上达到132.1 FPS的实时推理速度和最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23050 2026-06-23 cs.CV cs.CL 新提交

Unlimited OCR Works

无限OCR工作

Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

机构 * Baidu Inc.(百度公司)

AI总结 本文提出Unlimited OCR模型,通过Reference Sliding Window Attention机制,实现高效长文本处理,适用于OCR及ASR等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏