arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Baidu(百度)

2026-06-23 至 2026-06-23 共收录 6
2606.23623 2026-06-23 cs.RO 新提交

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23344 2026-06-23 cs.CV 新提交

RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild

RT-DocLayout:野外文档的实时端到端文档布局分析与阅读顺序

Cheng Cui, Tingquan Gao, Xueqing Wang, Changda Zhou, Hongen Liu, Ting Sun, Yubo Zhang, Zelun Zhang, Jiaxuan Liu, Manhui Lin, Yue Zhang, Suyin Liang, Yiqing Xiang, Yi Liu

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)

AI总结 提出RT-DocLayout,一个33M参数的端到端框架,通过统一的多任务查询解码器同时进行分类、检测、分割和阅读顺序预测,在公共基准上达到132.1 FPS的实时推理速度和最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23050 2026-06-23 cs.CV cs.CL 新提交

Unlimited OCR Works

无限OCR工作

Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

机构 * Baidu Inc.(百度公司)

AI总结 本文提出Unlimited OCR模型,通过Reference Sliding Window Attention机制,实现高效长文本处理,适用于OCR及ASR等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22766 2026-06-23 cs.CV 新提交

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

READ:超越所见——基于强化学习的准确连贯音频描述生成

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Baidu Inc(百度公司) Tsinghua University(清华大学)

AI总结 提出首个基于强化学习的音频描述生成框架READ,通过序列级优化和连贯性奖励,显著提升生成准确性与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04205 2026-06-23 cs.CV 版本更新

Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild

Real5-OmniDocBench:面向野外鲁棒文档解析的全尺度物理重建基准

Changda Zhou, Ziyue Gao, Xueqing Wang, Tingquan Gao, Cheng Cui, Jing Tang, Yi Liu

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出首个对OmniDocBench v1.5进行全尺度一对一物理重建的基准Real5-OmniDocBench,覆盖扫描、弯曲、屏幕摄影、光照和倾斜五种真实场景,通过完整真值映射实现性能退化的因子级归因,揭示文档解析中的“现实鸿沟”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01152 2026-06-23 cs.AI 版本更新

DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent

DeepResearch-9K:一个具有挑战性的深度研究智能体基准数据集

Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang, Dawei Yin, Xiangyu Zhao

机构 * Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

AI总结 为解决深度研究智能体缺乏大规模挑战性数据集和开源训练框架的问题,构建了DeepResearch-9K数据集,包含9000个多难度问题、搜索轨迹和可验证答案,并开发了开源训练框架DeepResearch-R1,实验表明训练后的智能体在基准测试上达到最优。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏