arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Huawei(华为)

2026-05-20 至 2026-05-20 共收录 4
2504.04349 2026-05-20 cs.GT cs.LG

Tight Regret Bounds for Fixed-Price Bilateral Trade

固定价格双边交易的紧懊悔界

Houshuang Chen, Yaonan Jin, Pinyan Lu, Chihao Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei’s Taylor Lab(华为泰勒实验室) Shanghai University of Finance and Economics, Laboratory of Interdisciplinary Research of Computation and Economics (SUFE)(上海金融学院,计算与经济学交叉研究实验室(SUFE))

AI总结 本文研究了固定价格机制在双边交易中的懊悔最小化问题,针对独立值和相关/对抗值分别给出了紧致的懊悔界,并改进了现有结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19386 2026-05-20 cs.CV

MatPhys: Learning Material-Aware Physics Parameters for Deformable Object Simulation from Videos

MatPhys: 从视频中学习材料感知的物理参数以模拟可变形物体

Yang Yang, Yiyan Wang, Zheming Liu, Naoya Iwamoto

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Huawei Technologies Japan K.K(华为技术日本株式会社)

AI总结 本文提出MatPhys方法,通过单视角视频预测弹簧-质量参数,解决了现有方法在材料假设和跨场景一致性方面的不足,从而提升可变形物体模拟的准确性和泛化能力。

Comments Submitted to Siggrah Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19033 2026-05-20 cs.RO cs.AI cs.CV cs.LG cs.MA

RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning

RLFTSim: 通过强化学习微调实现逼真且可控的多智能体交通仿真

Ehsan Ahmadi, Hunter Schofield, Behzad Khamidehi, Fazel Arasteh, Jinjun Shan, Lili Mou, Dongfeng Bai, Kasra Rezaee

机构 * University of Alberta(阿尔伯塔大学) Huawei Technologies Canada(华为加拿大技术有限公司) York University(约克大学) Canada CIFAR AI Chair, Amii(加拿大 CIFAR 人工智能主席,Amii)

AI总结 本文提出RLFTSim框架,通过强化学习微调提升交通仿真场景的真实感,并通过目标条件化方法实现对交通仿真可控性的提炼,实验表明其在真实感和可控性方面均优于其他启发式搜索方法。

Comments CVPR 2026 Highlight; Project page at https://ehsan-ami.github.io/rlftsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15698 2026-05-20 cs.CL cs.AI cs.LG

CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning

CoLD: 用于数学推理过程中奖励模型的反事实引导长度偏差消除

Congmin Zheng, Jiachen Zhu, Jianghao Lin, Xinyi Dai, Weiwen Liu, Haoxuan Li, Yong Yu, Weinan Zhang, Mengyue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) University of Bristol(布里斯托大学)

AI总结 本文提出CoLD,一种通过反事实引导消除过程奖励模型中长度偏差的统一框架,旨在提高多步骤推理的准确性和简洁性,同时提升下游强化学习性能和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏