arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-05-13 至 2026-05-13 共收录 7
2605.11928 2026-05-13 cs.AI

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents

当模拟欺骗时:一个仿真到现实的基准和领域随机化的强化学习配方用于工具使用智能体

Xiaolin Zhou, Aojie Yuan, Zheng Luo, Zipeng Ling, Xixiao Pan, Yicheng Gao, Haiyue Zhang, Jiate Li, Shuli Jiang, Prince Zizhuang Wang, Zixuan Zhu, Jinbo Liu, Ryan A. Rossi, Hua Wei, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究)

AI总结 本文研究了工具使用POMDP中的仿真到现实差距,提出了一种领域随机化的强化学习方法,通过扰动增强轨迹提升鲁棒性,缩小了工具使用智能体在现实部署中的性能差距。

Comments Dataset, code, and benchmark leaderboard are available at https://github.com/WillChow66/robustbench-tc-release.git and https://huggingface.co/spaces/willchow66/robustbench-tc-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11521 2026-05-13 cs.CV

XWOD: A Real-World Benchmark for Object Detection under Extreme Weather Conditions

XWOD:面向极端天气条件的现实世界目标检测基准

Chih-Hsin Chen, Yu-Tung Liu, Amar Fadillah, Kuan-Ting Lai, Dong Liu

机构 * Department of Electronic Engineering(电子工程系) National Taipei University of Technology(台北科技大学) Adobe Inc.(Adobe公司)

AI总结 本文提出XWOD基准,包含10010张图像和42924个边界框,涵盖七种极端天气条件,通过训练标准YOLO模型在其他基准上取得显著提升,验证了数据质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11272 2026-05-13 cs.LG cs.AI cs.IR

Localization Boosting for Growth Markets: Mitigating Cross-Locale Behavioral Bias in Learning-to-Rank

增长市场中的定位增强:减轻跨本地化行为偏差在学习到排序中的影响

Suryaa Veerabathiran Seran, Ashwin Naresh Kumar, Tracy Holloway King, Jing Zheng

机构 * Adobe

AI总结 本文提出一种多目标框架,结合行为监督、VLM相关性信号和本地化增强,以改善学习到排序中的本地内容可见性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11169 2026-05-13 cs.AI

OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents

OLIVIA:通过推理时间动作适应实现LLM ReAct代理的在线学习

Sheldon Yu, Junda Wu, Xintong Li, Nikki Lijing Kuang, Sizhe Zhou, Tong Yu, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究)

AI总结 OLIVIA通过在推理时对动作进行适应,改进LLM ReAct代理在部署中的决策能力,提供可跟踪、细粒度和不确定性感知的适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10082 2026-05-13 cs.CL cs.LG

FERA: Uncertainty-Aware Federated Reasoning for Large Language Models

FERA:面向大语言模型的不确定性感知联邦推理

Ruhan Wang, Chengkai Huang, Zhiyong Wang, Junda Wu, Rui Wang, Tong Yu, Julian McAuley, Lina Yao, Dongruo Zhou

机构 * Indiana University(印第安纳大学) The University of New South Wales(新南威尔士大学) The Chinese University of Hong Kong(香港中文大学) University of California San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

AI总结 FERA通过迭代服务器-客户端协同细化,解决联邦推理中客户端可靠性依赖查询的问题,提升多步骤推理能力,实验表明其在多个推理基准上优于联邦训练和无训练基线。

Comments 44 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22301 2026-05-13 cs.CV

Coarse-to-Real: Generative Rendering for Populated Dynamic Scenes

粗到真实:生成渲染用于拥挤的动态场景

Gonzalo Gomez-Nogales, Yicong Hong, Chongjian Ge, Peiye Zhuang, Marc Comino-Trinidad, Dan Casas, Yi Zhou

机构 * Universidad Rey Juan Carlos Móstoles, Spain(西班牙雷昂卡洛斯·莫斯特oles大学) Adobe Research San Jose, USA(美国Adobe研究圣地亚哥实验室) Roblox San Mateo, USA(美国Roblox圣马特奥实验室)

AI总结 本文提出C2R框架,通过粗略3D模拟生成真实风格的城市人群视频,利用神经网络生成真实外观和动态,解决粗模拟与真实视频数据配对不足的问题。

Comments Project website at https://gonzalognogales.github.io/coarse2real/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08420 2026-05-13 cs.LG stat.ML

Regret minimization in Linear Bandits with offline data via extended D-optimal exploration

通过扩展D-最优探索实现线性老虎机中离线数据的后悔最小化

Sushant Vijayan, Arun Suggala, Karthikeyan Shanmugam, Soumyabrata Pal

机构 * School of Technology and Computer Science TIFR(技术与计算机科学学院 TIFR) Google Deepmind(谷歌DeepMind) Adobe Research(Adobe 研究)

AI总结 本文提出OOPE算法,利用扩展D-最优设计结合离线数据以降低在线老虎机的后悔,其有效问题维度衡量离线数据中未探索方向的数量,并在高维情况下进一步优化复杂度。

Comments Accepted to TMLR, with J2C certification, link: https://openreview.net/forum?id=4WcK8gKgCi

详情

展开后加载摘要…

URL PDF HTML 收藏