arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-09-01 至 2026-09-01 共收录 5
2608.30724 2026-09-01 cs.LG cs.AI 新提交

BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks

BAITBENCH:通过植入ML任务中的可选捷径测量智能体的奖励黑客行为

Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs, Julian Moncarz, Kaustubh Kislay, Juan J. Vazquez

机构 * National University of Singapore(新加坡国立大学) MIT(麻省理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Toronto(多伦多大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Arb Research(Arb研究机构)

AI总结 BAITBENCH是含三个合成表格型ML任务的基准,用于测量智能体利用可选捷径获得虚高分的奖励黑客行为,实验显示57.1%的运行存在该行为,发布相关资源作为缓解措施评估测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30188 2026-09-01 cs.CL 新提交

GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

GPAgentBench-2K:复杂临床动作空间中的大语言模型智能体基准测试

Boqi Chen, Xudong Liu, Yunke Ao, Heejin Do, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Toronto(多伦多大学)

AI总结 该研究推出首个面向初级保健临床决策的CMDP LLM智能体基准GPAgentBench-2K,评估16种LLM时发现其存在临床质量-安全差距,且C-GRPO建模约束仍未达临床安全要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29514 2026-09-01 cs.RO 新提交

A Sliding Window Filter on the Galilean Group for Consistent Aided Inertial Navigation with Unknown Measurement Delays

适用于伽利略群的滑动窗口滤波器:处理未知测量延迟的一致辅助惯性导航

Jonathan Kelly

机构 * Vector Institute(向量研究所) University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所)

AI总结 针对辅助惯性导航中辅助测量的未知恒定延迟问题,提出基于伽利略群的滑动窗口滤波器,联合估计延迟与导航状态,仿真表明该滤波器可显著提升估计一致性。

Comments Accepted to the IEEE International Conference on Multisensor Fusion and Integration (MFI), Pilsen, Czechia, Sep 2-4, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28787 2026-09-01 cs.CV 新提交

Beyond Representation Learning: A Systematic Study of Joint-Embedding Predictive Generation for 3D Brain MRI

超越表示学习:针对3D脑部MRI的联合嵌入预测生成的系统研究

Meng Zhou, Wenhao You, Yuxing Chen, Yueying Tian

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Alberta(阿尔伯塔大学) University of Sussex(萨塞克斯大学)

AI总结 本研究提出适配3D脑部MRI的Med-D-JEPA模型,在生成质量、分类与分割任务上均优于或相当基线,证明联合嵌入预测生成可用于3D医学图像合成。

Comments Preprint, code will be released after review

详情

展开后加载摘要…

URL PDF HTML 收藏