arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-09-01 至 2026-09-01 共收录 13
2608.30724 2026-09-01 cs.LG cs.AI 新提交

BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks

BAITBENCH:通过植入ML任务中的可选捷径测量智能体的奖励黑客行为

Pradyumna Shyama Prasad, Meiri Anto, Leon Eshuijs, Julian Moncarz, Kaustubh Kislay, Juan J. Vazquez

机构 * National University of Singapore(新加坡国立大学) MIT(麻省理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Toronto(多伦多大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Arb Research(Arb研究机构)

AI总结 BAITBENCH是含三个合成表格型ML任务的基准,用于测量智能体利用可选捷径获得虚高分的奖励黑客行为,实验显示57.1%的运行存在该行为,发布相关资源作为缓解措施评估测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30475 2026-09-01 cs.CL cs.AI 新提交

ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation

ImageEval 2026:基于文化语境的阿拉伯语多模态评估

Samir Abdaljalil, Hunzalah Hassan Bhatti, Ahlam Bashiti, Farina Amir, Md Arid Hasan, Basel Mousi, Nadir Durrani, Fahim Dalvi, Zien Sheikh Ali, Erchin Serpedin, Hasan Kurban, Mustafa Jarrar, Shammur Absar Chowdhury, Firoj Alam

机构 * Texas A&M University(德克萨斯农工大学) Qatar Computing Research Institute(卡塔尔计算研究所) Birzeit University(比尔宰特大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学) University of Toronto(多伦多大学)

AI总结 ImageEval 2026共享任务含AynVQA和CRAI-Bench两项阿拉伯语多模态评估任务,14支团队参与,相关资源已发布,凸显文化语境多模态评估的挑战。

Comments Arabic LLMs, Multilingual, Multimodal, Shared Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30188 2026-09-01 cs.CL 新提交

GPAgentBench-2K: Benchmarking Large Language Model Agents in Complex Clinical Action Space

GPAgentBench-2K:复杂临床动作空间中的大语言模型智能体基准测试

Boqi Chen, Xudong Liu, Yunke Ao, Heejin Do, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Toronto(多伦多大学)

AI总结 该研究推出首个面向初级保健临床决策的CMDP LLM智能体基准GPAgentBench-2K,评估16种LLM时发现其存在临床质量-安全差距,且C-GRPO建模约束仍未达临床安全要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29514 2026-09-01 cs.RO 新提交

A Sliding Window Filter on the Galilean Group for Consistent Aided Inertial Navigation with Unknown Measurement Delays

适用于伽利略群的滑动窗口滤波器:处理未知测量延迟的一致辅助惯性导航

Jonathan Kelly

机构 * Vector Institute(向量研究所) University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所)

AI总结 针对辅助惯性导航中辅助测量的未知恒定延迟问题,提出基于伽利略群的滑动窗口滤波器,联合估计延迟与导航状态,仿真表明该滤波器可显著提升估计一致性。

Comments Accepted to the IEEE International Conference on Multisensor Fusion and Integration (MFI), Pilsen, Czechia, Sep 2-4, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28787 2026-09-01 cs.CV 新提交

Beyond Representation Learning: A Systematic Study of Joint-Embedding Predictive Generation for 3D Brain MRI

超越表示学习:针对3D脑部MRI的联合嵌入预测生成的系统研究

Meng Zhou, Wenhao You, Yuxing Chen, Yueying Tian

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Alberta(阿尔伯塔大学) University of Sussex(萨塞克斯大学)

AI总结 本研究提出适配3D脑部MRI的Med-D-JEPA模型,在生成质量、分类与分割任务上均优于或相当基线,证明联合嵌入预测生成可用于3D医学图像合成。

Comments Preprint, code will be released after review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20406 2026-09-01 cs.LG stat.AP 版本更新

Machine Learning and ARIMA Model Averaging for Adaptive Public Health Forecasting: Comparative Evaluation and an Ontario COVID-19 Case Study

机器学习与ARIMA模型平均法用于自适应公共卫生预测:比较评估及安大略省COVID-19案例研究

Yushu Zou, Ye Li, Johra Moosa, Martin Grunnill, Samir N. Patel, Venkata R. Duvvuri

机构 * Public Health Ontario(安大略省公共卫生局) Dalla Lana School of Public Health, University of Toronto(多伦多大学达拉·拉纳公共卫生学院) University of Toronto(多伦多大学) York University(约克大学)

AI总结 本研究评估ARIMA、随机森林、XGBoost模型,提出MLAMA集成方法,基于安大略省COVID-19数据验证其预测性能更优,支持按操作条件选择预测模型。

Comments This paper has been withdrawn by the author due to organizational policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14581 2026-09-01 cs.LG cs.AI 版本更新

CARE: Context-Aware Ranking Evolution with Executable Scoring Programs for Budgeted Reaction Optimization

CARE:通过科学实验中的可审计证据审查控制LLM生成的策略

Guanyu Liu, Weiyi Kong, Chao Tang, Zeyu Wang, Boer Zhang, Baiqing Li, Peiyu Zhang, Tianyu Shi

机构 * University of Macau(澳门大学) University of Toronto(多伦多大学) UCLA(加州大学洛杉矶分校) Harvard University(哈佛大学) XtalPi(晶泰科技) McGill University(麦吉尔大学)

AI总结 提出CARE框架,通过可审计的干预门控机制,在保留非LLM优化器作为默认路径的同时,利用LLM修正挑战者排序策略,显著提升高通量实验优化性能。

Comments 27 pages, 5 figures. Code: https://github.com/SHITIANYU-hue/care

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27995 2026-09-01 cs.AI 版本更新

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments https://github.com/StoKou/repo-asynctool

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15503 2026-09-01 cs.AR cs.DC cs.LG cs.PF 版本更新

DCC: Data-Centric Compilation of Machine Learning Kernels for Processing-In-Memory Architectures

DCC: 面向处理-内存架构的机器学习内核数据驱动编译

Peiming Yang, Sankeerth Durvasula, Ivan Fernandez, Mohammad Sadrosadati, Onur Mutlu, Gennady Pekhimenko, Christina Giannoula

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Barcelona Supercomputing Center(巴塞罗那超级计算中心) ETH Zürich(苏黎世联邦理工学院) Nvidia(英伟达) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

AI总结 针对PIM系统中数据重排与计算代码优化相互依赖的问题,提出数据驱动的编译器DCC,通过统一调优联合优化数据重排与计算代码,在HBM-PIM和AttAcc PIM上分别实现平均2.21倍和3.92倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27266 2026-09-01 cs.LG cond-mat.mtrl-sci 版本更新

AutoREC: A reinforcement learning platform for equivalent circuit model generation

AutoREC:一种用于从电化学阻抗谱数据开发强化学习代理以生成等效电路模型的软件平台

Ali Jaberi, Yonatan Kurniawan, Robert Black, Shayan Mousavi M., Kabir Verma, Zoya Sadighi, Santiago Miret, Jason Hattrick-Simpers

机构 * Clean Energy Innovation Research Center, National Research Council Canada(清洁能源创新研究中心,加拿大国家研究委员会) Department of Material Science and Engineering, University of Toronto(材料科学与工程系,多伦多大学) Cheriton School of Computer Science, University of Waterloo(计算机科学学院,滑铁卢大学)

AI总结 AutoREC通过将等效电路模型生成建模为马尔可夫决策过程中的序列决策问题,利用深度强化学习解决传统手动试错方法的局限性,实现了高成功率的自动等效电路模型生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23443 2026-09-01 cs.CL 版本更新

Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective

重新审视视觉问答中的贪婪解码:一种校准视角

Boqi Chen, Xudong Liu, Yunke Ao, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MBZUAI(穆桑比克人工智能研究所)

AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03654 2026-09-01 cs.CV cs.AI 版本更新

ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant

ReGraP-LLaVA:支持推理的基于图的个性化多模态大语言与视觉助手

Yifan Xiang, Zhenxi Zhang, Bin Li, Yixuan Weng, Bo Gao, Shoujun Zhou, Yangfan He, Yilin Yuan, Keqin Li

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Engineering, Westlake University(西湖大学工程学院) University of Minnesota – Twin Cities(明尼苏达大学双城分校) University of Toronto(多伦多大学)

AI总结 针对现有个性化多模态大语言模型忽略概念关联的局限,本文构建ReGraP数据集与基准,提出ReGraP-LLaVA模型,实现个性化关系推理,在对比基准中性能最优。

Comments accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏