机构
*
National University of Singapore(国立新加坡大学)
;
Yunnan University(云南大学)
;
The Ohio State University(俄亥俄州立大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
使用多片段视频破解多模态大语言模型
Choongwon Kang, Seungjong Sun, Hyunmin Jun, Jang Hyun Kim
机构
*
Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学)
;
Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
机构
*
National University of Singapore(新加坡国立大学)
;
Hefei University of Technology(合肥工业大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
ST Engineering Ltd.(ST工程有限公司)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.LG
Lessons from the Trenches on Reproducible Evaluation of Language Models
关于语言模型可重复评估的前线经验教训
Stella Biderman, Hailey Schoelkopf, Lintang Sutawika, Leo Gao, Jonathan Tow, Baber Abbasi, Alham Fikri Aji, Pawan Sasanka Ammanamanchi, Sidney Black, Jordan Clive, Anthony DiPofi, Julen Etxaniz, Benjamin Fattori, Jessica Zosa Forde, Charles Foster, Jeffrey Hsu, Mimansa Jaiswal, Wilson Y. Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A. Wang, Genta Indra Winata, François Yvon, Andy Zou
机构
*
MBZUAI
;
IIIT Hyderabad
;
EleutherAI
;
HiTZ Center - Ixa, UPV/EHU
;
Ivy Natal
;
University of Michigan
;
HubSpot
;
LibrAI
;
Kensho
;
Contextual AI
;
Brown University
;
New York University
;
Amazon
;
Yale University
;
HKUST
;
Sorbonne University
;
CMU
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
TimeSage-MT:用于评估智能时间序列推理的多轮基准测试
Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen
机构
*
University of Oxford(牛津大学)
;
VulpiVox Intelligence
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Griffith University(格里菲斯大学)
;
Squirrel Ai Learning
;
East China Normal University(华东师范大学)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems
POIROT: 在多智能体系统中审讯智能体以进行故障检测
Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal, J. M. Valverde-García, Annemarie F. Laudanski, Álvaro Gutiérrez, Eduardo Rocon, Manuel Cebrian
机构
*
Center for Automation and Robotics, Spanish National Research Council (CSIC-UPM)(自动化研究中心,西班牙国家科研 council (CSIC-UPM))
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Department of Biomedical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学生物医学工程系,深圳,中国)
;
School of Computer Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)计算机科学与工程学院,深圳,中国)
;
Omni-Intelligence, Shenzhen, China(奥米智能,深圳,中国)
;
Shenzhen Loop Area Institute, Shenzhen, China(深圳环城研究院,深圳,中国)
CARTE: A Benchmark for Mapping Language Model Knowledge Across France
CARTE:法国语言模型知识映射基准
Sarah Almeida Carneiro, Christos Xypolopoulos, Xiao Fei, Yang Zhang, Michalis Vazirgiannis
机构
*
École Polytechnique, Institut Polytechnique de Paris(巴黎政治学院)
;
National Technical University of Athens(雅典国家技术大学)
;
Mohamed bin Zayed University of Artificial Intelligence(姆阿扎德人工智能大学)
专题命中
评测与基准
:language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages
TukaBench: 一个基于文化的非洲语言越狱基准
Victor Akinode, Senyu Li, Wassim Hamidouche, Waqas Zamir, Inbal Becker-Reshef, David Ifeoluwa Adelani
机构
*
Mila - Quebec AI Institute(魁北克人工智能研究院)
;
McGill University(麦吉尔大学)
;
Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
PolySpeech-100:面向100多种语言和方言的大规模语音理解基准
Sicheng Yang, Shulan Ruan, Shiwei Wu, Yu Liu, Lu Fan, Zhi Li, You He
机构
*
Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)
;
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
JD AI Research(京东人工智能研究院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
A Foundation Model for Wearable Movement Data in Mental Health Research
心理健康研究中可穿戴运动数据的基础模型
Franklin Y. Ruan, Aiwei Zhang, Jenny Y. Oh, SouYoung Jin, Nicholas C. Jacobson
机构
*
Dartmouth College(达特茅斯学院)
;
National Institute of Diabetes and Digestive and Kidney Diseases(国家糖尿病、消化系统疾病和肾病研究所)
;
National Institutes of Health(美国国立卫生研究院)
;
Department of Computer Science at Dartmouth College(达特茅斯学院计算机科学系)
CommentsF. Y. Ruan, A. Zhang, J. Y. Oh, S. Jin and N. C. Jacobson, "A Foundation Model for Wearable Movement Data in Mental Health Research," in IEEE Journal of Biomedical and Health Informatics, doi: 10.1109/JBHI.2026.3694809