RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills
RubricsTree: 面向个人健康代理在健康记忆与医疗技能上的可扩展且不断演进的开放式评估
Weizhi Zhang, Zechen Li, Hamid Palangi, Ben Graef, A. Ali Heydari, Simon A. Lee, Salman Rahman, Ray Luo, Zeinab Esmaeilpour, Erik Schenck, Chloe Zhang, Yamin Li, Menglian Zhou, Philip S. Yu, Daniel McDuff, Lindsey Sunden, Mark Malhotra, Shwetak Patel, Ahmed A. Metwally
机构
*
Google Research(谷歌研究院)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset
IMPACTeen:青少年沟通数据集中的意图、操纵、说服、标注与后果
Aleksander Szczęsny, Wiktoria Mieleszczenko-Kowszewicz, Maciej Markiewicz, Beata Bajcar, Tomasz Adamczyk, Jolanta Babiak, Grzegorz Chodak, Przemysław Kazienko
机构
*
Wrocław University of Science and Technology(弗罗茨瓦夫理工大学)
The Faithfulness Gap: Certifying Semantic Equivalence Between Natural-Language and Formal Mathematical Statements
忠实性差距:认证自然语言与形式数学语句之间的语义等价性
Noor Islam S. Mohammad, Tamim Sheikh
机构
*
Department of Computer Science, Informatics Institute, Istanbul Technical University, İstanbul, Türkiye(信息学院计算机科学系,伊斯坦布尔技术大学,伊斯坦布尔,土耳其)
;
Department of Computer Science(计算机科学系)
;
Engineering, Jashore University of Science(工程系,贾沙尔大学科学学院)
PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino
PACUTE: 面向菲律宾语的音韵、词缀和字符级词元理解
Jann Railey Montalan, David Demitri Africa, Jimson Paulo Layacan, Richell Isaiah Flores, Ivan Yuri De Leon, Lance Calvin Gamboa
机构
*
AI Singapore(AI新加坡)
;
Nanyang Technological University(南洋理工大学)
;
UK AI Security Institute(英国人工智能安全研究所)
;
Ateneo de Manila University(马尼拉雅典耀大学)
;
University of Birmingham(伯明翰大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility
AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化
Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
Purdue University(普渡大学)
;
University of Ljubljana(卢布尔雅那大学)
;
University of Washington(华盛顿大学)
;
Oasis Labs
;
University of Maryland(马里兰大学)
;
IBM Research(IBM研究院)
;
Mila
;
McGill University(麦吉尔大学)
;
ServiceNow Research(ServiceNow研究院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
National Institute of Standards and Technology(美国国家标准与技术研究院)
;
The Ohio State University(俄亥俄州立大学)
;
University of Cambridge(剑桥大学)
;
University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准
Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
DAMO Academy, Alibaba Group(阿里巴巴达摩院)
;
Hupan Lab(湖畔实验室)
;
Zhejiang University(浙江大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation
激活引导引发突现失调:一项更全面的评估
Qi Cao, Jian Lou, Meiting Liu, Wenjie Feng, Dan Li, See-Kiong Ng, Anh Tuan Luu
机构
*
Nanyang Technological University(南洋理工大学)
;
Sun Yat-sen University(中山大学)
;
University of Science and Technology of China(中国科学技术大学)
;
National University of Singapore(新加坡国立大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions
CrowdMath: 众包数学研究讨论数据集
Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky
机构
*
University of Massachusetts Lowell(马萨诸塞大学洛文分校)
;
San Jose State University(圣何塞州立大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
Dartmouth College(达特茅斯学院)
;
Amazon AGI(亚马逊人工智能研究院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Cross-View Feature Matching: Survey, Benchmarking, and Foundation-Model Perspectives
跨视图特征匹配:综述、基准测试与基础模型视角
Songlin Du, Xiaoyong Lu, Zeyu Wu, Xiaobo Lu, Guobao Xiao, Bin Fan, Jiayi Ma, Takeshi Ikenaga
机构
*
School of Automation, Southeast University(东南大学自动化学院)
;
School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
;
Institute of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能研究院)
;
School of Robotics, Wuhan University(武汉大学机器人学院)
;
Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究科)
CommentsThis manuscript goes beyond a conventional survey. It proposes a new taxonomy for cross-view feature matching, provides extensive benchmarking under unified datasets and protocols, and offers original analysis from the perspective of vision foundation models. These contributions provide substantive methodological synthesis, empirical findings, and new research insights