Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations
无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美
Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji
机构
*
University of California San Francisco(加州大学旧金山分校)
;
Waymark
;
University of Pennsylvania(宾夕法尼亚大学)
;
Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)
;
Stanford University(斯坦福大学)
机构
*
Department of Computer Science, Stanford University, Stanford, CA, USA(计算机科学系,斯坦福大学,斯坦福,加州,美国)
;
Department of Psychiatry and Behavioral Sciences, Stanford University, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学,斯坦福,加州,美国)
;
Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(生物医学数据科学系,斯坦福大学,斯坦福,加州,美国)
;
University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加州,美国)
;
The University of Hong Kong, Hong Kong(香港大学,香港)
MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems
MedMASLab:多模态医疗多智能体系统的统一协调框架
Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li
机构
*
National University of Singapore(新加坡国立大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
;
vivo
;
Stanford University(斯坦福大学)
Jillian Fisher, Shangbin Feng, Robert Aron, Thomas Richardson, Yejin Choi, Daniel W. Fisher, Jennifer Pan, Yulia Tsvetkov, Katharina Reinecke
机构
*
Department of Statistics, University of Washington(华盛顿大学统计学系)
;
Department of Computer Science, University of Washington(华盛顿大学计算机科学系)
;
Dallas, Texas(德克萨斯州达拉斯)
;
Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
;
Psychiatry and Behavioral Science, University of Washington(华盛顿大学精神病学与行为科学系)
;
Department of Communication, Stanford University(斯坦福大学传播学系)