Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior
量化数据影响与数据相似性之间的一致性以理解LLM行为
Christopher J. Anders, Henrique Da Silva Gameiro, Nico Daheim, Mohammad Emtiyaz Khan
机构
*
RIKEN Center for Advanced Intelligence Project, Tokyo, Japan(日本东京理化学研究所先进智能项目中心)
;
Section of Computer Science, EPFL Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机科学系)
;
Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室)
;
National Research Center for Applied Cybersecurity ATHENE, Germany(德国国家应用网络安全研究中心ATHENE)
;
TU Darmstadt & Hessian Center for AI (hessian.AI), Darmstadt, Germany(达姆施塔特工业大学与黑森州人工智能中心)
One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao
机构
*
Tsinghua University(清华大学)
;
SenseTime Research(商汤科技研究院)
;
Sun Yat-Sen University(中山大学)
;
Technical University of Munich(慕尼黑工业大学)
;
Heilbronn Data Science Center(海尔布隆数据科学中心)
;
Munich Data Institute(慕尼黑数据研究所)
专题命中
预训练与数据
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期
Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo
机构
*
Startlux(星创公司)
;
Tsinghua University(清华大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
The University of Hong Kong(香港大学)
;
University of Sydney(悉尼大学)
;
Columbia University(哥伦比亚大学)
专题命中
预训练与数据
:large language model(title);language model(title);pretraining(abstract);分类 cs.CL