YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese
YOMI-Bench:评估日语大语言模型汉字读音与音韵理解的基准
Ryota Mibayashi, Hiroya Takamura, Hitomi Yanaka
机构
*
Kobe University(神户大学)
;
National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所(AIST))
;
The University of Tokyo(东京大学)
;
RIKEN(理化学研究所)
;
Tohoku University(东北大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering
JL1-CC&QA:扩展JL1-CD基准,增加变化描述和问答
Ziyuan Liu, Ruifei Zhu, Ouqiao Ma, Yuantao Gu
机构
*
Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学电子工程系,北京信息科学与技术国家研究中心)
;
Chang Guang Satellite Technology Co., Ltd. (CGSTL)(长光卫星技术股份有限公司)
;
College of Communications Engineering, Army Engineering University of PLA(中国人民解放军陆军工程大学通信工程学院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
National University of Singapore(新加坡国立大学)
;
DAMO Academy, Alibaba Group(阿里巴巴达摩院)
;
University of California, Berkeley(加州大学伯克利分校)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Zhejiang University(浙江大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation
MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准
Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma
机构
*
The Pennsylvania State University(宾夕法尼亚州立大学)
;
Michigan State University(密歇根州立大学)
;
Dalian University of Technology(大连理工大学)
;
Stony Brook University(石溪大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity
STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准
Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Tencent Youtu Lab(腾讯优图实验室)
;
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
SHERLOC: Structured Diagnostic Localization for Code Repair Agents
SHERLOC: 代码修复智能体的结构化诊断定位
Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg
机构
*
NVIDIA(英伟达)
;
Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉)
;
TU Darmstadt(达姆施塔特工业大学)
;
National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)
SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment
SkillAudit:从固定套件基准测试到以技能为中心的评估
Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li
机构
*
Northeastern University(东北大学)
;
City University of Hong Kong(香港城市大学)
;
Northwestern University(西北大学)
;
Fudan University(复旦大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Santa Clara University(圣克拉拉大学)
;
Fenz AI
;
Ohio State University(俄亥俄州立大学)
;
University of Glasgow(格拉斯哥大学)
;
National University of Singapore(新加坡国立大学)
;
DeciLix Lab(DeciLix实验室)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement
PaperClaw:利用智能体实现自主研究与人在回路精炼
Weiwei Ye, Hangchen Liu, Dongyuan Li, Renhe Jiang
机构
*
Open scholarly indexes(开放学术索引)
;
Priem et al.(Priem 等)
;
Lo et al.(Lo 等)
;
Si et al.(Si 等)
;
Baek et al.(Baek 等)
;
Wang et al.(Wang 等)
;
Yang et al.(Yang 等)
;
Wei et al.(Wei 等)
;
Yao et al.(Yao 等)
;
Shinn et al.(Shinn 等)
;
Madaan et al.(Madaan 等)
;
Packer et al.(Packer 等)
;
Park et al.(Park 等)
;
Zhong et al.(Zhong 等)
;
Huang et al.(Huang 等)
;
Ji et al.(Ji 等)
;
Min et al.(Min 等)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI