SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
SimpleDevQA:在开发知识问答上评估大语言模型
专题命中 知识库问答 :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 SimpleDevQA是一个基于真实用户对话构建的多语言基准,用于评估大语言模型在开发知识问答任务中的表现,通过三阶段流程生成2740个问答对,发现代码LLM在该任务中表现更优。