arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 210 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2601.20419 2026-01-29 cs.CV cs.AI 79%

Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models

让我们进行BiFTA:用于视觉语言模型中细粒度文本-视觉对齐的双 refinement

Yuhao Sun, Chengyi Cai, Jiacheng Zhang, Zesheng Ye, Xingliang Yuan, Feng Liu

机构 * School of Computing and Information Systems(计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 BiFTA通过视图和描述细化方法提升视觉语言模型中细粒度文本-视觉对齐的零样本性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11987 2026-01-29 cs.AI 79%

SimBench: A Framework for Evaluating and Diagnosing LLM-Based Digital-Twin Generation for Multi-Physics Simulation

SimBench:用于多物理仿真中基于LLM的数字孪生生成评估与诊断的框架

Jingquan Wang, Andrew Negrut, Hongyu Wang, Harry Zhang, Dan Negrut

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 SimBench是一个用于评估和诊断基于LLM的数字孪生生成能力的框架,适用于多物理仿真场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19935 2026-01-29 cs.CL cs.AI 79%

Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents

Mem2ActBench: 一个评估面向任务的自主代理长期记忆利用的基准

Yiting Shen, Kun Li, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Mem2ActBench是一个评估自主代理利用长期记忆执行任务能力的基准,通过合成工具使用任务验证记忆应用的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16669 2026-01-29 cs.CL cs.AI cs.CY 79%

PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

PLawBench: 一个基于规则的法律实践评估基准

Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang, Sen Yang, Wei Wang, Rongyao Shi, Yuanyang Qiu, Yuemeng Qi, Jingwen Zhang, Xiaoyu Sui, Yifan Chen, Yi Zhang, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Weixing Shen, Bing Zhao, Charles L. A. Clarke, Hu Wei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PLawBench通过现实法律任务评估LLM的法律推理能力,揭示其在细节处理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06052 2026-01-29 cs.AI 77%

DCP-Bench-Open: Evaluating LLMs for Constraint Modelling of Discrete Combinatorial Problems

DCP-Bench-Open:评估用于离散组合问题约束建模的LLM

Kostis Michailidis, Dimos Tsouros, Tias Guns

机构 * University of Western Macedonia(希腊西部大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DCP-Bench-Open通过引入多样化问题集评估LLM在约束建模中的能力,发现高级Python框架能显著提升性能,准确率达91%。

Comments This version is currently submitted and it is under review. For CP-Bench (the paper accepted at ECAI25), please refer to the previous version of this entry (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08862 2026-01-29 cs.LG cs.CR 77%

LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs

LLMStinger: 使用强化学习微调的LLM进行LLM劫持

Piyush Jha, Arnav Arora, Vijay Ganesh

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLMStinger通过强化学习微调LLM,生成对抗性后缀以提高对有害问题的攻击成功率,显著优于现有方法。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20617 2026-01-29 cs.CY cs.AI 77%

Agent Benchmarks Fail Public Sector Requirements

代理基准测试未能满足公共部门要求

Jonathan Rystrøm, Chris Schmitz, Karolina Korgul, Jan Batzner, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Centre for Digital Governance, Hertie School(数字治理中心) Weizenbaum Institute(魏泽瑙研究所) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。

Comments Forthcoming @ IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 77%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20102 2026-01-29 cs.CL 77%

Counterfactual Cultural Cues Reduce Medical QA Accuracy in LLMs: Identifier vs Context Effects

反事实文化线索降低大语言模型医学问答准确性:标识符效应与情境效应

Amirhossein Haji Mohammad Rezaei, Zahra Shakeri

机构 * Institute of Health Policy, Management, and Evaluation (IHPME)(健康政策、管理与评估研究所) Dalla Lana School of Public Health(达拉兰公共卫生学院) University of Toronto(多伦多大学) Faculty of Information(信息学院) Schwartz Reisman Institute(施瓦茨-雷曼研究所)

专题命中 评测与基准 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究通过反事实文化线索测试,发现文化相关信息显著降低大语言模型医学问答准确性,尤其在标识符与情境共同存在时影响最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19941 2026-01-29 cs.AR cs.AI cs.PL cs.SE 77%

Bench4HLS: End-to-End Evaluation of LLMs in High-Level Synthesis Code Generation

Bench4HLS: 面向端到端评估LLM在高层次综合代码生成中的表现

M Zafir Sadik Khan, Kimia Azar, Hadi Kamali

机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida(电子与计算机工程系,中央佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Bench4HLS通过提供结构化、可扩展的测试平台,评估LLM在高层次综合代码生成中的性能与优化能力。

Comments Accepted to the Design, Automation and Test in Europe Conference (DATE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19927 2026-01-29 cs.CL 77%

Attribution Techniques for Mitigating Hallucinated Information in RAG Systems: A Survey

缓解RAG系统中幻觉信息的归因技术:综述

Yuqing Zhao, Ziyao Liu, Yongsen Zheng, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了RAG系统中缓解幻觉的归因技术,通过分类幻觉类型、统一流程和比较优劣,为实际应用提供指导。

Journal ref The 8th International Conference on Artifcial Intelligence in Information and Communication (ICAIIC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16656 2026-01-29 cs.AI 77%

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

NUMINA:多维智能与数值推理能力的自然理解基准

Changyu Zeng, Yifan Wang, Zimu Wang, Wei Wang, Zhengni Yang, Muyi Bao, Jiming Xiao, Anh Nguyen, Yutao Yue

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进技术学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NUMINA是一个用于多维智能和数值推理能力的自然理解基准,通过多尺度注释和自动化注释流程提升多模态室内感知理解,揭示当前LLM在三维空间计算中的不足。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22575--22590

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10258 2026-01-29 cs.CV cs.MM 75%

XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark

XY-Cut++: 一种基于新型基准的分层遮罩机制的高级布局排序方法

Shuai Liu, Youmeng Li, Jizeng Wei

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 XY-Cut++通过分层遮罩机制在新型基准上实现高级布局排序,提升文档阅读顺序恢复的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14891 2026-01-29 cs.CL cs.AI 73%

LLMBind: A Unified Modality-Task Integration Framework

LLMBind:一种统一的模态-任务整合框架

Bin Zhu, Munan Ning, Peng Jin, Bin Lin, Jinfa Huang, Qi Song, Junwu Zhang, Zhenyu Tang, Mingjun Pan, Li Yuan

机构 * pku(北京大学) pcl(鹏城实验室) hkbu(香港 Baptist大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLMBind通过双路径机制和MoE架构,实现多模态任务的统一整合,提升任务扩展性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20618 2026-01-29 cs.CV cs.AI cs.CL 73%

GDCNet: Generative Discrepancy Comparison Network for Multimodal Sarcasm Detection

GDCNet:用于多模态讽刺检测的生成不一致比较网络

Shuguang Zhang, Junhong Lian, Guoxin Yu, Baoxun Xu, Xiang Ao

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所(ICT),中国科学院(CAS)) University of Chinese Academy of Sciences, CAS(中国科学院大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Stock Exchange(深圳证券交易所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GDCNet通过生成事实性图像描述和文本对比,提升多模态讽刺检测的准确性和鲁棒性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20276 2026-01-29 cs.CL cs.AI 73%

Beyond the Needle's Illusion: Decoupled Evaluation of Evidence Access and Use under Semantic Interference at 326M-Token Scale

超越针的错觉:在32600万token规模下解耦证据访问和使用下的语义干扰评估

Tianwei Lin, Zuyi Zhou, Xinda Zhao, Chenke Wang, Xiaohong Li, Yu Chen, Chuanrui Hu, Jian Pei, Yafeng Deng

机构 * EverMind Shanda Group(Shanda集团) Duke University(杜克大学)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMB-S基准,用于评估长上下文模型在大规模语义干扰下的证据访问与使用能力,揭示语义辨别是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20112 2026-01-29 cs.SE 71%

Usage, Effects and Requirements for AI Coding Assistants in the Enterprise: An Empirical Study

企业中AI编码助手的使用、影响与需求:一项实证研究

Maja Vukovic, Rangeet Pan, Tin Kam Ho, Rahul Krishna, Raju Pavuluri, Michele Merler

专题命中 评测与基准 :large language model(abstract,comments);language model(abstract,comments)

AI总结 本文通过实证研究探讨了企业中AI编码助手的使用情况、影响及需求,分析了其在软件工程流程中的作用及用户需求。

Comments To appear in the 3rd International Workshop on Large Language Models For Code, co-located at ICSE, Rio de Janeiro, Brazil, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20858 2026-01-29 cs.CL 70%

When Flores Bloomz Wrong: Cross-Direction Contamination in Machine Translation Evaluation

当Flores Bloomz出错:机器翻译评估中的跨方向污染

David Tan, Pinzhen Chen, Josef van Genabith, Koel Dutta Chowdhury

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现Bloomz在FLORES-200翻译基准中存在污染,且污染可跨方向影响翻译性能,通过替换命名实体可有效探测记忆现象。

Comments 5 pages of content, 15 total. 5 figures, 12 tables total. Accepted to EACL 2026 main conference. Code can be found here: github.com/Mr-Ao-25/cross-ling-contamination

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17536 2026-01-29 cs.CL 70%

Multimodal Conversation Structure Understanding

多模态对话结构理解

Kent K. Chang, Mackenzie Hanh Cramer, Anna Ho, Ti Ti Nguyen, Yilin Yuan, David Bamman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多模态对话结构理解任务及TV-MMPC数据集,揭示对话角色匿名化对模型性能的影响,并分析对话中性别角色的参与差异。

Comments accepted to EACL 2026 main conference; 22 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20705 2026-01-29 cs.CV cs.AI 70%

LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?

LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?

Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20412 2026-01-29 cs.CL cs.SE 70%

Beyond Accuracy: A Cognitive Load Framework for Mapping the Capability Boundaries of Tool-use Agents

超越准确率:一种认知负荷框架用于映射工具使用代理的能力边界

Qihao Wang, Yue Hu, Mingzhe Lu, Jiayue Wu, Yanbing Liu, Yuanmin Tang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种认知负荷框架,用于评估工具使用代理的能力边界,通过分解任务复杂性为内在负荷和额外负荷,揭示模型的真实能力限制。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20311 2026-01-29 cs.HC cs.AI 70%

DiagLink: A Dual-User Diagnostic Assistance System by Synergizing Experts with LLMs and Knowledge Graphs

DiagLink:通过融合专家与LLM和知识图谱的双用户诊断辅助系统

Zihan Zhou, Yinan Liu, Yuyang Xie, Bin Wang, Xiaochun Yang, Zezheng Feng

机构 * Northeastern University(东北大学) Northeastern University School of Computer Science(东北大学计算机科学学院) Northeastern University Software College(东北大学软件学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DiagLink通过融合LLM、知识图谱和专家,构建双用户诊断辅助系统,提升诊断效率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20105 2026-01-29 cs.CL 70%

FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language

FFE-Hallu:固定修辞表达中的幻觉:波斯语中的成语和谚语基准

Faezeh Hosseini, Mohammadali Yousefzadeh, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究 institute,Khatam 大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,德黑兰,伊朗)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FFE-Hallu是首个针对波斯语隐喻幻觉评估的基准,揭示了LLMs在处理隐喻语言方面的系统性弱点。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03001 2026-01-29 cs.CL 70%

LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation

LEGO-Eval: 向通过工具增强合成3D具身环境的细粒度评估迈进

Gyeom Hwangbo, Hyungjoo Chae, Minseok Kang, Hyeonjong Ju, Soohyun Oh, Jinyoung Yeo

机构 * Yonsei University(延世大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LEGO-Eval通过工具增强合成3D具身环境,提供细粒度评估框架和基准测试集,提升场景与指令对齐的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14398 2026-01-29 cs.CL 70%

YNTP-100: A Benchmark for Your Next Token Prediction with 100 People

YNTP-100: 一个用于下一步令牌预测的基准,包含100人

Shiyao Ding, Takayuki Ito

机构 * Kyoto University(京都大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 YNTP-100是一个包含100人的多语言对话基准,用于评估个性化响应生成的对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20623 2026-01-29 cs.IR 67%

When Vision Meets Texts in Listwise Reranking

当视觉与文本在列表级重排序中相遇

Hongyi Cai

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Rank-Nexus,一种轻量级多模态图像-文本文档重排序器,通过渐进跨模态训练策略提升重排序性能,适用于文本和图像重排序基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20196 2026-01-29 cs.CV 67%

Automated Marine Biofouling Assessment: Benchmarking Computer Vision and Multimodal LLMs on the Level of Fouling Scale

自动化海洋生物污损评估:基于生物污损等级的计算机视觉与多模态LLM对比分析

Brayden Hamilton, Tim Cashmore, Peter Driscoll, Trevor Gee, Henry Williams

机构 * Centre for Automation and Robotic Engineering Science(自动化与机器人工程科学中心) The University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract)

AI总结 本文通过对比计算机视觉与多模态LLM在生物污损等级评估中的表现,提出混合方法以实现可扩展且可解释的自动化评估。

Comments Australasian Conference on Robotics and Automation, ACRA2025 13 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19660 2026-01-29 cs.NI eess.SP 67%

Mixture of Experts for Decentralized Generative AI and Reinforcement Learning in Wireless Networks: A Comprehensive Survey

专家混合方法用于无线网络中的去中心化生成人工智能与强化学习:综述

Yunting Xu, Jiacheng Wang, Ruichen Zhang, Changyuan Zhao, Dusit Niyato, Jiawen Kang, Zehui Xiong, Bo Qian, Haibo Zhou, Shiwen Mao, Abbas Jamalipour, Xuemin Shen, Dong In Kim

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了专家混合方法在无线网络中的应用,探讨其在资源效率、可扩展性和适应性方面的潜力,并指出未来研究方向。

Comments Survey paper, 33 pages, 13 figures

Journal ref IEEE Communications Surveys & Tutorials, vol. 28, pp. 4051-4085, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20253 2026-01-29 cs.CL cs.AI 62%

Automated Benchmark Generation from Domain Guidelines Informed by Bloom's Taxonomy

基于布卢姆分类法的领域指南驱动的自动基准生成

Si Chen, Le Huy Khiem, Annalisa Szymanski, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, USA(诺丁汉大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 基于布卢姆分类法的自动基准生成框架,通过专家指南生成多选题和对话,评估模型在实践领域中的上下文推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19930 2026-01-29 cs.CL cs.AI 62%

SDUs DAISY: A Benchmark for Danish Culture

SDUs DAISY:文化传承的基准测试

Jacob Nielsen, Stine L. Beltoft, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 SDUs DAISY通过文化传承构建新基准,涵盖从古代考古到现代设计的丹麦文化主题,利用语言模型生成问题并人工审核,形成741对封闭式问题-答案对。

Comments Danish Culture Benchmark, 2 Tables, 1 Figure demonstrating the data curation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏