arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-24 至 2026-02-24 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 63 篇

2602.20117 2026-02-24 cs.AI cs.LG 62%

ReSyn: Autonomously Scaling Synthetic Environments for Reasoning Models

ReSyn:自主扩展合成环境以增强推理模型

Andre He, Nathaniel Weir, Kaj Bostrom, Allen Nie, Darion Cassel, Sam Bayless, Huzefa Rangwala

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 ReSyn通过生成多样化推理环境,利用验证器监督和任务多样性提升推理语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19569 2026-02-24 cs.CL cs.AI 62%

Temporal-Aware Heterogeneous Graph Reasoning with Multi-View Fusion for Temporal Question Answering

具有多视角融合的时序感知异构图推理用于时序问答

Wuzhenghong Wen, Bowen Zhou, Jinwen Huang, Xianjie Wu, Yuwei Sun, Su Pan, Liang Li, Jianting Liu

机构 * 1 School of Internet of Things, Nanjing University of Posts Telecommunications 2 Faculty of Medicine \& Health, University of New South Wales, Sydney, Australia 3 Dept. of Biomedical Engineering \& Biotechnology, Khalifa University, Abu Dhabi 4 Beijing Information Science Technology University 5 Shortest Path Technology Co., Ltd.

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种时序感知异构图推理框架,通过多视角融合提升时序问答的准确性和效率。

Comments 6pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17053 2026-02-24 cs.AI cs.CL 62%

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试

Yunseok Han, Yejoon Lee, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。

Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15940 2026-02-24 cs.LG cs.AI 62%

Lean Finder: Semantic Search for Mathlib That Understands User Intents

Lean Finder: 用于Mathlib的语义搜索,能理解用户意图

Jialin Lu, Kye Emond, Kaiyu Yang, Swarat Chaudhuri, Weiran Sun, Wuyang Chen

机构 * Simon Fraser University(西蒙·弗雷泽大学) University of Waterloo(滑铁卢大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Lean Finder通过语义搜索和用户意图理解,提升了数学家在Lean和mathlib中的搜索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20119 2026-02-24 cs.RO cs.AI cs.CV 57%

NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning

NovaPlan: 通过闭环视频语言规划实现零样本长周期操控

Jiahui Fu, Junyu Nan, Lingfeng Sun, Hongyu Li, Jianing Qian, Jennifer L. Barry, Kris Kitani, George Konidaris

机构 * Robotics and AI Institute(机器人与人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) Brown University(布朗大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 NovaPlan通过闭环视频语言规划实现零样本长周期操控,结合高层任务分解与底层物理执行,无需先验演示即可完成复杂装配任务。

Comments 25 pages, 15 figures. Project webpage: https://nova-plan.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19980 2026-02-24 cs.LG 57%

Discrete Diffusion Models Exploit Asymmetry to Solve Lookahead Planning Tasks

离散扩散模型利用不对称性解决前瞻规划任务

Itamar Trainin, Shauli Ravfogel, Omri Abend, Amir Feder

机构 * Hebrew University of Jerusalem(耶路撒冷希伯来大学) New York University(纽约大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 离散扩散模型通过反向生成机制在无需复杂遍历机制的情况下解决前瞻规划任务,相比自回归模型更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19372 2026-02-24 cs.RO cs.CV cs.LG 57%

Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization

看得更远且更聪明:基于价值引导的多路径反射用于VLM策略优化

Yanting Yang, Shenyuan Gao, Qingwen Bu, Li Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本研究提出了一种基于价值引导的多路径反射方法,用于提升VLM在机器人操作任务中的策略优化性能,通过解耦状态评估与动作生成,提高决策鲁棒性并减少推理时间。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19357 2026-02-24 cs.CV cs.LG 57%

MentalBlackboard: Evaluating Spatial Visualization via Mathematical Transformations

MentalBlackboard: 通过数学变换评估空间可视化能力

Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 MentalBlackboard通过数学变换评估模型的空间可视化能力,揭示其在预测和规划任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19193 2026-02-24 cs.RO cs.AI 57%

Visual Prompt Guided Unified Pushing Policy

基于视觉提示的统一推送策略

Hieu Bui, Ziyan Gao, Yuya Hosoda, Joo-Ho Lee

机构 * Graduate School of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程研究生院) Japan Advanced Institute of Science and Technology (JAIST)(日本先进科学研究院) College of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程学院)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出一种基于视觉提示的统一推送策略,通过整合轻量级提示机制提升多模态推送动作的生成效率,适用于广泛规划问题,并在桌面清洁任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19187 2026-02-24 cs.LG 57%

Adaptive Problem Generation via Symbolic Representations

通过符号表示实现自适应问题生成

Teresa Yeo, Myeongho Jeon, Dulaj Weerakoon, Rui Qiao, Alok Prakash, Armando Solar-Lezama, Archan Misra

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联盟研究技术) Massachusetts Institute of Technology(麻省理工学院) Singapore Management University(新加坡管理大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文提出通过符号表示生成自适应问题,以提升小型语言模型在数学任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21896 2026-02-24 cs.AI 57%

GenesisGeo: Technical Report

GenesisGeo:技术报告

Minfeng Zhu, Zi Wang, Sizhe Ji, Zhengtong Du, Shengqiang Tai, Junming Ke, Xiao Deng, Zanlang Yin, Xiuqi Huang, Heyu Wang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Polytechnic Institute, Zhejiang University(浙江大学多科大学院) Hangzhou Research Institute of AI and Holographic Technology(杭州人工智能与全息技术研究 institutes) Volkswagen Group Innovation(大众集团创新) School of Mathematical Science, Zhejiang University(浙江大学数学科学学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出GenesisGeo-1M数据集及基于多任务学习的几何学习框架,通过大规模合成数据提升模型在几何推理任务中的性能,实现金牌级表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18824 2026-02-24 cs.SI cs.AI 57%

UniRank: A Multi-Agent Calibration Pipeline for Estimating University Rankings from Anonymized Bibliometric Signals

UniRank:一种多智能体校准流程,用于从匿名化的引文计量信号中估算大学排名

Pedram Riyazimehr, Seyyed Ehsan Mahmoudi

机构 * NotionWave

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 UniRank通过多智能体校准流程,利用匿名化引文数据估算大学排名,实现零记忆误差和高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14979 2026-02-24 cs.CV cs.AI 57%

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

从像素到词语 -- 向大规模原生视觉-语言原始语义迈进

Haiwen Diao, Mingxuan Li, Silei Wu, Linjun Dai, Xiaohua Wang, Hanming Deng, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。

Comments 21 pages, 8 figures, Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19308 2026-02-24 cs.RO cs.CV 50%

WildOS: Open-Vocabulary Object Search in the Wild

WildOS: 野外环境中的开放词汇物体搜索

Hardik Shah, Erica Tevere, Deegan Atha, Marcel Kaufmann, Shehryar Khattak, Manthan Patel, Marco Hutter, Jonas Frey, Patrick Spieler

机构 * Jet Propulsion Laboratory(喷气推进实验室) California Institute of Technology(加州理工学院) Swiss Federal Institute of Technology(瑞士联邦理工学院) ETH Zürich(苏黎世联邦理工学院) FieldAI Inc.(FieldAI公司) Stanford University(斯坦福大学) University of California Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 WildOS通过结合安全几何探索与语义视觉推理,实现野外环境中的开放词汇物体搜索,显著提升导航效率和自主性。

Comments 28 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16949 2026-02-24 cs.CY 50%

How should AI knowledge be governed? Epistemic authority, structural transparency, and the case for open cognitive graphs

AI知识应该如何被治理?知识权威、结构透明性与开放认知图的案例

Chao Li, Chunyi Zhao, Yuru Wang, Yi Hu

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出开放认知图作为教育AI治理框架,通过结构透明和知识权威管理,实现教育AI与民主问责的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 82 篇

2602.18583 2026-02-24 cs.CL cs.AI cs.LG 91%

Luna-2: Scalable Single-Token Evaluation with Small Language Models

Luna-2:基于小语言模型的可扩展单令牌评估

Vatsal Goel, Rishon Dsouza, Nikhil Ega, Amey Ramesh Rambatla, Rob Friel, Shuai Shao, Yash Sheth

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17433 2026-02-24 cs.CY 90%

Preserving Historical Truth: Detecting Historical Revisionism in Large Language Models

守护历史真实:检测大语言模型中的历史修正主义

Francesco Ortu, Joeun Yook, Punya Syon Pandey, Keenan Samway, Bernhard Schölkopf, Alberto Cazzaniga, Rada Mihalcea, Zhijing Jin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 该研究提出HistoricalMisinfo数据集,用于评估大语言模型在面对历史修正主义请求时的鲁棒性及事实准确性。

Comments Accepted at IASEAI 2026, non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18935 2026-02-24 cs.DL cs.SE 89%

Responsible Intelligence in Practice: A Fairness Audit of Open Large Language Models for Library Reference Services

实践中的负责任智能:开放大型语言模型在图书馆参考服务中的公平性审计

Haining Wang, Jason Clark, Angelica Peña

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了三个开源大型语言模型在图书馆参考服务中的公平性,发现无显著种族差异,但存在轻微性别差异,强调持续监测的重要性。

Comments Invited chapter for the edited volume Artificial Intelligence and Social Justice Intersections in Library and Information Studies: Challenges and Opportunities (Emerald Group Publishing, in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19006 2026-02-24 cs.AI quant-ph 88%

Evaluating Large Language Models on Quantum Mechanics: A Comparative Study Across Diverse Models and Tasks

评估大型语言模型在量子力学中的表现:跨多样模型和任务的比较研究

S. K. Rithvik

机构 * Quantum Science and Technology Laboratory, Physical Research Laboratory, Navrangpura, Ahmedabad 380009, India(量子科学与技术实验室,物理研究实验室,Ahmedabad) Indian Institute of Technology Gandhinagar, Palaj, Gandhinagar 382055, India(印度理工学院冈达塞瓦尔)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了不同大型语言模型在量子力学问题上的表现,揭示了模型层级、任务难度及工具增强效果的差异,提供了可重复的基准和性能分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20137 2026-02-24 cs.CV 88%

Do Large Language Models Understand Data Visualization Rules?

大语言模型理解数据可视化规则吗?

Martin Sinnona, Valentin Bonas, Emmanuel Iarussi, Viviana Siless

机构 * Universidad Torcuato Di Tella(托科托迪特拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了大语言模型在数据可视化规则检测中的性能,发现其在基本规则上表现良好,但在复杂规则上存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20084 2026-02-24 cs.CV 88%

Do Large Language Models Understand Data Visualization Principles?

大语言模型理解数据可视化原则吗?

Martin Sinnona, Valentin Bonas, Viviana Siless, Emmanuel Iarussi

机构 * Universidad Torcuato Di Tella(托科托迪泰拉大学) Consejo Nacional de Investigaciones Científicas y Técnicas(阿根廷国家科学与技术研究院) Universidad de Buenos Aires(布宜诺斯艾利斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文首次系统评估大语言模型和视觉-语言模型在推理数据可视化原则方面的能力,通过严格验证数据揭示了模型在检测和纠正可视化违规方面的表现及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19294 2026-02-24 cs.SE 88%

Towards Automated Page Object Generation for Web Testing using Large Language Models

基于大语言模型的网页测试用例自动生成方法

Betül Karagöz, Filippo Ricca, Matteo Biagiola, Andrea Stocco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了利用大语言模型自动生成网页测试用例页面对象的可行性,通过实证分析展示了其在准确性与元素识别率上的表现。

Comments In proceedings of the 19th IEEE International Conference on Software Testing, Verification and Validation 2026 (ICST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19073 2026-02-24 cs.CE 88%

Evaluation and Benchmarking Suite for Financial Large Language Models and Agents

金融大语言模型与代理的评估与基准测试套件

Shengyuan Lin, Kaiwen He, Jaisal Patel, Qinchuan Zhang, Chris Ding, James Tang, Keyi Wang, Yupeng Cao, Yan Wang, Kairong Xiao, Vincent Caldeira, Matt White, Xiao-Yang Liu Yanglet

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出了一套评估和基准测试套件,用于评估和比较金融大语言模型与代理,促进更稳健的FinAI生态系统。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18928 2026-02-24 cs.SE 88%

Narrowing the Complexity Gap in the Evaluation of Large Language Models

缩小大型语言模型评估中的复杂性差距

Yang Chen, Shuyang Liu, Reyhaneh Jabbarvand

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 GeneBench通过增加编程基准的复杂性,揭示了LLMs在真实世界任务中的表现下降,证明了其评估的挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11915 2026-02-24 cs.CL cs.AI cs.LG 87%

CORE: Measuring Multi-Agent LLM Interaction Quality under Game-Theoretic Pressures

CORE: 在博弈论压力下评估多智能体大语言模型交互质量

Punya Syon Pandey, Yongjin Yang, Jiarui Liu, Zhijing Jin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE通过量化多智能体LLM在不同博弈压力下的语言使用效果,揭示社会激励对语言适应的影响,并提供评估对话鲁棒性的指标。

Comments EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-02-24 cs.DB cs.AI cs.CL cs.SE 86%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19643 2026-02-24 cs.CL 85%

KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge

KGHaluBench: 一种基于知识图谱的幻觉基准测试,用于评估大语言模型知识的广度和深度

Alex Robertson, Huizhi Liang, Mahbub Gani, Rohit Kumar, Srijith Rajamohan

机构 * School of Computing, Newcastle University(计算学院,新castle大学) Sage Ai, Sage Group PLC(Sage Ai,Sage集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KGHaluBench通过基于知识图谱的基准测试,评估大语言模型在知识广度和深度上的表现,提供更全面的真相评估方法。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18891 2026-02-24 cs.CY cs.AI cs.HC 85%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18479 2026-02-24 physics.chem-ph cs.AI cs.DL 85%

AgentCAT: An LLM Agent for Extracting and Analyzing Catalytic Reaction Data from Chemical Engineering Literature

AgentCAT: 一种用于从化学工程文献中提取和分析催化反应数据的LLM代理

Wei Yang, Zihao Liu, Tao Tan, Xiao Hu, Hong Xie, Lulu Li Xin Li, Jianyu Han, Defu Lian, Mao Ye

机构 * University of Science and Technology of China(科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) National Engineering Research Center of Lower-Carbon Catalysis Technology(低碳催化技术国家工程研究中心) Dalian Institute of Chemical Physics, Chinese Academy of Sciences(化学物理研究所,中国科学院) IFLYTEK CO.LTD(IFLYTEK有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentCAT是一种用于从化学工程文献中提取和分析催化反应数据的LLM代理,通过形式化抽象和挑战分析,解决了复杂依赖结构下的数据提取问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11962 2026-02-24 cs.HC cs.CY 85%

Wisdom of the LLM Crowd: A Large Scale Benchmark of Multi-Label U.S. Election-Related Harmful Social Media Content

LLM群体的智慧:多标签美国大选相关有害社交媒体内容的大规模基准测试

Qile Wang, Prerana Khatiwada, Carolina Coimbra Vieira, Benjamin E. Bagozzi, Kenneth E. Barner, Matthew Louis Mauriello

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过LLM群体智慧方法,构建了包含10万条美国大选相关有害社交媒体内容的多标签数据集,验证了LLM在分类任务中的有效性,并分析了人类标注者背景对标注行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏