arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2604.17102 2026-04-21 cs.AR cs.AI 86%

Configuration Over Selection: Hyperparameter Sensitivity Exceeds Model Differences in Open-Source LLMs for RTL Generation

配置胜过选择:在开源LLM用于RTL生成中,超参数敏感性超过模型差异

Minghao Shao, Zeng Wang, Weimin Fu, Xiaolong Guo, Johann Knechtel, Ozgur Sinanoglu, Ramesh Karri, Muhammad Shafique

机构 * NYU Tandon School of Engineering(纽约大学坦顿工程学院) NYU Abu Dhabi(纽约大学阿布扎比分校) Kansas State University(堪萨斯州立大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 研究通过对比26个开源LLM在VerilogEval和RTLLM上的表现,发现超参数配置对RTL生成效果影响显著,优于模型选择,揭示了配置优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16753 2026-04-21 cs.AI 86%

Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs

何时信任技能:单智能体LLM的延迟评估与认知警惕

Eren Unlu

机构 * Globeholder Paris, France(巴黎Globeholder机构)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MESA-S框架,通过延迟评估和认知警惕机制提升单智能体LLM的可靠性,减少供应链漏洞并防止自信膨胀。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16394 2026-04-21 cs.IR cs.AI 86%

A Reference Architecture for Agentic Hybrid Retrieval in Dataset Search

面向数据集搜索的代理混合检索参考架构

Riccardo Terrenzi, Phongsakon Mark Konrad, Tim Lukas Adam, Serkan Ayvaz

机构 * Centre for Industrial Software University of Southern Denmark(工业软件中心 欧洲南部大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合BM25和嵌入检索的代理混合检索架构,通过LLM代理规划查询并融合RRF算法,引入元数据增强减少语义偏差,分析单代理与多代理架构的权衡。

Comments 7 pages, 3 figures, accepted at SAML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05403 2026-04-21 cs.CL 86%

Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection

同一条主张,不同判断:多语言金融虚假信息检测中情境诱导偏见的基准测试

Zhiwei Liu, Yupen Cao, Yuechen Jiang, Mohsinul Kabir, Polydoros Giannouris, Chen Xu, Ziyang Xu, Tianlei Zhu, Md. Tariquzzaman, Triantafillos Papadopoulos, Yan Wang, Lingfei Qian, Xueqing Peng, Zhuohan Xie, Ye Yuan, Saeed Almheiri, Abdulrazzaq Alnajjar, Mingbin Chen, Harry Stuart, Paul Thompson, Prayag Tiwari, Alejandro Lopez-Lira, Xue Liu, Jimin Huang, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Stevens Institute of Technology(史蒂文斯理工学院) The Fin AI(Fin AI) Columbia University(哥伦比亚大学) Islamic University of Technology(伊斯兰科技大学) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿基米德,亚特兰蒂斯研究中心) MBZUAI McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Dubai Police(迪拜警察) University of Melbourne(墨尔本大学) Halmstad University(哈姆斯塔德大学) University of Florida(佛罗里达大学) ELLIS Manchester(曼彻斯特ELLIS)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MFMDScen基准,用于评估LLM在多语言金融虚假信息检测中的情境诱导偏见,通过构建三种复杂金融场景并整合虚假信息主张,系统评估22种主流LLM的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15415 2026-04-20 cs.CR cs.AI 86%

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

HarmfulSkillBench: 你的代理如何被有害技能所利用?

Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次研究了代理生态系统中的有害技能,发现4.93%的技能具有潜在危害,并构建了HarmfulSkillBench基准,评估六个LLM在有害技能下的表现,发现预装技能显著降低拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11978 2026-04-15 cs.AI 86%

The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break

长远任务的幻觉?诊断代理系统何时及为何失效

Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang, Wenjie Hu, Mya Schroder, Bilge Mutlu, Dawn Song, Robert D Nowak

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过HORIZON基准测试分析LLM代理在长周期任务中的失效模式,提出轨迹驱动的评估方法,并通过人类标注验证其有效性,为构建更可靠的代理系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09553 2026-04-14 cs.IR cs.AI 86%

SRBench: A Comprehensive Benchmark for Sequential Recommendation with Large Language Models

SRBench: 一个面向大型语言模型的序列推荐综合基准

Jianhong Li, Zeheng Qian, Wangze Ni, Haoyang Li, Hongwei Yao, Yang Bai, Kui Ren

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 SRBench通过多维框架、统一输入范式和新型提取机制,解决序列推荐模型评估中的公平性、稳定性与效率问题,揭示LLM-SR模型过度关注流行度而缺乏深度理解的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23523 2026-03-26 cs.CL cs.RO 86%

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

三维大语言模型真的能理解三维空间关系吗?

Xianzheng Ma, Tao Sun, Shuai Chen, Yash Bhalgat, Jindong Gu, Angel X Chang, Iro Armeni, Iro Laina, Songyou Peng, Victor Adrian Prisacariu

机构 * VGG(视觉信息组) University of Oxford(牛津大学) Stanford University(斯坦福大学) Simon Fraser University(西蒙弗雷泽大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11513 2026-03-13 cs.CL 86%

Can Small Language Models Use What They Retrieve? An Empirical Study of Retrieval Utilization Across Model Scale

小型语言模型能利用它们检索到的信息吗?不同模型规模下的检索利用经验研究

Sanchit Pandey

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL

AI总结 研究发现小型语言模型在检索信息时存在利用瓶颈,无法有效提取答案,且上下文干扰导致错误生成,表明RAG在小模型中效果有限。

Comments 10 pages, 5 figures, planning to submit to arr march 2026. Code and evaluation data: https://anonymous.4open.science/r/rag-utilization-study-C67F . Earlier draft preprint available on Zenodo: https://zenodo.org/records/18870116 (note: this arXiv submission is an updated draft)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14043 2026-02-17 cs.SI cs.AI 86%

Beyond Static Snapshots: Dynamic Modeling and Forecasting of Group-Level Value Evolution with Large Language Models

超越静态快照:利用大语言模型进行群体层面价值演变的动态建模与预测

Qiankun Pi, Guixin Su, Jinliang Li, Mayi Xu, Xin Miao, Jiawei Jiang, Ming Zhong, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型进行群体层面价值演变的动态建模与预测方法,通过整合历史价值轨迹和事件影响,提升了社会模拟的准确性与预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11939 2026-02-13 cs.CL 86%

Do Large Language Models Adapt to Language Variation across Socioeconomic Status?

大型语言模型是否在社会经济地位上适应语言变异?

Elisa Bassignana, Mike Zhang, Dirk Hovy, Amanda Cercas Curry

机构 * IT University of Copenhagen(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心) University of Copenhagen(哥本哈根大学) Bocconi University(博科尼大学) CENTAI Institute(CENTAI研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 研究发现大型语言模型在不同社会经济地位社区中适应语言风格有限,可能加剧语言层级差异并影响社会模拟研究的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02182 2026-02-13 cs.CL 86%

Evaluating Metalinguistic Knowledge in Large Language Models across the World's Languages

在世界各语言中评估大型语言模型的元语言知识

Tjaša Arčon, Matej Klemen, Marko Robnik-Šikonja, Kaja Dobrovoljc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院) University of Ljubljana, Faculty of Arts(卢布尔雅那大学艺术学院) Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本研究通过跨语言评估揭示LLM在元语言知识上的局限性,发现其表现受数据可用性和语言资源影响,而非广泛语法能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03551 2026-02-04 cs.CL 86%

Assessing the Impact of Typological Features on Multilingual Machine Translation in the Age of Large Language Models

评估大规模语言模型时代语言类型特征对多语言机器翻译的影响

Vitalii Hirak, Jaap Jumelet, Arianna Bisazza

机构 * Data & Knowledge Engineering, Heinrich Heine University(海因里希·海因大学数据与知识工程系) Center for Language and Cognition (CLCG), University of Groningen(格罗宁根大学语言与认知中心)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文研究了语言类型特征对多语言机器翻译质量的影响,通过分析两种先进模型发现目标语言类型显著影响翻译效果,并提出了细粒度的语言类型属性以促进进一步研究。

Comments 19 pages, 11 figures, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08734 2026-01-29 cs.CL 86%

NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context

NurValues: 临床情境下大型语言模型护理价值观的现实评估

Ben Yao, Qiuchi Li, Yazhou Zhang, Siyu Yang, Bohan Zhang, Prayag Tiwari, Jing Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Copenhagen(哥本哈根大学) Tianjin University(天津大学) Tongji Hospital of Tongji Medical College of Huazhong University of Science and Technology(华中科技大学同济医学院同济医院) Beijing University of Chinese Medicine(北京中医药大学) Halmstad University(哈马尔大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 NurValues通过首个护理价值对齐基准,评估LLMs在临床情境中是否符合护理核心价值观,发现通用LLMs在公正维度表现最差。

Comments 39 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19267 2026-01-28 cs.CL 86%

DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models

DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型

Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title);language model(title);SFT(abstract);分类 cs.CL

AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。

Comments Project webpage: https://diadem-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06596 2026-01-13 cs.CR cs.AI 86%

Are LLMs Vulnerable to Preference-Undermining Attacks (PUA)? A Factorial Analysis Methodology for Diagnosing the Trade-off between Preference Alignment and Real-World Validity

大型语言模型是否易受偏好削弱攻击(PUA)攻击?一种诊断偏好对齐与现实有效性之间权衡的因子分析方法

Hongjun An, Yiliang Song, Jiangan Chen, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics, Northwestern Polytechnical University(人工智能学院、光学与电子学院、西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) School of Economics and Management, Guangxi Normal University(经济管理学院,广西师范大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出了一种因子分析方法,用于诊断LLM在偏好对齐与现实有效性之间的权衡,揭示了高级模型可能更易受操纵性提示攻击,并强调了定制防御的重要性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23440 2025-12-30 cs.CL 86%

ClinDEF: A Dynamic Evaluation Framework for Large Language Models in Clinical Reasoning

ClinDEF: 一种用于大语言模型临床推理的动态评估框架

Yuqi Tang, Jing Yu, Zichang Su, Kehua Feng, Zhihui Zhu, Libin Wang, Lei Liang, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ZJU-UIUC Institute, Zhejiang University(浙江大学UIUC研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) AntGroup(蚂蚁集团)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 ClinDEF通过模拟诊断对话评估大语言模型的临床推理能力,利用疾病知识图谱生成病例并进行多轮交互,提供细粒度效率分析和诊断质量评估,揭示LLM在临床推理中的关键不足。

Comments 23 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21647 2025-12-30 cond-mat.mtrl-sci cs.LG 86%

Automated Machine Learning Pipeline: Large Language Models-Assisted Automated Dataset Generation for Training Machine-Learned Interatomic Potentials

自动化机器学习流水线:基于大语言模型的自动化数据集生成用于训练机器学习互作用势

Adam Lahouari, Jutta Rogal, Mark E. Tuckerman

机构 * NYU, Department of Chemistry(纽约大学化学系) Initiative for Computational Catalysis, Flatiron Institute(计算催化计划,Flatiron研究所) NYU, Department of Physics(纽约大学物理系) Courant Institute of Mathematical Sciences, NYU(数学科学学院,纽约大学) NYU-ECNU Center for Computational Chemistry(纽约大学-复旦大学计算化学中心) Simons Center for Computational Physical Chemistry, NYU(Simons计算物理化学中心,纽约大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的自动化机器学习流水线,用于生成训练数据集以提升机器学习互作用势的精度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00045 2025-12-02 cs.AR cs.AI 86%

Assessing Large Language Models in Generating RTL Design Specifications

评估大语言模型在生成RTL设计规范中的表现

Hung-Ming Huang, Yu-Hsin Yang, Fu-Chieh Chang, Yun-Chia Hsu, Yin-Yu Lin, Ming-Fang Tsai, Chun-Chih Yang, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(国立台湾大学通信工程研究所) MediaTek Inc, Hsinchu Taiwan(联发科技)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.AI

AI总结 本文评估了大语言模型在生成RTL设计规范中的性能,探讨了提示策略对规范质量的影响,并提出了评估指标,为自动化规范生成提供了基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14788 2025-11-20 cs.AI stat.AP 86%

Subnational Geocoding of Global Disasters Using Large Language Models

Michele Ronco, Damien Delforge, Wiebke S. Jäger, Christina Corbane

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15153 2025-11-13 cs.CL 86%

Evaluating Deep Unlearning in Large Language Models

Ruihan Wu, Chhavi Yadav, Russ Salakhutdinov, Kamalika Chaudhuri

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24014 2025-10-31 cs.CL 86%

TEXT2DB: Integration-Aware Information Extraction with Large Language Model Agents

Yizhu Jiao, Sha Li, Sizhe Zhou, Heng Ji, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments Source code: https://github.com/yzjiao/Text2DB

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06153 2025-10-20 cs.SE cs.CL 86%

What's Wrong with Your Code Generated by Large Language Models? An Extensive Study

Shihan Dou, Haoxiang Jia, Shenxi Wu, Huiyuan Zheng, Muling Wu, Yunbo Tao, Ming Zhang, Mingxu Chai, Jessica Fan, Zhiheng Xi, Rui Zheng, Yueming Wu, Ming Wen, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学) Peking University(北京大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Shanghai Qiji Zhifeng Co., Ltd.(上海启智风科技有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments Accepted by SCIENCE CHINA Information Sciences (SCIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13430 2025-10-17 cs.CL 86%

Evaluating Arabic Large Language Models: A Survey of Benchmarks, Methods, and Gaps

Ahmed Alzubaidi, Shaikha Alsuwaidi, Basma El Amel Boussaha, Leen AlQadi, Omar Alkaabi, Mohammed Alyafeai, Hamza Alobeidli, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07892 2025-10-10 cs.CL 86%

Metric Calculating Benchmark: Code-Verifiable Complicate Instruction Following Benchmark for Large Language Models

Hyeonseok Moon, Seongtae Hong, Jaehyung Seo, Heuiseok Lim

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments Accepted to the EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26128 2025-10-01 cs.AI 86%

MEDAKA: Construction of Biomedical Knowledge Graphs Using Large Language Models

Asmita Sengupta, David Antony Selby, Sebastian Josef Vollmer, Gerrit Großmann

机构 * Department of Data Science and its Applications, German Research Center for Artificial Intelligence (DFKI GmbH)(数据科学及其应用系,德国人工智能研究中心(DFKI GmbH)) Department of Computer Science, University of Kaiserslautern–Landau (RPTU)(计算机科学系,凯撒斯劳滕-兰道大学(RPTU))

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10572 2025-09-23 cs.SE cs.AI cs.DB 86%

Quality Assessment of Tabular Data using Large Language Models and Code Generation

Ashlesha Akella, Akshar Kaul, Krishnasuri Narayanam, Sameep Mehta

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16686 2025-09-23 cs.CL 86%

NILE: Internal Consistency Alignment in Large Language Models

Minda Hu, Qiyuan Zhang, Yufei Wang, Bowei He, Hongru Wang, Jingyan Zhou, Liangyou Li, Yasheng Wang, Chen Ma, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments This work has been accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18048 2025-08-26 cs.IR cs.AI 86%

HyST: LLM-Powered Hybrid Retrieval over Semi-Structured Tabular Data

Jiyoon Myung, Jihyeon Park, Joohyung Han

机构 * PrompTart LAB, MODULABS(PrompTart实验室,MODULABS)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

Comments Accepted at the 2nd EARL Workshop on Evaluating and Applying Recommender Systems with Large Language Models (RecSys 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21500 2025-08-26 cs.CL 86%

OpenHuEval: Evaluating Large Language Model on Hungarian Specifics

Haote Yang, Xingjian Wei, Jiang Wu, Noémi Ligeti-Nagy, Jiaxing Sun, Yinfan Wang, Zijian Győző Yang, Junyuan Gao, Jingchao Wang, Bowen Jiang, Shasha Wang, Nanjun Yu, Zihao Zhang, Shixin Hong, Hongwei Liu, Wei Li, Songyang Zhang, Dahua Lin, Lijun Wu, Gábor Prószéky, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) HUN-REN Hungarian Research Centre for Linguistics(匈牙利语言研究与研究中心) Wuhan University(武汉大学) Shanghai University(上海大学) University of Chinese Academy of Sciences(中国科学院大学) East China Normal University(华东师范大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) Chinese University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏