arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-21 至 2026-01-21 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 145 篇

2507.22936 2026-01-21 cs.CL cs.AI cs.CE cs.HC q-fin.CP 90%

Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis

评估大型语言模型(LLMs)在金融NLP中的表现:对财务报告分析的比较研究

Md Talha Mohsin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了五种基于transformer的LLMs在财务报告分析中的表现,发现模型在不同评估维度上表现各异,需考虑人类主观性和行为差异性。

Comments 23 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08464 2026-01-21 cs.CL cs.LG cs.SI 90%

Large Language Models Meet Stance Detection: A Survey of Tasks, Methods, Applications, Challenges and Future Directions

大语言模型与立场检测:任务、方法、应用、挑战与未来方向的综述

Lata Pangtey, Anukriti Bhatnagar, Shubhi Bansal, Shahid Shafi Dar, Nagendra Kumar

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT) Indore, Indore 453552, India(计算机科学与工程系,印度理工学院(IIT)印多尔,印多尔453552,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大语言模型在立场检测中的任务、方法、应用及挑战,提出分类框架并探讨未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02650 2026-01-21 cs.CL cs.AI 90%

Undesirable Memorization in Large Language Models: A Survey

大语言模型中的不良记忆现象:综述

Ali Satvaty, Suzan Verberne, Fatih Turkmen

机构 * University of Groningen(Groningen大学) Leiden University(莱顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型中记忆化现象的文献,探讨了其分类、度量方法、成因及缓解策略,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13882 2026-01-21 cs.CL 89%

OpenLearnLM Benchmark: A Unified Framework for Evaluating Knowledge, Skill, and Attitude in Educational Large Language Models

OpenLearnLM基准:一个评估教育大型语言模型知识、技能和态度的统一框架

Unggi Lee, Sookbun Lee, Heungsoo Choi, Jinseo Lee, Haeun Park, Younghoon Jeon, Sungmin Cho, Minju Kang, Junbo Koh, Jiyeong Bae, Minwoo Nam, Juyeon Eun, Yeonji Jung, Yeil Jeong

机构 * Chosun University(chosun大学) Korea University(韩国大学) Ewha Womans University(成均馆大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Seoul National University(首尔国立大学) Texas A&M University(德克萨斯农工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 OpenLearnLM基准通过统一框架评估教育大型语言模型的知识、技能和态度,揭示不同模型在多维度上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07238 2026-01-21 cs.CL 89%

When Benchmarks Age: Temporal Misalignment through Large Language Model Factuality Evaluation

当基准老化时:通过大型语言模型事实性评估进行时间错位

Xunyi Jiang, Dingyi Chang, Julian McAuley, Xin Xu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了评估基准随时间老化对LLM事实性评估的影响,通过分析五个基准和八种LLM,提出了一套新的指标和方法以量化基准老化问题。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12632 2026-01-21 cs.CL cs.IR 89%

BioPulse-QA: A Dynamic Biomedical Question-Answering Benchmark for Evaluating Factuality, Robustness, and Bias in Large Language Models

BioPulse-QA: 一个动态生物医学问答基准,用于评估大型语言模型的事实性、鲁棒性和偏见

Kriti Bhattarai, Vipina K. Keloth, Donald Wright, Andrew Loza, Yang Ren, Hua Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 BioPulse-QA是一个动态生物医学问答基准,用于评估大型语言模型在事实性、鲁棒性和偏见方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13118 2026-01-21 cs.SE 89%

Guidelines to Prompt Large Language Models for Code Generation: An Empirical Characterization

为大型语言模型生成代码的指南:实证分析

Alessandro Midolo, Alessandro Giagnorio, Fiorella Zampetti, Rosalia Tufano, Gabriele Bavota, Massimiliano Di Penta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过实证分析提出10条提示优化指南,帮助开发者改进代码生成提示,提升LLM辅助软件开发工具的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12132 2026-01-21 cs.CL cs.AI 88%

Bengali Text Classification: An Evaluation of Large Language Model Approaches

孟加拉语文本分类:大型语言模型方法的评估

Md Mahmudul Hoque, Md Mehedi Hassain, Md Hojaifa Tanvir, Rahul Nandy

机构 * Dept. of Computer Science \& Engineering, CCN University of Science

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在孟加拉语文本分类中的有效性,发现Qwen 2.5模型在体育类别中表现最佳,准确率达72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11776 2026-01-21 cs.CL cs.AI 88%

Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models

净化人工智能:一种用于大型语言模型的自反思净化框架

Kaituo Zhang, Zhimeng Jiang, Na Zou

机构 * University of Houston(休斯顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种自反思净化框架,利用LLMs自身能力检测并纠正有毒内容,提升文本生成的安全性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12560 2026-01-21 cs.AI cs.MA 88%

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

代理型人工智能(AI):架构、分类及大语言模型代理的评估

Arunkumar V, Gangadharan G. R., Rajkumar Buyya

机构 * University College of Engineering, Anna University(安娜大学工程学院) National Institute of Technology Tiruchirappalli(Tiruchirappalli 国家理工学院) School of Computing and Information Systems University of Melbourne(墨尔本大学计算机与信息系统学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了代理型人工智能的架构、分类及评估,提出统一分类框架,分析从线性推理到原生推理模型的转变,并指出未来研究方向以提升自主系统的可靠性。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12234 2026-01-21 cs.GR cs.AI cs.CV 88%

Proc3D: Procedural 3D Generation and Parametric Editing of 3D Shapes with Large Language Models

Proc3D: 基于大语言模型的3D形状过程生成与参数编辑

Fadlullah Raji, Stefano Petrangeli, Matheus Gadelha, Yu Shen, Uttaran Bhattacharya, Gang Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Proc3D利用大语言模型实现3D形状的可编辑生成,通过参数化编辑提升设计效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12087 2026-01-21 cs.SE 88%

TransLibEval: Demystify Large Language Models' Capability in Third-party Library-targeted Code Translation

TransLibEval: 解密大型语言模型在第三方库定向代码翻译中的能力

Pengyu Xue, Kunwu Zheng, Zhen Yang, Yifei Pei, Linhao Wu, Jiahui Dong, Xiapu Luo, Yan Xiao, Fei Liu, Yuxuan Zhang, Xiran Lyu, Xianhang Li, Xuanyu Zhu, Chengyi Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 TransLibEval首次构建了专注于第三方库导向代码翻译的基准测试,揭示LLM在处理TPL时的性能缺陷及改进方向。

Comments 24 pages, 5 figures, accepted by FSE 2026 (The ACM International Conference on the Foundations of Software Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11914 2026-01-21 cs.AI cs.CL cs.CR cs.IT cs.LG math.IT 87%

Forgetting-MarI: LLM Unlearning via Marginal Information Regularization

Forgetting-MarI: 通过边际信息正则化实现LLM反训练

Shizhou Xu, Yuan Ni, Stefan Broecker, Thomas Strohmer

机构 * Department of Mathematics, University of California Davis, USA(加州大学戴维斯分校数学系) SLAC National Accelerator Laboratory, Stanford University, USA(斯坦福大学SLAC国家加速器实验室) Department of Computer Science, University of California Davis, USA(加州大学戴维斯分校计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Forgetting-MarI通过边际信息正则化实现LLM反训练,有效移除冗余信息并保留关键知识,提升模型可控性和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13709 2026-01-21 cs.AI cs.CL cs.CY cs.HC cs.SI 87%

Hidden in Plain Text: Measuring LLM Deception Quality Against Human Baselines Using Social Deduction Games

隐藏在 plain 文本中:使用社会推断游戏测量 LLM 欺骗质量 against 人类基准

Christopher Kao, Vanshika Vats, James Davis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过社会推断游戏测量 LLM 欺骗能力,发现 LLM 在欺骗人类时表现更优,但其欺骗质量低于人类。

Comments For associated dataset, see https://github.com/cocochief4/llm-mafia. Published in IEEE ICA 2025, waiting for IEEEXplore proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13649 2026-01-21 cs.CL cs.AI 86%

Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge

公平性还是流畅性?对配对LLM-as-a-judge语言偏见的调查

Xiaolin Zhou, Zheng Luo, Yicheng Gao, Qixuan Chen, Xiyang Hu, Yue Zhao, Ruishan Liu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM-as-a-judge在配对任务中的语言偏见,发现不同语言在性能和偏好上有显著差异,且语言偏见不能仅由困惑度解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13537 2026-01-21 cs.CL cs.AI 86%

When Wording Steers the Evaluation: Framing Bias in LLM judges

当用词引导评估:在LLM评估中框架偏见的影响

Yerin Hwang, Dongryeol Lee, Taegwan Kang, Minwoo Lee, Kyomin Jung

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) LG AI Research(LG人工智能研究) SNU-LG AI Research Center(SNU-LG人工智能研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了LLM评估中框架偏见的影响,通过设计对称提示展示框架如何扭曲模型判断,强调需建立框架意识的评估协议。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01553 2026-01-21 cs.AI cs.CL 86%

MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills

MedQA-CS: 用于评估大语言模型临床技能的Objective Structured Clinical Examination (OSCE)风格基准

Zonghai Yao, Zihao Zhang, Chaolong Tang, Xingyu Bian, Youxia Zhao, Zhichao Yang, Junda Wang, Huixue Zhou, Won Seok Jang, Feiyun Ouyang, Hong Yu

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Emory University(埃默里大学) University of Minnesota(明尼苏达大学) University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校) UMass Chan Medical School(UMass Chan医学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedQA-CS是一种基于OSCE风格的基准,用于评估大语言模型的临床技能,通过模拟医学学生和评估者任务,提供更全面的评估方法。

Comments To appear in proceedings of the Main Conference of the European Chapter of the Association for Computational Linguistics (EACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11920 2026-01-21 cs.CL cs.AI 86%

Enhancing LLM-Based Data Annotation with Error Decomposition

通过错误分解增强基于LLM的数据标注

Zhen Xu, Vedant Khatri, Yijun Dai, Xiner Liu, Siyan Li, Xuanming Zhang, Renzhe Yu

机构 * Columbia University(哥伦比亚大学) University of California, Irvine(加州大学尔湾分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过错误分解增强基于LLM的数据标注,提出诊断评估范式以区分任务固有模糊性与模型不准确,提升标注质量评估的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11903 2026-01-21 cs.AI 86%

AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems

AEMA:可验证评估框架用于可信和受控的代理LLM系统

YenTing Lee, Keerthi Koneru, Zahra Moslemi, Sheethal Kumar, Ramesh Radhakrishnan

机构 * University of California, San Diego(加州大学圣地亚哥分校) Center for Advanced AI, Accenture(Accenture高级人工智能中心) University of California, Irvine(加州大学伊拉斯姆斯分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。

Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13658 2026-01-21 cs.CL 85%

Beyond Known Facts: Generating Unseen Temporal Knowledge to Address Data Contamination in LLM Evaluation

超越已知事实:生成未见的时间知识以应对LLM评估中的数据污染

Arthur Amalvy, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(中国科学院信息研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过生成未来未见的时间事实来构建无污染的评估数据集,以提升LLM在时间知识图谱提取任务中的评估准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13655 2026-01-21 cs.SE cs.AI cs.DC 85%

Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs

为何大语言模型停止计算:对开源大语言模型用户报告失败的实证研究

Guangba Yu, Zirui Wang, Yujie Huang, Renyi Zhong, Yuedong Zhong, Yilun Wang, Michael R. Lyu

机构 * The Chinese University of HongKong(香港中文大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过分析开源LLM的705个失败案例,揭示了部署堆栈的系统脆弱性,并提出提升LLM可靠性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13581 2026-01-21 cs.AI 85%

SCRIPTMIND: Crime Script Inference and Cognitive Evaluation for LLM-based Social Engineering Scam Detection System

SCRIPTMIND:基于LLM的社会工程诈骗检测系统的犯罪脚本推断与认知评估

Heedou Kim, Changsik Kim, Sanghwa Shin, Jaewoo Kang

机构 * Korea University(韩国大学) Korean National Police Agency(韩国国家警察局) Inje University(仁荷大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ScriptMind通过结合自动化推理与人类认知,提升LLM在社会工程诈骗检测中的准确性与用户认知意识

Comments This paper has been accepted to the EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07902 2026-01-21 cs.CL 85%

Tailored Emotional LLM-Supporter: Enhancing Cultural Sensitivity

定制情感LLM支持者:增强文化敏感性

Chen Cecilia Liu, Hiba Arnaout, Nils Kovačić, Dana Atzil-Slonim, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technische Universität Darmstadt(通用知识处理实验室(UKP实验室)计算机科学系和海斯曼人工智能中心(hessian.AI)德意志联邦人家电大学) Department of Psychology, Bar-Ilan University(心理学系,巴伊兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CultureCare数据集,通过四种适应策略提升LLMs的文化敏感性,并展示其在临床培训中的应用潜力。

Comments Joint first authors; EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23473 2026-01-21 cs.AI 85%

EVOREFUSE: Evolutionary Prompt Optimization for Evaluation and Mitigation of LLM Over-Refusal to Pseudo-Malicious Instructions

EVOREFUSE: 进化提示优化用于评估和缓解大语言模型对伪恶意指令的过度拒绝

Xiaorui Wu, Fei Li, Xiaofeng Mao, Xin Zhang, Li Zheng, Yuxiang Peng, Chong Teng, Donghong Ji, Zhuang Li

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、武汉大学计算机科学与工程学院) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) School of Computing Technologies, Royal Melbourne Institute of Technology(皇家墨尔本理工学院计算机技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EVOREFUSE通过进化算法生成多样化伪恶意指令,提升LLM对恶意指令的拒绝触发率并减少过度拒绝

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12951 2026-01-21 cs.SE cs.AI 85%

Beyond Accuracy: Characterizing Code Comprehension Capabilities in (Large) Language Models

超越准确性:在(大)语言模型中表征代码理解能力

Felix Mächtle, Jan-Niclas Serr, Nils Loose, Thomas Eisenbarth

机构 * ITS, University of Luebeck(ITS,吕贝克大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在代码理解能力上的表现,发现其与传统人类度量标准相关性低,而影子模型能捕捉更复杂的模式,强调需改进基准方法以更准确评估模型能力。

Comments Published in the Proceedings of DeepTest 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12744 2026-01-21 cs.AI cs.NI cs.SE 85%

Vision Language Models for Optimization-Driven Intent Processing in Autonomous Networks

面向自主网络的基于视觉语言模型的优化驱动意图处理

Tasnim Ahmed, Yifan Zhu, Salimur Choudhury

机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。

Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16272 2026-01-21 cs.SE cs.AI 85%

Beyond Blind Spots: Analytic Hints for Mitigating LLM-Based Evaluation Pitfalls

超越盲区:用于缓解基于LLM评估缺陷的分析提示

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Raviv Gal, Wesam Ibraheem, Rami Katan, Alice Podolsky

机构 * Ora Nova Fandina(奥拉诺瓦·法丁纳) Eitan Farchi(埃itan·法奇) Shmulik Froimovich(什mulik·弗罗伊米奇) Raviv Gal(拉维夫·加尔) Wesam Ibraheem(韦萨姆·伊布拉希姆) Rami Katan(拉米·卡坦) Alice Podolsky(艾丽斯·波德洛斯基)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种分析提示方法,通过结合LLM和分析检查器,提高代码评估的可靠性,减少LLM的盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11783 2026-01-21 cs.SE cs.CL 85%

The Stability Trap: Evaluating the Reliability of LLM-Based Instruction Adherence Auditing

稳定性陷阱:评估基于大语言模型的指令遵循审计的可靠性

Murtuza N. Shergadwala

机构 * Workday Inc.(Workday公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过引入有界指令分解框架,揭示了基于大语言模型的指令遵循审计中判决稳定性与推理稳定性之间的矛盾,提出需严格限定自动化评估协议以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11643 2026-01-21 cs.CY cs.AI 85%

Syllabic Agglutinative Tokenizations for Indonesian LLM: A Study from Gasing Literacy Learning System

基于音节粘合的印尼语LLM分词方法:来自Gasing识字学习系统的研究

H. Situngkir, A. B. Lumbantobing, Y. Surya

机构 * Bandung Fe Institute(巴杜安费学院) Fe Institute & AI Research Center IT Del(费学院及IT德尔人工智能研究中心) AI Research Center IT Del(IT德尔人工智能研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于音节的印尼语分词方法,结合教学与计算优化,提升分词效率与语言模型性能。

Comments 12 pages, 1 figures

Journal ref BFI Working Paper Series 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05080 2026-01-21 cs.CL 85%

An Architectural Advantage of The Instruction-Tuned LLM in Containing The Readability-Accuracy Tension in Text Simplification

指令调优LLM在文本简化中缓解可读性-准确性张力的优势

P. Bilha Githinji, Aikaterini Meilliou, Zeming Liang, Lian Zhang, Peiwu Qin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过比较指令调优和推理增强的LLM,发现指令调优在文本简化中能更有效平衡可读性与准确性,提升话语忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏