arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2601.15436 2026-01-27 cs.AI cs.CL cs.CY 87%

Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models

并非典型的阿谀者:在大语言模型中阿谀行为的 elusive 性

Shahar Ben Natan, Oren Tsur

机构 * Ben Gurion University(本· Gurion 大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种评估大语言模型阿谀倾向的方法,发现阿谀行为与最近性偏见相互作用,导致建设性干扰效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18785 2026-01-27 cs.HC cs.AI cs.CL 86%

Design Techniques for LLM-Powered Interactive Storytelling: A Case Study of the Dramamancer System

基于LLM的交互叙事设计技术:Dramamancer系统的案例研究

Tiffany Wang, Yuqian Sun, Yi Wang, Melissa Roemmele, John Joon Young Chung, Max Kreminski

机构 * Midjourney

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Dramamancer系统利用LLM将作者创建的故事架构转化为玩家驱动的交互叙事,探讨了相关设计技术和评估方法。

Comments Extended abstract presented at the 2025 Wordplay Workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04663 2026-01-27 cs.CL cs.LG cs.MA 86%

Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation

辩论、 deliberative、决定(D3):一种成本意识的对抗框架,用于可靠且可解释的LLM评估

Abir Harrasse, Chaithanya Bandi, Hari Bandi

机构 * Martian NUS(新加坡国立大学) MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 D3是一种通过结构化辩论和聚合机制提升LLM评估可靠性和可解释性的对抗框架,通过预算停止机制优化成本效率。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 85%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18630 2026-01-27 cs.AI cs.HC 85%

Assessing the Quality of Mental Health Support in LLM Responses through Multi-Attribute Human Evaluation

通过多属性人类评估评估LLM响应中的心理健康支持质量

Abeer Badawi, Md Tahmid Rahman Laskar, Elahe Rahimi, Sheri Grach, Lindsay Bertrand, Lames Danok, Frank Rudzicz, Jimmy Huang, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过多属性人类评估方法,评估LLM在心理健康对话中的响应质量,揭示LLMs在认知可靠性与情感一致性方面的差异,并倡导以治疗敏感性为核心的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01289 2026-01-27 cs.AI cs.GR 85%

OntoMetric: An Ontology-Driven LLM-Assisted Framework for Automated ESG Metric Knowledge Graph Generation

OntoMetric: 一种基于本体的LLM辅助框架,用于自动化生成ESG指标知识图谱

Mingqin Yu, Fethi Rabhi, Boming Xia, Zhengyi Yang, Felix Tan, Qinghua Lu

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Sciences, Engineering and Technology, The University of Adelaide(阿德莱德大学科学、工程与技术学院) School of Information Systems and Technology Management, University of New South Wales(新南威尔士大学信息系统与技术管理学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OntoMetric通过基于本体的LLM辅助框架,实现了从监管文件中自动化生成ESG指标知识图谱,显著提升语义准确性和模式合规性,同时降低成本并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17348 2026-01-27 cs.AI 85%

Auditing Disability Representation in Vision-Language Models

对视觉-语言模型中残障人表示的审计

Srikant Panda, Sourabh Singh Yadav, Palkesh Malviya

机构 * Lam Research

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在残障人表示上的表现,通过引入残障情境化提示和评估框架,发现残障情境会降低模型解释忠实度,并提出针对性提示和微调方法来改善模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17010 2026-01-27 cs.LG stat.AP 85%

Optimizing the Landscape of LLM Embeddings with Dynamic Exploratory Graph Analysis for Generative Psychometrics: A Monte Carlo Study

通过动态探索图分析优化LLM嵌入景观:生成心理测量学的蒙特卡洛研究

Hudson Golino

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过动态探索图分析优化LLM嵌入景观,发现嵌入深度与项目池大小相关,需基于加权复合标准进行优化以平衡准确性和组织性。

Comments 18 pages, 6 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17817 2026-01-27 cs.CR cs.NI 85%

Multi-Agent Collaborative Intrusion Detection for Low-Altitude Economy IoT: An LLM-Enhanced Agentic AI Framework

多智能体协作入侵检测用于低空经济物联网:一种基于大语言模型的智能AI框架

Hongjuan Li, Hui Kang, Jiahui Li, Geng Sun, Ruichen Zhang, Jiacheng Wang, Dusit Niyato, Wei Ni, Abbas Jamalipour

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的多智能体协作入侵检测框架,用于提升低空经济物联网的安全性能,实验显示其在多个数据集上达到90%以上的分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17540 2026-01-27 cs.CY 85%

Ethical Risk Assessment of the Data Harnessing Process of LLM supported on Consensus of Well-known Multi-Ethical Frameworks

基于知名多伦理框架共识的LLM数据获取过程伦理风险评估

Javed I. Khan, Sharmila Rahman Prithula

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于多伦理框架共识的伦理风险评分系统,用于量化评估AI系统数据获取过程的伦理完整性,促进负责任的大语言模型发展。

Journal ref Proceedings of the 38th Canadian Conference on Artificial Intelligence, 2025, Calgary, Canada. Retrieved from https://caiac.pubpub.org/pub/s50xrmxh

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26136 2026-01-27 cs.CL 83%

CliniBench: A Clinical Outcome Prediction Benchmark for Generative and Encoder-Based Language Models

CliniBench: 一种用于生成式和编码器型语言模型的临床结果预测基准

Paul Grundmann, Dennis Fast, Jan Frick, Thomas Steffek, Felix Gers, Wolfgang Nejdl, Alexander Löser

机构 * DATEXIS, Berlin University of Applied Sciences, Berlin, Germany(德累斯顿应用技术大学DATEXIS机构,柏林,德国) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 CliniBench通过比较编码器型分类器和生成式LLMs在医疗诊断预测中的表现,揭示编码器型分类器的优越性及检索增强策略对生成式模型的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 83%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18951 2026-01-27 cs.DB cs.AI 83%

SWE-SQL: Illuminating LLM Pathways to Solve User SQL Issues in Real-World Applications

SWE-SQL:揭示LLM解决现实应用中用户SQL问题的路径

Jinyang Li, Xiaolong Li, Ge Qu, Per Jacobsson, Bowen Qin, Binyuan Hui, Shuzheng Si, Nan Huo, Xiaohan Xu, Yue Zhang, Ziwei Tang, Yuanshuai Li, Florensia Widjaja, Xintong Zhu, Feige Zhou, Yongfeng Huang, Yannis Papakonstantinou, Fatma Ozcan, Chenhao Ma, Reynold Cheng

机构 * HKU STAR Lab(香港大学STAR实验室) Google Cloud(谷歌云) CUHKSZ(香港中文大学) CUHK(香港中文大学) THU(清华大学) The BIRD Team(BIRD团队)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SWE-SQL通过引入BIRD-CRITIC基准和Six-Gym训练环境,提升开源模型解决SQL问题的能力,实现对复杂SQL调试任务的突破。

Comments 29 pages, 10 figures, NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11908 2026-01-27 cs.RO 82%

Safe Learning for Contact-Rich Robot Tasks: A Survey from Classical Learning-Based Methods to Safe Foundation Models

接触丰富机器人任务的安全学习:从经典学习方法到安全基础模型的综述

Heng Zhang, Rui Dai, Gokhan Solak, Pokuang Zhou, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genova, Italy(人类-机器人接口与交互实验室,意大利技术研究院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目(DRIM)和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN, USA(工业工程埃德华森学校,普渡大学,西拉法伊斯,美国)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract)

AI总结 本文综述了接触丰富机器人任务的安全学习方法,探讨了从经典学习方法到安全基础模型的发展,分析了安全探索与执行的关键技术及未来方向。

Comments version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04192 2026-01-27 cs.CV 82%

PixFoundation: Are We Heading in the Right Direction with Pixel-level Vision Foundation Models?

PixFoundation: 我们在像素级视觉基础模型的方向正确吗?

Mennatullah Siam

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract)

AI总结 PixFoundation提出新的基准测试,揭示像素级基础模型在视觉问答中的不足,并提出可解释性工具分析接地机制。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16387 2026-01-27 cs.CL cs.AI cs.SD eess.AS 81%

Probing the Hidden Talent of ASR Foundation Models for L2 English Oral Assessment

探测ASR基础模型在二语英语口语评估中的隐藏潜能

Fu-An Chao, Bi-Cheng Yan, Berlin Chen

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过探测Whisper模型的隐藏能力,展示了其在二语英语口语评估中的潜力,通过轻量级分类器和辅助线索提升性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18250 2026-01-27 cs.CV cs.AI 79%

A multimodal vision foundation model for generalizable knee pathology

一种用于通用膝部病理的多模态视觉基础模型

Kang Yu, Dingyu Wang, Zimu Yuan, Nan Zhou, Jiajun Liu, Jiaxin Liu, Shanggui Liu, Yaoyan Zheng, Huishu Yuan, Di Huang, Dong Jiang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 OrthoFoundation是一种多模态视觉基础模型,通过自监督学习在膝关节影像上实现高泛化能力,提升骨科影像诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17728 2026-01-27 cs.CL 79%

Unsupervised Elicitation of Moral Values from Language Models

无监督从语言模型中提取道德价值观

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

机构 * University of Zurich(苏黎世大学) IPM(伊朗高等教育科学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17705 2026-01-27 cs.CL 79%

Distance-to-Distance Ratio: A Similarity Measure for Sentences Based on Rate of Change in LLM Embeddings

句子间的距离比:基于LLM嵌入变化率的相似性度量

Abdullah Qureshi, Kenneth Rice, Alexander Wolpert

机构 * DataKnife Roosevelt University(罗思希尔大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出距离比(DDR)作为衡量句子相似性的新方法,通过分析LLM嵌入变化率来评估上下文对语义的影响,实验表明其在区分语义相似与不相似文本方面表现更优。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17692 2026-01-27 cs.IR cs.CL 79%

LegalMALR:Multi-Agent Query Understanding and LLM-Based Reranking for Chinese Statute Retrieval

LegalMALR:多代理查询理解与基于大语言模型的重排序法用于中文法律条文检索

Yunhan Li, Mingjie Xie, Gaoli Kang, Zihan Gong, Gengshen Wu, Min Yang

机构 * Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所) Chinese Academy of Sciences(中国科学院) Southern University of Science and Technology(南方科技大学) Artificial Intelligence Research Institute(人工智能研究院) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 LegalMALR通过多代理查询理解和大语言模型重排序技术,提升中文法律条文检索的准确性和适用性。

Comments 31pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17301 2026-01-27 cs.LG 79%

Tabular Foundation Models are Strong Graph Anomaly Detectors

表格基础模型是强大的图异常检测器

Yunhui Liu, Tieke He, Yongchao Liu, Can Yi, Hong Jin, Chuntao Hong

机构 * State Key Laboratory for Novel Software Technology Nanjing University Nanjing China(新型软件技术国家重点实验室 南京大学 南京 中国) State Key Laboratory for Novel Software Technology Nanjing University(新型软件技术国家重点实验室 南京大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出TFM4GAD,利用表格基础模型解决图异常检测问题,通过增强特征表和上下文学习提升跨领域泛化能力。

Comments Accepted by WWW 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07110 2026-01-27 cs.CL cs.AI cs.CY 79%

The Need for a Socially-Grounded Persona Framework for User Simulation

用户模拟中需要基于社会的个性框架

Pranav Narayanan Venkit, Yu Li, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SCOPE框架,通过社会心理学协议构建更高质量的个性,提升大语言模型在社会模拟中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02567 2026-01-27 cs.AI cs.LG 79%

Agentic Additive Manufacturing Alloy Evaluation

代理式增材制造合金评估

Peter Pak, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用LLM赋能的多代理系统,自动化加速增材制造合金的评估,通过智能工具调用实现热物理性质计算和工艺窗口分析。

Journal ref Additive Manufacturing Letters, Vol. 17, January 2026, Article 100355

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18989 2026-01-27 cs.CV 78%

Ask Me Again Differently: GRAS for Measuring Bias in Vision Language Models on Gender, Race, Age, and Skin Tone

再次提问:GRAS用于测量视觉语言模型在性别、种族、年龄和肤色上的偏见

Shaivi Malik, Hasnat Md Abdullah, Sriparna Saha, Amit Sheth

机构 * Guru Gobind Singh Indraprastha University(古鲁·戈宾德·辛格印度教普拉斯塔大学) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Patna, India(印度理工学院帕纳布分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 GRAS用于评估视觉语言模型在性别、种族、年龄和肤色上的偏见,通过基准测试揭示了模型的偏见水平,并提出了可解释的偏见评分方法。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10157 2026-01-27 cs.SE 78%

On the synchronization between Hugging Face pre-trained language models and their upstream GitHub repository

Hugging Face预训练语言模型与其上游GitHub仓库之间的同步研究

Adekunle Ajibode, Abdul Ali Bangash, Oussama Ben Sghaier, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究Hugging Face预训练语言模型与GitHub仓库之间的同步问题,发现不同平台的贡献者关注点差异及同步模式,揭示跨平台发布实践中的结构性断开。

Comments Revised version incorporating substantial changes following peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05742 2026-01-27 eess.IV cs.CV 78%

Whole Slide Concepts: A Supervised Foundation Model For Pathological Images

整张切片概念:一种用于病理图像的监督基础模型

Till Nicke, Daniela Schacherer, Jan Raphael Schäfer, Natalia Artysh, Antje Prasse, André Homeyer, Andrea Schenk, Henning Höfener, Johannes Lotz

机构 * Institute for Digital Medicine MEVIS(数字医学MEVIS研究所) Fraunhofer(弗劳恩霍夫) Institute for Toxicology and Experimental Medicine(毒理学与实验医学研究所) Institute for Diagnostic and Interventional Radiology(诊断与介入放射学研究所) Hannover Medical School(汉诺威医学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出了一种基于监督学习的多任务基础模型,用于病理图像分析,整合癌症亚型分类、风险估计和基因突变预测,且在资源消耗上优于自监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11178 2026-01-27 cs.CV cs.CY 78%

BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models

BLEnD-Vis: 评估视觉语言模型在多模态文化理解中的基准测试

Bryan Chen Zhengyu Tan, Zheng Weihua, Zhengyuan Liu, Nancy F. Chen, Hwaran Lee, Kenny Tsu Wei Choo, Roy Ka-Wei Lee

专题命中 评测与基准 :language model(title,abstract)

AI总结 BLEnD-Vis通过多模态文化基准测试评估视觉语言模型在语言重述和视觉模态下的文化理解稳健性,揭示当前模型在文化知识上的脆弱性,并指导更文化胜任的模型发展。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06515 2026-01-27 cs.CV 78%

BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok

BigTokDetect: 一种临床指导的视觉-语言建模框架,用于检测TikTok上促进大肌肉畸形行为的视频

Minh Duc Chu, Kshitij Pawar, Zihao He, Roxanna Sharifi, Ross Sonnenblick, Magdalayna Curry, Laura D'Adamo, Lindsay Young, Stuart B Murray, Kristina Lerman

机构 * USC Information Sciences Institute(USC信息科学研究所) Keck School of Medicine, USC(USC凯克医学院) Department of Clinical Psychology, Drexel University(德雷塞尔大学临床心理学系) Department of Psychiatry and Biobehavioral Sciences, UCLA(UCLA精神病学与生物行为科学系)

专题命中 评测与基准 :language model(title,abstract)

AI总结 BigTokDetect通过临床指导的视觉-语言模型,检测TikTok上促进大肌肉畸形行为的视频,建立了可扩展的有害内容缓解框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07974 2026-01-27 cs.CL 77%

Explaining Generalization of AI-Generated Text Detectors Through Linguistic Analysis

通过语言分析解释AI生成文本检测器的泛化行为

Yuxi Xia, Kinga Stańczak, Benjamin Roth

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文通过语言分析研究AI生成文本检测器的泛化行为,发现其性能与动词时态和代词频率等语言特征密切相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14545 2026-01-27 cs.CL 77%

Controlling Language Difficulty in Dialogues with Linguistic Features

通过语言特征控制对话中的语言难度

Shuyao Xu, Wenguang Wang, Handong Gao, Wei Kang, Long Qin, Weizhi Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过语言特征控制对话中语言难度的框架,利用可读性、句法和词汇特征提升语言生成的可控性和质量。

Comments 15 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏