arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-29 至 2025-12-29 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 25 篇

2404.00287 2025-12-29 cs.SE cs.CR 90%

Evaluating Large Language Models for Line-Level Vulnerability Localization

评估大型语言模型在行级漏洞定位中的表现

Jian Zhang, Chong Wang, Anran Li, Weisong Sun, Cen Zhang, Wei Ma, Yang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文评估了大型语言模型在行级漏洞定位中的表现,发现判别微调在有充足训练数据时效果显著,而提示方法在低数据环境下更有效,同时提出了改进微调过程的策略。

Comments Accepted to TSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02455 2025-12-29 cs.CL cs.AI cs.CY 90%

An Exploration of Higher Education Course Evaluation by Large Language Models

大型语言模型在高等教育课程评估中的探索

Bo Yuan, Jiazi Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大型语言模型进行高等教育课程评估,发现微调和提示工程能显著提高评估准确性,LLM生成的反馈有助于教学改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03297 2025-12-29 cs.HC 89%

"It's the only thing I can trust": Envisioning Large Language Model Use by Autistic Workers for Communication Assistance

只有一件事我可信任:面向自闭症工作者的大型语言模型在沟通辅助中的应用展望

JiWoong Jang, Sanika Moharana, Patrick Carrington, Andrew Begel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨自闭症工作者在工作中使用LLM进行沟通辅助的现象,发现参与者更倾向LLM,但专家对其建议持质疑态度,提出需关注自闭症体验的设计考量。

Comments 19 pages, 6 figure, CHI '24 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21439 2025-12-29 cs.CL cs.AI cs.LG 89%

Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models

道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型

Geoffroy Morlat, Marceau Nahon, Augustin Chartouny, Raja Chatila, Ismael T. Freire, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。

Comments 11 pages, 5 figures, +24 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21347 2025-12-29 cs.SE 89%

Understanding the Role of Large Language Models in Software Engineering: Evidence from an Industry Survey

理解大型语言模型在软件工程中的作用:来自行业调查的证据

Vítor Mateus de Brito, Kleinner Farias

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过行业调查揭示大型语言模型在软件工程中的应用现状与影响,探讨其积极效果与潜在风险,提出需批判性使用LLM工具以提升开发效率与安全性。

Comments 4 Figures, 8 Tables, Text in Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21422 2025-12-29 cs.CL cs.AI 88%

Teaching People LLM's Errors and Getting it Right

教导人类LLM的错误并使其正确

Nathan Stringham, Fateme Hashemi Chaleshtori, Xinyuan Yan, Zhichao Xu, Bei Wang, Ana Marasović

机构 * University of Utah(犹他大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了如何通过教导人类LLM的错误模式来减少其过度依赖,发现教学效果依赖于更有效的自动失败发现方法和新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07413 2025-12-29 cs.CR cs.AI cs.LG 86%

Hybrid LLM-Enhanced Intrusion Detection for Zero-Day Threats in IoT Networks

混合LLM增强的物联网网络零日威胁入侵检测

Mohammad F. Al-Hammouri, Yazan Otoum, Rasha Atwa, Amiya Nayak

机构 * Dept. of Computer Engineering, The Hashemite University(计算机工程系,哈希米大学) School of Computer Science and Technology, Algoma University(计算机科学与技术学院,阿尔戈马大学) College of Computer Science and Engineering, University of Jeddah(计算机科学与工程学院,朱德赫大学) School of Electrical Engineering and Computer Science, University of Ottawa(电气工程与计算机科学学院,渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合传统签名检测与GPT-2语言模型的混合入侵检测框架,以提升物联网网络中零日威胁的检测准确率和减少误报。

Comments 6 pages, IEEE conference

Journal ref Proc. IEEE/ACIS International Conference on Software Engineering, Artificial Intelligence, Networking and Parallel/Distributed Computing (SNPD), 2025, pp. 864-869

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21309 2025-12-29 cs.MA 85%

A Plan Reuse Mechanism for LLM-Driven Agent

面向LLM驱动代理的计划重用机制

Guopeng Li, Ruiqi Wu, Haisheng Tan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AgentReuse机制,通过意图分类和语义相似性评估,实现LLM驱动代理计划重用,有效降低延迟,提升用户体验。

Comments This paper is an English version of A Plan Reuse Mechanism for LLM-Driven Agent published in 2024 in the Journal of Computer Research and Development

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20926 2025-12-29 cs.CG 85%

Uncovering Hierarchical Structure in LLM Embeddings with $δ$-Hyperbolicity, Ultrametricity, and Neighbor Joining

通过δ-超几何性、超度量性和邻接连接揭示LLM嵌入的层次结构

Prakash Chourasia, Sarwan Ali, Murray Patterson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过δ-超几何性、超度量性和邻接连接度量揭示LLM嵌入的层次结构,发现其超几何性和超度量性与机器学习任务性能相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21582 2025-12-29 cs.CV 85%

LLM-Free Image Captioning Evaluation in Reference-Flexible Settings

无需大型语言模型的图像描述评估在参考灵活设置中的应用

Shinnosuke Hirano, Yuiga Wada, Kazuki Matsuda, Seitaro Otsuki, Komei Sugiura

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Pearl是一种无需大型语言模型的图像描述评估指标,适用于基于参考和非参考设置,通过学习图像-描述和描述-描述相似性来提升评估性能。

Comments Accepted for presentation at AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13464 2025-12-29 cs.CL cs.AI 84%

Unveiling the Learning Mind of Language Models: A Cognitive Framework and Empirical Study

揭示语言模型的学习心智:一种认知框架与实证研究

Zhengyu Hu, Jianxun Lian, Zheyuan Xiao, Seraphina Zhang, Tianfu Wang, Nicholas Jing Yuan, Xing Xie, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) Microsoft Research Asia(微软亚洲研究院) University of Cambridge(剑桥大学) Microsoft(微软)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种认知框架,将学习能力分解为三个维度,并通过实证研究揭示LLMs在不同学习场景下的表现与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 81%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22100 2025-12-29 cs.CL cs.AI 79%

Introducing TrGLUE and SentiTurca: A Comprehensive Benchmark for Turkish General Language Understanding and Sentiment Analysis

引入TrGLUE和SentiTurca:土耳其通用语言理解与情感分析的综合基准

Duygu Altinok

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrGLUE和SentiTurca两个土耳其语综合基准,用于评估自然语言理解和情感分析能力,通过半自动化流程构建高质量数据集,支持研究人员进行模型微调和评估。

Comments under review by Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03688 2025-12-29 cs.CL cs.AI 79%

A Comparison of DeepSeek and Other LLMs

深度学习模型与其它LLM的比较

Tianchen Gao, Jiashun Jin, Zheng Tracy Ke, Gabriel Moryoussef

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了DeepSeek与其他LLM在作者分类和引用分类任务中的性能,发现DeepSeek在多数情况下表现优于其他模型,但成本较低。

Comments 30 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02519 2025-12-29 cs.AI cs.LG 79%

Creative Agents: Empowering Agents with Imagination for Creative Tasks

创意代理:通过想象力赋能代理以完成创意任务

Penglin Cai, Chi Zhang, Yuhui Fu, Haoqi Yuan, Zongqing Lu

机构 * School of Computer Science Peking University(北京大学计算机学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出通过增强想象力的创意代理,首次在Minecraft生存模式中实现多样化建筑创建,利用大语言模型和扩散模型提升创造力表现。

Comments The first two authors contribute equally

Journal ref Proceedings of the 41st Conference on Uncertainty in Artificial Intelligence (UAI 2025), PMLR 244:471-496

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21494 2025-12-29 cs.CL cs.AI 79%

Oogiri-Master: Benchmarking Humor Understanding via Oogiri

Oogiri-Master:通过Oogiri基准测试幽默理解

Soichiro Murakami, Hidetaka Kamigaito, Hiroya Takamura, Manabu Okumura

机构 * CyberAgent Nara Institute of Science and Technology(奈良科学技術大學)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 Oogiri-Master通过Oogiri基准测试,利用大量候选回应和独立评分机制,评估LLMs的幽默理解能力,并揭示语言因素与趣味性之间的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21402 2025-12-29 cs.CV 78%

Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation

理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估

Arnav Gupta, Gurekas Singh Sahney, Hardik Rathi, Abhishek Chandwani, Ishaan Gupta, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07148 2025-12-29 cs.CL 77%

TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine

TCM-Eval: 一个专家级动态且可扩展的中医基准测试

Zihao Cheng, Yuheng Lu, Huaiqian Ye, Zeming Liu, Minqi Wang, Jingjing Liu, Zihan Li, Wei Fan, Yuanfang Guo, Ruiji Fu, Shifeng She, Gang Wang, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Zhimingtang Technology Co., Ltd.(北京智明堂科技有限公司) Beijing Zhiyan AI Technology Co., Ltd.(北京智言AI科技有限公司) Guangzhou University of Chinese Medicine(广州中医药大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TCM-Eval通过动态可扩展的基准测试和SI-CoTE方法,开发出ZMT模型,显著超越人类中医从业者水平,推动中医领域LLM研究发展。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13298 2025-12-29 cs.CL 77%

Improving Multi-turn Task Completion in Task-Oriented Dialog Systems via Prompt Chaining and Fine-Grained Feedback

通过提示链和细粒度反馈提升任务导向对话系统多轮任务完成

Moghis Fereidouni, Md Sajid Ahmed, Adib Mosharrof, A. B. Siddique

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RealTOD通过提示链和细粒度反馈提升任务导向对话系统多轮任务完成能力,显著提高API调用准确率

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21849 2025-12-29 cs.CL cs.AI 73%

HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs

HeartBench: 探索大语言模型中拟人智能的核心维度

Jiaxin Liu, Peiyi Tu, Wenyu Chen, Yihong Zhuang, Xinxia Ling, Anji Zhou, Chenxi Wang, Zhuo Han, Zhengkai Yang, Junbo Zhao, Zenan Huang, Yuanyuan Wang

机构 * Ant Group(蚂蚁集团) Xiamen University(厦门大学) Beijing Normal University(北京师范大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HeartBench通过理论驱动的分类体系评估中文大语言模型的情感、文化和伦理维度,揭示其在拟人智能方面的性能上限及改进方向。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21809 2025-12-29 cs.CL cs.CY 70%

On The Conceptualization and Societal Impact of Cross-Cultural Bias

关于跨文化偏见的概念化与社会影响

Vitthal Bhandari

机构 * University of Washington / Seattle(华盛顿大学/西雅图)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了跨文化偏见在NLP中的概念化与社会影响,提出观察结果以帮助研究者更有效地评估偏见的危害。

Comments Term paper for LING 575 (Societal Impacts of Language Technologies)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI 70%

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21360 2025-12-29 cs.AI cs.SY eess.SY 70%

From Visual Perception to Deep Empathy: An Automated Assessment Framework for House-Tree-Person Drawings Using Multimodal LLMs and Multi-Agent Collaboration

从视觉感知到深度共情:一种利用多模态大语言模型和多智能体协作的房屋-树-人绘画自动评估框架

Shuide Wen, Yu Sun, Beier Ku, Zhi Gao, Lijun Ma, Yang Yang, Can Jiao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型和多智能体协作,开发自动评估房屋-树-人绘画测试的框架,以提升投射评估的标准化和效率。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21715 2025-12-29 cs.CL cs.AI 62%

CATCH: A Controllable Theme Detection Framework with Contextualized Clustering and Hierarchical Generation

CATCH:一个具有上下文聚类和层次生成的可控主题检测框架

Rui Ke, Jiahui Xu, Shenghao Yang, Kuang Wang, Feng Jiang, Haizhou Li

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 CATCH提出了一种可控主题检测框架,通过上下文聚类和层次生成机制,解决稀疏语句和用户偏好识别的问题,提升对话系统中主题检测的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21637 2025-12-29 cs.CV 50%

Training-Free Disentangled Text-Guided Image Editing via Sparse Latent Constraints

无需训练的解耦文本引导图像编辑:通过稀疏潜在约束

Mutiara Shabrina, Nova Kurnia Putri, Jefri Satria Ferdiansyah, Sabita Khansa Dewi, Novanto Yudistira

机构 * Department of Informatics Engineering Universitas Brawijaya Malang, Indonesia(信息工程系 乌姆拉大学 马拉邦,印度尼西亚)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种无需训练的解耦文本引导图像编辑方法,通过引入稀疏潜在约束减少属性纠缠问题,提升编辑的可控性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏