arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-25 至 2025-11-25 共收录 375 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 104 篇

2511.18985 2025-11-25 cs.HC cs.CY 85%

LLM Chatbots in High School Programming: Exploring Behaviors and Interventions

LLM在高中编程中的应用:探索行为与干预

Manuel Valle Torre, Marcus Specht, Catharine Oertel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过设计基于研究方法探讨LLM在高中编程教育中的应用,发现干预教学能改善学习行为,但未显著提升考试成绩,表明需更全面的学习策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17682 2025-11-25 cs.CY cs.AI cs.CL 84%

A Cross-Cultural Assessment of Human Ability to Detect LLM-Generated Fake News about South Africa

对人类识别南非虚假新闻能力的跨文化评估

Tim Schlippe, Matthias Wölfel, Koena Ronny Mabokela

机构 * IU International University of Applied Sciences, Germany(国际应用科学大学) Karlsruhe University of Applied Sciences, Germany(卡尔斯鲁厄应用科学大学) Applied Information Systems, University of Johannesburg, South Africa(应用信息系统,约翰内斯堡大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过比较南非与其他国籍参与者,发现文化熟悉度有助于识别真实信息,但可能在识别伪造内容时引入偏见。

Journal ref The Southern African Conference on AI Research (SACAIR 2025), Century City, South Africa, 1-5 December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17803 2025-11-25 cs.CV cs.AI 83%

Pillar-0: A New Frontier for Radiology Foundation Models

Pillar-0:放射学基础模型的新前沿

Kumar Krishna Agrawal, Longchao Liu, Long Lian, Michael Nercessian, Natalia Harguindeguy, Yufu Wu, Peter Mikhael, Gigin Lin, Lecia V. Sequist, Florian Fintelmann, Trevor Darrell, Yutong Bai, Maggie Chung, Adam Yala

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 Pillar-0通过预训练大量医学影像数据和RATE框架,在放射学任务中实现高性能表现,超越现有模型并扩展至新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09049 2025-11-25 cs.CL 83%

From Punchlines to Predictions: A Metric to Assess LLM Performance in Identifying Humor in Stand-Up Comedy

从笑点到预测:一种评估大语言模型在识别单口喜剧幽默能力的指标

Adrianna Romanowski, Pedro H. V. Valois, Kazuhiro Fukui

机构 * International Christian University(国际基督教大学) University of Tsukuba(茨口大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出了一种评估大语言模型识别单口喜剧幽默能力的指标,发现即使领先模型在幽默检测上的表现也仅达到51%,低于人类的41%。

Comments Accepted to CMCL2025 @ NAACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18921 2025-11-25 cs.CV 82%

BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models

BackdoorVLM:面向视觉-语言模型的后门攻击基准

Juncheng Li, Yige Li, Hanxun Huang, Yunhao Chen, Xin Wang, Yixu Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理学院) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract)

AI总结 BackdoorVLM提出首个评估视觉-语言模型后门攻击的基准,揭示VLMs对文本指令的高敏感性及多模后门的有效性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18889 2025-11-25 cs.CL cs.AI 81%

CoreEval: Automatically Building Contamination-Resilient Datasets with Real-World Knowledge toward Reliable LLM Evaluation

CoreEval: 通过现实世界知识自动构建抗污染数据集以实现可靠的LLM评估

Jingqian Zhao, Bingbing Wang, Geng Tu, Yice Zhang, Qianlong Wang, Bin Liang, Jing Li, Ruifeng Xu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东省新型安全智能技术重点实验室) The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 CoreEval通过现实世界知识自动更新数据集,提升LLM评估的抗污染能力,减少数据污染导致的性能高估问题。

Comments ACL'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22143 2025-11-25 eess.SP cs.AI cs.CV cs.LG 81%

A Self-Supervised Learning of a Foundation Model for Analog Layout Design Automation

为模拟布局设计自动化构建一个自监督学习的基础模型

Sungyu Jeong, Won Joon Choi, Junung Choi, Anik Biswas, Byungsub Kim

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于UNet的基础模型及其自监督学习方法,用于解决模拟布局设计自动化中的数据不足和任务多样性问题,通过预训练和微调实现高效布局任务处理。

Comments 8 pages, 11 figures

Journal ref IEEE Transactions on Circuits and Systems I: Regular Papers, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18409 2025-11-25 cs.CL cs.AI 81%

Findings of the BlackboxNLP 2025 Shared Task: Localizing Circuits and Causal Variables in Language Models

黑箱NLP 2025共享任务成果:语言模型中电路和因果变量的本地化

Dana Arad, Yonatan Belinkov, Hanjie Chen, Najoung Kim, Hosein Mohebbi, Aaron Mueller, Gabriele Sarti, Martin Tutek

机构 * Technion – IIT(技术学院-理工学院) Rice University(里士满大学) Boston University(波士顿大学) Tilburg University(蒂尔堡大学) University of Groningen(格罗宁根大学) University of Zagreb(扎格雷布大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 黑箱NLP 2025共享任务评估了语言模型中电路和因果变量的本地化方法,通过集成和正则化策略提升了电路本地化性能,通过低维投影提升了因果变量本地化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13646 2025-11-25 cs.SE cs.AI cs.CL cs.LG 80%

Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

Live-SWE-agent: 软件工程代理能否在飞行中自我进化?

Chunqiu Steven Xia, Zhe Wang, Yan Yang, Yuxiang Wei, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Live-SWE-agent是一种能够在运行时自主进化其自身框架的软件代理,通过解决现实软件问题实现了77.4%的解决率,优于现有所有软件代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17970 2025-11-25 cs.LG 79%

Controllability Analysis of State Space-based Language Model

基于状态空间的语言模型可控性分析

Mohamed Mabrok, Yalda Zafari

机构 * Qatar University(卡塔尔大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出影响分数,用于分析Mamba模型的可控性,揭示模型容量、架构模式及大规模下的涌现行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17876 2025-11-25 cs.AI 79%

Training Emergent Joint Associations: A Reinforcement Learning Approach to Creative Thinking in Language Models

训练涌现的联合关联:一种基于强化学习的创造性思维方法用于语言模型

Mukul Singh, Ananya Singha, Aishni Parab, Pronita Mehrotra, Sumit Gulwani

机构 * Microsoft, USA(微软公司) Microsoft, India(微软公司) University of California, Los Angeles, USA(加州大学洛杉矶分校) MindAntix

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的框架,通过增强语言模型的关联性思维能力,提升其在故事创作、代码生成和数据可视化等任务中的原创性和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17828 2025-11-25 cs.CV cs.AI 79%

Toward explainable AI approaches for breast imaging: adapting foundation models to diverse populations

迈向可解释AI方法的乳腺成像:适应基础模型以适应多样化人群

Guilherme J. Cavalcante, José Gabriel A. Moreira, Gabriel A. B. do Nascimento, Vincent Dong, Alex Nguyen, Thaís G. do Rêgo, Yuri Malheiros, Telmo M. Silva Filho, Carla R. Zeballos Torrez, James C. Gee, Anne Marie McCarthy, Andrew D. A. Maidment, Bruno Barufaldi

机构 * University of Pennsylvania(宾夕法尼亚大学) Federal University of Paraíba(帕拉州联邦大学) University of Bristol(布里斯托大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究利用BiomedCLIP基础模型,通过多模态训练提升乳腺密度分类的准确性和泛化能力,验证了其在不同成像模态中的鲁棒性和可解释性。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15998 2025-11-25 cs.CR cs.AI 79%

Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming

AI流量中的隐藏:利用MCP进行LLM驱动的代理红队攻击

Strahinja Janjusevic, Anna Baron Garcia, Sohrob Kazerounian

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种基于MCP的C2架构,用于LLM驱动的红队攻击,通过异步并行操作和实时情报共享,减少检测足迹并提升系统整体效能。

Comments 23 pages, 9 figures, 3 tables. Submitted as a full paper for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16466 2025-11-25 cs.CR cs.AI 79%

Incalmo: An Autonomous LLM-assisted System for Red Teaming Multi-Host Networks

Incalmo:一种自主的LLM辅助系统用于多主机网络红队测试

Brian Singer, Keane Lucas, Lakshmi Adiga, Meghna Jain, Lujo Bauer, Vyas Sekar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 Incalmo是一种基于LLM的自主红队测试系统,通过高层次任务规划和专用任务代理实现多主机网络攻击,显著提高了红队测试的效率和成功率。

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26213 2025-11-25 cs.CV 79%

OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning

OmniDocLayout: 通过粗到细的LLM学习实现多样化的文档布局生成

Hengrui Kang, Zhuangcheng Gu, Zhiyuan Zhao, Zichen Wen, Bin Wang, Weijia Li, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract)

AI总结 OmniDocLayout通过粗到细的LLM学习方法,生成多样化文档布局,解决现有布局生成中多样性和复杂性不足的问题。

Comments TL;DR: With the proposed OmniDocLayout-1M dataset and the LLM-based coarse-to-fine learning strategy, we enable diverse and complex document layout generation that achieves both strong condition consistency and adherence to fundamental aesthetic principles

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19355 2025-11-25 cs.LG cs.AI cs.RO 79%

Leveraging LLMs for reward function design in reinforcement learning control tasks

利用大型语言模型设计强化学习控制任务中的奖励函数

Franklin Cardenoso, Wouter Caarls

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LEARN-Opt通过自主设计奖励函数,无需人工干预或环境代码,提升强化学习任务的效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09711 2025-11-25 cs.CL cs.AI 79%

PsychiatryBench: A Multi-Task Benchmark for LLMs in Psychiatry

PsychiatryBench: 一个面向心理治疗的多任务基准测试

Aya E. Fouda, Abdelrahamn A. Hassan, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PsychiatryBench通过权威教科书和病例书构建多任务基准,评估LLMs在心理治疗中的临床一致性与安全性,揭示模型在多轮随访等任务中的不足,推动专门调优和更严谨的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18364 2025-11-25 cs.AI cs.DB cs.LG 79%

KGpipe: Generation and Evaluation of Pipelines for Data Integration into Knowledge Graphs

KGpipe:数据整合进知识图谱的管道生成与评估

Marvin Hofer, Erhard Rahm

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KGpipe通过整合现有工具和LLM功能,提供数据整合到知识图谱的管道生成与评估框架,展示其灵活性和有效性。

Comments 15 KG pipelines (9 single source, 6 multi source)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17818 2025-11-25 cs.LG cs.AI 79%

APRIL: Annotations for Policy evaluation with Reliable Inference from LLMs

APRIL:利用LLM可靠推断进行策略评估的标注

Aishwarya Mandyam, Kalyani Limaye, Barbara E. Engelhardt, Emily Alsentzer

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 APRIL利用大语言模型生成医疗领域的反事实注释,以提高离线策略评估的准确性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17609 2025-11-25 cs.CL cs.LG 79%

TyphoFormer: Language-Augmented Transformer for Accurate Typhoon Track Forecasting

TyphoFormer:语言增强的Transformer用于准确的台风路径预测

Lincan Li, Eren Erman Ozguven, Yue Zhao, Guang Wang, Yiqun Xie, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) FAMU-FSU College of Engineering(FAMU-FSU 工程学院) University of Southern California(南加州大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TyphoFormer通过结合自然语言描述提升台风路径预测准确性,优于现有方法,尤其在复杂场景中表现突出。

Comments Accepted by ACM SIGSPATIAL 2025. Received SIGSPATIAL '25 Best Short Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18978 2025-11-25 cs.CV 78%

Zero-shot segmentation of skin tumors in whole-slide images with vision-language foundation models

基于视觉语言基础模型的全切片图像皮肤肿瘤零样本分割

Santiago Moreno, Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech), Universitat Politécnica de Valencia(人类中心技术大学研究机构(HUMAN-Tech)、西班牙巴塞罗那理工大学) Artikode Intelligence S.L.(Artikode Intelligence公司)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出ZEUS框架,利用视觉语言基础模型实现全切片图像中皮肤肿瘤的零样本分割,减少标注负担并提高分割精度。

Comments Conference manuscript accepted for oral presentation at CASEIB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03480 2025-11-25 cs.SE 78%

LLM Agents for Automated Dependency Upgrades

基于大语言模型的自动化依赖升级代理

Vali Tawosi, Salwa Alamir, Xiaomo Liu, Manuela Veloso

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出基于LLM代理的自动化依赖升级方法,通过合成数据验证,实现了高效准确的代码更新与兼容性保障。

Comments Accepted to AISM Workshop at ASE 2005

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19427 2025-11-25 cs.SE cs.AI 77%

Prompt Less, Smile More: MTP with Semantic Engineering in Lieu of Prompt Engineering

无需提示,微笑更多:通过语义工程替代提示工程的MTP

Jayanaka L. Dantanarayana, Savini Kashmira, Thakee Nathees, Zichen Zhang, Krisztian Flautner, Lingjia Tang, Jason Mars

机构 * University of Michigan(密歇根大学) Jaseci Labs(Jaseci实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过语义工程替代提示工程,提升AI集成编程中提示的准确性与开发者效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19122 2025-11-25 cs.CL 77%

Emotion-Enhanced Multi-Task Learning with LLMs for Aspect Category Sentiment Analysis

情感增强的多任务学习与大语言模型用于方面类别情感分析

Yaping Chai, Haoran Xie, Joe S. Qin

机构 * School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种情感增强的多任务学习框架,通过整合Ekman基本情感和VAD模型,提升方面类别情感分析的细粒度情感捕捉能力。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06908 2025-11-25 cs.CV cs.AI 77%

Find Them All: Unveiling MLLMs for Versatile Person Re-identification

找到它们全部:揭示MLLMs用于多功能人物重识别

Jinhao Li, Zijian Chen, Lirong Deng, Guangtao Zhai, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究所) Macao Polytechnic University(澳门 polytechnic 大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出VP-ReID基准,利用MLLMs提升人物重识别的多功能性和有效性,同时揭示其在处理某些模态时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02106 2025-11-25 cs.CL 77%

ContrastScore: Towards Higher Quality, Less Biased, More Efficient Evaluation Metrics with Contrastive Evaluation

ContrastScore: 向更高质量、更少偏见、更高效评估指标迈进的对比评估

Xiao Wang, Daniil Larionov, Siwei Wu, Yiqi Liu, Steffen Eger, Nafise Sadat Moosavi, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) University of Mannheim(曼海姆大学) University of Technology Nuremberg(纽伦堡技术大学) The University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ContrastScore通过对比评估方法提升生成文本评估的质量、减少偏见并提高效率。

Comments Accepted at AACL 2025 (Main Conference Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17775 2025-11-25 cs.CL 77%

FoREST: Frame of Reference Evaluation in Spatial Reasoning Tasks

FoREST: 空间推理任务中的参考框架评估

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 FoREST基准通过空间引导提示法提升LLMs在空间推理任务中的参考框架理解能力。

Comments 10 pages, 3 Figures, 4 Tables, EMNLP-2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 77%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18098 2025-11-25 cs.CR cs.LG 77%

Towards Harnessing the Power of LLMs for ABAC Policy Mining

面向利用大语言模型进行ABAC策略挖掘的探索

More Aayush Babasaheb, Shamik Sural

机构 * Indian Institute of Technology Kharagpur(印度克达尔格浦尔理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了大语言模型在ABAC策略挖掘中的应用,发现其在小规模场景有效,但随着规模扩大,准确性下降且策略规模增大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18867 2025-11-25 cs.SE 75%

VecIntrinBench: Benchmarking Cross-Architecture Intrinsic Code Migration for RISC-V Vector

VecIntrinBench: 跨架构内在代码迁移的RISC-V向量基准测试

Liutong Han, Chu Kang, Mingjie Xing, Yanjun Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VecIntrinBench是首个评估RISC-V向量扩展内在代码迁移能力的基准,包含50个函数级任务,通过标量、RVV、Arm Neon和x86内在函数进行测试,揭示LLM在代码迁移中的表现及优化方向。

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏