arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32459 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32459 篇

2512.03318 2025-12-04 cs.AI 85%

Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia

利用Concordia评估基于LLM的智能体在混合动机场景中的泛化能力

Chandler Smith, Marwa Abdulhai, Manfred Diaz, Marko Tesic, Rakshit S. Trivedi, Alexander Sasha Vezhnevets, Lewis Hammond, Jesse Clifton, Minsuk Chang, Edgar A. Duéñez-Guzmán, John P. Agapiou, Jayd Matyas, Danny Karmon, Akash Kundu, Aliaksei Korshuk, Ananya Ananya, Arrasy Rahman, Avinaash Anand Kulandaivel, Bain McHale, Beining Zhang, Buyantuev Alexander, Carlos Saith Rodriguez Rojas, Caroline Wang, Chetan Talele, Chenao Liu, Chichen Lin, Diana Riazi, Di Yang Shi, Emanuel Tewolde, Elizaveta Tennant, Fangwei Zhong, Fuyang Cui, Gang Zhao, Gema Parreño Piqueras, Hyeonggeun Yun, Ilya Makarov, Jiaxun Cui, Jebish Purbey, Jim Dilkes, Jord Nguyen, Lingyun Xiao, Luis Felipe Giraldo, Manuela Chacon-Chamorro, Manuel Sebastian Rios Beltran, Marta Emili García Segura, Mengmeng Wang, Mogtaba Alim, Nicanor Quijano, Nico Schiavone, Olivia Macmillan-Scott, Oswaldo Peña, Peter Stone, Ram Mohan Rao Kadiyala, Rolando Fernandez, Ruben Manrique, Sunjia Lu, Sheila A. McIlraith, Shamika Dhuri, Shuqing Shi, Siddhant Gupta, Sneheel Sarangi, Sriram Ganapathi Subramanian, Taehun Cha, Toryn Q. Klassen, Wenming Tu, Weijian Fan, Wu Ruiyang, Xue Feng, Yali Du, Yang Liu, Yiding Wang, Yipeng Kang, Yoonchang Sung, Yuxuan Chen, Zhaowei Zhang, Zhihan Wang, Zhiqiang Wu, Ziang Chen, Zilong Zheng, Zixia Jia, Ziyan Wang, Dylan Hadfield-Menell, Natasha Jaques, Tim Baarslag, Jose Hernandez-Orallo, Joel Z. Leibo

机构 * Cooperative AI Foundation(合作人工智能基金会) University of Oxford(牛津大学) UC Berkeley(伯克利大学) Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心,剑桥大学) MIT(麻省理工学院) Google DeepMind(谷歌DeepMind) Center on Long-Term Risk(长期风险中心) Google Research(谷歌研究) University of Washington(华盛顿大学) Centrum Wiskunde & Informatica(数学与信息研究所) Utrecht University(乌得勒支大学) Universitat Politècnica de València(瓦伦西亚理工大学) Concordia Contest Participants with Notable Contributions(康科德比赛有显著贡献的参与者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用Concordia评估LLM智能体在混合动机场景中的合作能力,揭示了当前智能体在泛化能力上的不足。

Comments Published at NeurIPS Datasets and Benchmarks 2025, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10792 2025-12-04 cs.CL 85%

Finetune-RAG: Fine-Tuning Language Models to Resist Hallucination in Retrieval-Augmented Generation

Finetune-RAG: 通过微调语言模型抵抗检索增强生成中的幻觉

Zhan Peng Lee, Andre Lin, Calvin Tan

机构 * Pints AI Labs(Pints AI 实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 Finetune-RAG通过微调方法提升LLM事实准确性,提出首个RAG训练数据集和压力测试评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02282 2025-12-03 cs.AI cs.HC cs.MA 85%

DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses

DialogGuard: 多智能体心理社会安全评估框架用于敏感LLM响应

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Department of Industrial Engineering and Management(工业工程与管理系) Ben-Gurion University of the Negev(贝内尔·加隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DialogGuard通过多智能体框架评估LLM响应的心理社会风险,提供高准确性的风险检测与可解释的评估结果,支持安全提示设计和脆弱用户应用的监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03665 2025-12-02 cs.DC cs.AI 85%

LLM & HPC:Benchmarking DeepSeek's Performance in High-Performance Computing Tasks

LLM与HPC:在高性能计算任务中评估DeepSeek的性能

Noujoud Nader, Patrick Diehl, Steve Brandt, Hartmut Kaiser

机构 * Center of Computation and Technology(计算与技术中心) Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了DeepSeek在高性能计算任务中生成代码的能力,发现其在扩展性和执行效率上逊于GPT-4。

Comments 9 pages, 2 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01452 2025-12-02 cs.AI 85%

Automated Risk-of-Bias Assessment of Randomized Controlled Trials: A First Look at a GEPA-trained Programmatic Prompting Framework

随机对照试验风险偏误自动评估:一种基于GEPA训练的程序化提示框架初探

Lingbo Li, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 评测与基准 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 GEPA通过结构化优化生成一致的提示,提升随机对照试验偏误风险评估的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10493 2025-12-02 cs.CR cs.LG 85%

The Hidden DNA of LLM-Generated JavaScript: Structural Patterns Enable High-Accuracy Authorship Attribution

LLM生成JavaScript的隐藏DNA:结构模式实现高精度作者归属

Norbert Tihanyi, Bilel Cherif, Richard A. Dubniczky, Mohamed Amine Ferrag, Tamás Bisztray

机构 * Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(欧多芬·洛尔兰大学) United Arab Emirates University(联合阿拉伯酋长国大学) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LLM-NodeJS数据集,通过分析生成JavaScript代码的结构模式,实现高精度的作者归属和模型指纹识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05239 2025-12-02 cs.CL 85%

LLM-based Automated Grading with Human-in-the-Loop

基于大型语言模型的自动评分与人类在循环中

Yucheng Chu, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Jiliang Tang

机构 * Computer Science and Engineering(计算机科学与工程) Michigan State University(密歇根州立大学) Rossier School of Education(罗塞尔教育学院) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GradeHITL框架,通过人类在循环中方法提升自动简答评分的准确性,实现接近人类水平的评估。

Comments Accepted to IEEE TALE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03543 2025-12-02 cs.AI cs.CY cs.MA 85%

CogniPair: From LLM Chatbots to Conscious AI Agents -- GNWT-Based Multi-Agent Digital Twins for Social Pairing -- Dating & Hiring Applications

CogniPair: 从LLM聊天机器人到有意识的AI代理 -- 基于GNWT的多智能体数字孪生用于社交配对 -- dating与招聘应用

Wanghao Ye, Sihan Chen, Yiting Wang, Shwai He, Bowei Tian, Guoheng Sun, Ziyi Wang, Ziyao Wang, Yexiao He, Zheyu Shen, Meng Liu, Yuning Zhang, Meng Feng, Yang Wang, Siyuan Peng, Yilong Dai, Zhenle Duan, Lang Xiong, Joshua Liu, Hanzhang Qin, Ang Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CogniPair基于GNWT理论,通过整合人类认知架构,创建多智能体数字孪生系统,用于社交配对,提升LLM代理的心理真实性,并应用于约会和招聘场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 85%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22769 2025-12-01 cs.CL 85%

Modeling Romanized Hindi and Bengali: Dataset Creation and Multilingual LLM Integration

构建罗马化印地语和孟加拉语的模型:数据集创建与多语言大语言模型整合

Kanchon Gharami, Quazi Sarwar Muhtaseem, Deepti Gupta, Lavanya Elluri, Shafika Showkat Moni

机构 * Department of EECS, Embry-Riddle Aeronautical University, Daytona Beach, FL, USA(电子工程与科学系,埃姆布里-里德尔航空大学,日落海滩,佛罗里达州,美国) NLP Engineering Team, Hishab Singapore Pte. Ltd, Singapore(自然语言处理工程团队,Hishab新加坡私人有限公司,新加坡) Department of Computer Information Systems, Texas A&M University - Central Texas, Texas, USA(计算机信息系统系,德克萨斯A&M大学-中央德克萨斯分校,德克萨斯州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的转写数据集和定制多语言模型,用于提高罗马化印地语和孟加拉语的转写效果。

Comments Proceedings of the 8th Workshop on Big Data for Cybersecurity (BigCyber)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22275 2025-12-01 cs.AI 85%

RecToM: A Benchmark for Evaluating Machine Theory of Mind in LLM-based Conversational Recommender Systems

RecToM:用于评估基于LLM的对话推荐系统机器理论 of mind 的基准

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * SMU(德克萨斯南方大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RecToM是一个用于评估基于LLM的对话推荐系统中机器理论 of mind 能力的新基准,重点关注认知推理和行为预测两个维度。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19875 2025-11-26 cs.SE cs.AI 85%

CodeFuse-CommitEval: Towards Benchmarking LLM's Power on Commit Message and Code Change Inconsistency Detection

CodeFuse-CommitEval: 向基于提交信息和代码变更不一致检测的LLM能力基准测试迈进

Qingyu Zhang, Puzhuo Liu, Peng Di, Chenxiong Qian

机构 * Ant Group(蚂蚁集团) The University of Hong Kong(香港大学) Tsinghua University(清华大学) The University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CodeFuse-CommitEval是首个用于评估LLM检测提交信息与代码变更不一致能力的基准,通过生成七类不一致消息并验证样本,评估六种开源LLM在不同增强策略下的表现,揭示了不同增强方法对模型性能的影响及不同类型不一致的检测差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16883 2025-11-24 cs.LG 85%

PersonalizedRouter: Personalized LLM Routing via Graph-based User Preference Modeling

PersonalizedRouter: 通过基于图的用户偏好建模实现个性化LLM路由

Zhongjie Dai, Tao Feng, Jiaxuan You

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PersonalizedRouter通过基于图的用户偏好建模,实现个性化LLM选择,显著优于现有方法,具有高效和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06017 2025-11-21 cs.CL 85%

AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search

AgentSwift: 通过价值引导的分层搜索高效设计LLM代理

Yu Li, Lehui Li, Zhihao Wu, Qingmin Liao, Jianye Hao, Kun Shao, Fengli Xu, Yong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AgentSwift通过价值引导的分层搜索高效设计LLM代理,实现8.34%的性能提升。

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16131 2025-11-21 cs.DB cs.AI 85%

AskDB: An LLM Agent for Natural Language Interaction with Relational Databases

AskDB: 一种用于关系数据库自然语言交互的大型语言模型代理

Xuan-Quang Phan, Tan-Ha Mai, Thai-Duy Dinh, Minh-Thuan Nguyen, Lam-Son Lê

机构 * IT Operations, Mantu Group(Mantu集团信息技术部) Faculty of Engineering, Vietnamese-German University(越南-德国大学工程学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AskDB是一种基于大型语言模型的代理,通过自然语言实现对关系数据库的数据分析和管理操作,提供统一且智能的交互体验。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15698 2025-11-20 cs.CY cs.LG 85%

RescueLens: LLM-Powered Triage and Action on Volunteer Feedback for Food Rescue

RescueLens:基于大语言模型的志愿者反馈 triage 和行动

Naveen Raman, Jingwu Tang, Zhiyu Chen, Zheyuan Ryan Shi, Sean Hudson, Ameesh Kapoor, Fei Fang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RescueLens利用大语言模型自动处理志愿者反馈,提高食品救援组织的反馈管理效率和问题解决能力。

Comments Accepted at IAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15357 2025-11-20 cs.LG 85%

Cost-Aware Prediction (CAP): An LLM-Enhanced Machine Learning Pipeline and Decision Support System for Heart Failure Mortality Prediction

Yinan Yu, Falk Dippel, Christina E. Lundberg, Martin Lindgren, Annika Rosengren, Martin Adiels, Helen Sjöland

机构 * Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和哥德堡大学) Sahlgrenska University Hospital(萨尔姆斯卡大学医院) Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,萨尔姆斯卡学院,哥德堡大学) Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,萨尔姆斯卡大学医院) Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,哥德堡大学) School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学学院,医学院,哥德堡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15203 2025-11-20 cs.CR cs.AI 85%

Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks

Zimo Ji, Xunguang Wang, Zongjie Li, Pingchuan Ma, Yudong Gao, Daoyuan Wu, Xincheng Yan, Tian Tian, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Lingnan University(岭南大学) School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ZTE Corporation(中兴通讯有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14439 2025-11-20 cs.CL 85%

MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents

Jinru Ding, Lu Lu, Chao Ding, Mouxiao Bian, Jiayuan Chen, Wenrao Pang, Ruiyao Chen, Xinwei Peng, Renjie Lu, Sijie Ren, Guanxu Zhu, Xiaoqin Wu, Zhiqiang Liu, Rongzhao Zhang, Luyi Jiang, Bing Han, Yunqiu Wang, Jie Xu

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14248 2025-11-19 cs.AI 85%

Enhancing Regional Airbnb Trend Forecasting Using LLM-Based Embeddings of Accessibility and Human Mobility

Hongju Lee, Youngjun Park, Jisun An, Dongman Lee

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) School of Computing, KAIST(韩国科学技术院计算机科学学院) Luddy School of Informatics, Computing, and Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校信息学、计算与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at ASONAM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14181 2025-11-19 cs.CL 85%

Harnessing Deep LLM Participation for Robust Entity Linking

Jiajun Hou, Chenyu Zhang, Rui Meng

机构 * Guangdong Provincial/Zhuhai Key Laboratory of IRADS(广东省级/珠海IRADS关键实验室) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13998 2025-11-19 cs.SE cs.AI 85%

LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering

Jielin Qiu, Zuxin Liu, Zhiwei Liu, Rithesh Murthy, Jianguo Zhang, Haolin Chen, Shiyu Wang, Ming Zhu, Liangwei Yang, Juntao Tan, Roshan Ram, Akshara Prabhakar, Tulika Awalgaonkar, Zixiang Chen, Zhepeng Cen, Cheng Qian, Shelby Heinecke, Weiran Yao, Silvio Savarese, Caiming Xiong, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 54-pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18970 2025-11-19 cs.AI 85%

LLM-based Agents Suffer from Hallucinations: A Survey of Taxonomy, Methods, and Directions

Xixun Lin, Yucheng Ning, Jingwen Zhang, Yan Dong, Yilong Liu, Yongxuan Wu, Xiaohua Qi, Nan Sun, Yanmin Shang, Kun Wang, Pengfei Cao, Qingyue Wang, Lixin Zou, Xu Chen, Chuan Zhou, Jia Wu, Peng Zhang, Qingsong Wen, Shirui Pan, Bin Wang, Yanan Cao, Kai Chen, Songlin Hu, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全科学与工程学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) School of Computing, Faculty of Science and Engineering, Macquarie University(麦考瑞大学计算机学院) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学高级技术网络研究所) Squirrel Ai Learning Xiaomi Company(小米公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13254 2025-11-18 cs.CL 85%

Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance

Shalini Maiti, Amar Budhiraja, Bhavul Gauri, Gaurav Chaurasia, Anton Protopopov, Alexis Audran-Reiss, Michael Slater, Despoina Magka, Tatiana Shavrina, Roberta Raileanu, Yoram Bachrach

机构 * Meta SuperIntelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13169 2025-11-18 cs.CL 85%

TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine

Tianai Huang, Jiayuan Chen, Lu Lu, Pengcheng Chen, Tianbin Li, Bing Han, Wenchao Tang, Jie Xu, Ming Li

机构 * School of Artificial Intelligence in Traditional Chinese Medicine, Shanghai University of Traditional Chinese Medicine, Shanghai, China(上海中医药大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Washington, Seattle, Washington, US(华盛顿大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12689 2025-11-18 cs.CY cs.AI 85%

From Delegates to Trustees: How Optimizing for Long-Term Interests Shapes Bias and Alignment in LLM

Suyash Fulay, Jocelyn Zhu, Michiel Bakker

机构 * MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05925 2025-11-18 cs.CY cs.AI 85%

Small Models, Big Support: A Local LLM Framework for Educator-Centric Content Creation and Assessment with RAG and CAG

Zarreen Reza, Alexander Mazur, Michael T. Dugdale, Robin Ray-Chaudhuri

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13768 2025-11-18 cs.SE cs.AI 85%

Evaluation-Driven Development and Operations of LLM Agents: A Process Model and Reference Architecture

Boming Xia, Qinghua Lu, Liming Zhu, Zhenchang Xing, Dehai Zhao, Hao Zhang

机构 * Responsible AI Research Centre(责任人工智能研究中心) Adelaide University(阿德莱德大学) CSIRO’s Data61(CSIRO数据61) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Revised based on review comments. Submission under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11671 2025-11-18 cs.LG cs.HC 85%

Evaluation of LLM-based Explanations for a Learning Analytics Dashboard

Alina Deriyeva, Benjamin Paassen

机构 * Faculty of Technology, Bielefeld University(技术学院,比勒菲尔德大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10860 2025-11-17 cs.DC cs.AI cs.SE 85%

HPCAgentTester: A Multi-Agent LLM Approach for Enhanced HPC Unit Test Generation

Rabimba Karanjai, Lei Xu, Weidong Shi

机构 * University Of Houston(德克萨斯大学休斯顿分校) Kent State University(肯特州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted in AIWare 2025

详情

展开后加载摘要…

URL PDF HTML 收藏