arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2312.00909 2023-12-05 cs.IR cs.AI 92%

LLM-TAKE: Theme Aware Keyword Extraction Using Large Language Models

Reza Yousefi Maragheh, Chenhao Fang, Charan Chand Irugu, Parth Parikh, Jason Cho, Jianpeng Xu, Saranyan Sukumar, Malay Patel, Evren Korpeoglu, Sushant Kumar, Kannan Achan

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19792 2023-10-31 cs.CL 92%

The Eval4NLP 2023 Shared Task on Prompting Large Language Models as Explainable Metrics

Christoph Leiter, Juri Opitz, Daniel Deutsch, Yang Gao, Rotem Dror, Steffen Eger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15100 2023-10-24 cs.CL 92%

LLM-in-the-loop: Leveraging Large Language Model for Thematic Analysis

Shih-Chieh Dai, Aiping Xiong, Lun-Wei Ku

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01023 2026-07-01 cs.SE 91%

Large Language Model Evaluation Via Multi AI Agents: Preliminary results

通过多AI代理评估大型语言模型:初步结果

Zeeshan Rasheed, Muhammad Waseem, Kari Systä, Pekka Abrahamsson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文提出多AI代理模型评估不同LLM性能,通过代码检索与验证,初步结果显示GPT-3.5 Turbo表现更优,未来将引入MBPP基准提升评估精度。

Comments 10 pages, 1 figure

Journal ref ICLR 2024 Workshop on Large Language Model (LLM) Agents, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01535 2026-05-11 cs.SE 91%

Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation

评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障

Laboni Sarker, Mara Downing, Achintya Desai, Tevfik Bultan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(journal_ref)

AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。

Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same

Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09980 2026-02-17 cs.CV cs.RO 91%

V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models

V2V-LLM:基于多模态大语言模型的车与车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Stephen F. Smith, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的V2V-LLM,通过车与车协同感知提升自动驾驶安全性和性能。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02376 2025-12-23 cs.CL cs.AI cs.CR cs.LG 91%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking

Aashray Reddy, Andrew Zagula, Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。

Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12324 2026-08-14 cs.CY cs.AI cs.CL 新提交 91%

When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models

当AI成为你的牧师:大型语言模型的神学分诊与牧灵指导基准测试

Alex Chao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出FMG-Bench基准测试,评估LLM在基督教神学分诊与牧灵指导场景的表现,发现结构化框架可提升模型表现与鲁棒性,且该基准仅为测量工具。

Comments Full paper. Code and dataset are available at https://github.com/FideAI/fmg-bench and https://huggingface.co/datasets/FideAI/fmg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00665 2026-08-04 cs.CL cs.AI 版本更新 91%

Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation

小语言模型能否处理上下文总结的多轮客户服务问答?一种合成数据驱动的比较评估

Lakshan Cooray, Deshan Sumanathilaka, Pattigadapa Venkatesh Raju

机构 * School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所) School of Mathematics and Computer Science, Swansea University(数学与计算机科学学院,萨默塞特大学) R&D, Zame AI(Zame AI研发部)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文通过合成数据评估小语言模型在多轮客户服务问答中的表现,发现部分模型接近大语言模型性能,但整体仍存在对话连续性和上下文对齐的挑战。

Comments Published at Frontiers in Artificial Intelligence, Natural Language Processing Section

Journal ref Frontiers in Artificial Intelligence, 9:1804284, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19723 2026-07-09 cs.CL cs.AI 版本更新 91%

Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

大型语言模型中的数学推理:基准测试、架构、评估与开放挑战

Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima

机构 * organization= School of Electrical Engineering Computer Science, National University of Science organization= School of Computing, Data Mathematical Sciences, Western Sydney University, Indonesia organization= Department of Communication, Quality Management Information Systems, Mid Sweden University, Östersund Campus, Sweden

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01829 2026-07-03 cs.AI cs.CL 新提交 91%

Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

Pre-Flight: 评估大型语言模型航空运营知识的基准

Alex Brooker, Tim Hughes

机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。

Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31718 2026-07-01 cs.CL cs.AI 新提交 91%

Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian

跨语言关系抽取与大语言模型:罗马尼亚语的零样本、少样本和微调评估

Dragos-Mitrut Vasile, Elena-Simona Apostol, Stefan-Adrian Toma, Adrian Paschke, Ciprian-Octavian Truica

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 通过自动翻译数据集结合大语言模型推理,研究罗马尼亚语的跨语言关系抽取,评估Gemma 4 31B在零样本、少样本和QLoRA微调下的性能,并与四种编码器基线对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21820 2026-06-23 cs.SI cs.AI cs.CL 新提交 91%

Generating Public Health Responses using Survey-Augmented Large Language Models

使用调查增强的大语言模型生成公共卫生响应

Leonardo Marciaga, Thuyen Pham, Julia Rezvani, Alina Hyk, Chunyang Liao, Konstantinos Mitsopoulos, Raffaele Vardavas

机构 * Hawk.illinoistech.edu(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究利用大语言模型生成合成调查数据,以模拟真实人群在流行病中的健康决策行为,发现合成数据能复现人口统计和信念分布,但难以捕捉因素间的协变关系,不能替代真实调查。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12347 2026-06-18 cs.CL cs.AI cs.CY 91%

Assessment of Evolving Large Language Models in Upper Secondary Mathematics

对上中学数学中演进式大语言模型的评估

Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

机构 * Faculty of Information Technology(信息科技学院) University of Jyväskylä(于韦斯屈莱大学) Faculty of Humanities and Social Sciences(人文与社会科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文评估了不同大语言模型在芬兰毕业考试中的数学能力,发现随着模型演进,其表现显著提升,部分模型接近完美,展示了LLM在数学能力上的快速进步及其在教育中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14634 2026-06-08 cs.CL cs.AI cs.CY 91%

AIn't Nothing But a Survey? Using Large Language Models for Coding German Open-Ended Survey Responses on Survey Motivation

不是什么别的吗?利用大语言模型对德国开放式调查回答进行编码:调查动机

Leah von der Heyde, Anna-Carolina Haensch, Bernd Weiß, Jessica Daikeler

机构 * Social Data Science & AI Lab, LMU Munich(社会科学与人工智能实验室,慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学学院公园分校) GESIS – Leibniz Institute for the Social Sciences(莱比锡社会科学研究机构)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)

AI总结 本文探讨了使用大语言模型对开放式调查回答进行编码的有效性,通过德国调查参与原因的数据,比较了不同LLM和提示方法的性能,发现仅微调的LLM能获得满意预测效果,且分类性能差异影响类别分布。

Comments to appear in Survey Research Methods

Journal ref Survey Research Methods (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28848 2026-05-29 cs.CL cs.AI 91%

GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models

GPF-LiveNews: 大型语言模型中群体条件框架的流式评估协议

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Roy George

机构 * Clark Atlanta University(克拉克阿特兰大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 提出GPF-LiveNews流式评估协议,通过实时新闻锚点与身份标签组合,检测LLM输出中针对不同受众的语义敏感性和情感差异,用于审计群体条件框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11167 2026-05-26 cs.LG cs.CL 91%

SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors

SURGE: 大型语言模型作为通用代理代码执行器的潜力

Bohan Lyu, Siqiao Huang, Zichen Liang

机构 * Department of Computer Science and Technology, Tsinghua(清华大学计算机科学与技术系) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua(清华大学交叉信息研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SURGE基准,包含1160个问题覆盖8个关键方面,通过评估21个开源和专有LLM,研究其作为代码执行预测代理模型的可行性、扩展律、数据效率和预测准确性。

Journal ref Proceedings of The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23025 2026-05-12 cs.CL cs.AI 91%

LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models

LENS:通过对齐多模态传感与语言模型实现LLM赋能的叙事合成用于心理健康

Wenxuan Xu, Arvind Pillai, Subigya Nepal, Amanda C Collins, Daniel M Mackin, Michael V Heinz, Tess Z Griffin, Nicholas C Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Virginia(弗吉尼亚大学) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LENS框架,通过将多模态传感数据与语言模型对齐,生成临床相关的心理健康叙述。该方法构建大规模数据集并训练补丁级编码器,提升对长时序传感器数据的处理能力,实验显示其在自然语言处理指标和症状严重性准确性上优于基线模型。

Comments Camera-ready version. Additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 91%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13741 2025-12-17 cs.LG cs.AI 91%

The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models

层流假说:通过大语言模型中的语义湍流检测对抗性突破

Md. Hasib Ur Rahman

机构 * Brac University(布拉克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15958 2025-11-21 cs.AI cs.CL 91%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17119 2025-04-28 cs.CL cs.AI 91%

The Rise of Small Language Models in Healthcare: A Comprehensive Survey

Muskan Garg, Shaina Raza, Shebuti Rayana, Xingyi Liu, Sunghwan Sohn

机构 * Artificial Intelligence & Informatics, Mayo Clinic(人工智能与信息学,梅奥诊所) Vector Institute(向量研究所) SUNY at Old Westbury(纽约旧西伯里州立大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

Comments 35 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15232 2026-08-20 cs.SE 版本更新 91%

When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling

当代理失效:对LLM代理中bug的全面研究与自动化标记

Niful Islam, Ragib Shahriar Ayon, Deepak George Thomas, Shibbir Ahmed, Mohammad Wardat

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。

Comments Accepted at ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02592 2026-08-20 cs.CY 版本更新 91%

AI Fact-Checking in the Wild: A Field Evaluation of LLM-Written Community Notes on X

在野中的AI事实核查:在X平台上的LLM生成社区笔记现场评估

Haiwen Li, Michiel A. Bakker

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文首次在X平台现场评估LLM生成的社区笔记,通过三个月的测试发现LLM笔记在不同政治立场的评价者中获得更高正面评分,证明其在事实核查中的广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03444 2026-08-18 cs.RO cs.SY eess.SY 版本更新 91%

PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers

PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11965 2026-08-13 cs.SE 新提交 91%

Developing LLM-based Multi-Agent Systems in Software Engineering: A Mixed-Method Experience Report

在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告

Mariama Celi Serafim De Oliveira, Motunrayo Osatohanmen Ibiyo, Marco Gianrusso, Claudio Di Sipio, Davide Di Ruscio, Phuong T. Nguyen

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。

Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15817 2026-08-12 cs.SE 91%

A Causal Perspective on Measuring, Explaining and Mitigating Smells in LLM-Generated Code

从因果视角测量、解释和缓解LLM生成代码中的代码异味

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Luftar Rahman Alif, Denys Poshyvanyk

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文从因果视角研究LLM生成代码中的代码异味问题,提出PSC指标用于测量和缓解异味倾向,通过实验揭示生成策略和架构对代码结构的影响,并推动质量感知评估在代码生成中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09443 2026-08-07 cs.CR 版本更新 91%

LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge

大型语言模型目前尚不可靠地充当评判者:对LLM作为评判者的鲁棒性的综合评估

Songze Li, Chuokun Xu, Jiaying Wang, Xueluan Gong, Chen Chen, Jirui Zhang, Jun Wang, Kwok-Yan Lam, Shouling Ji

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究引入RobustJudge框架,评估LLM-as-a-Judge的鲁棒性,发现其易受攻击,鲁棒性对提示模板和模型选择敏感,优化攻击结合长后缀可提升PAI-Judge分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04907 2026-08-06 cs.CR cs.AR 新提交 91%

LLM-Assisted Detection and Repair of Hardware Security Vulnerabilities in Verilog Designs

基于Verilog设计的大语言模型辅助硬件安全漏洞检测与修复

Ethen Santana, Gabriel Gyaase, Hao Zheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出利用LLM从Verilog硬件设计中识别潜在CWE漏洞的方法,经单模块Verilog数据集迭代评估,证实LLM可增强硬件安全分析,为设计阶段漏洞识别提供自动化可扩展辅助。

Comments 6 Pages, 3 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01649 2026-08-04 cs.NI 新提交 91%

LLM-Driven Automated Reward Design for Reinforcement Learning-Based Routing in LEO Satellite Networks

面向低轨(LEO)卫星网络中基于强化学习(RL)的路由的大语言模型(LLM)驱动的自动奖励设计

Walter P. Casas, Nelson L. S. da Fonseca, and Carlos A. Astudillo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LARGE框架结合LLM生成与迭代在环仿真,为LEO卫星网络RL路由自动设计奖励,其性能可与专家基线相当,凸显该优化方法的潜力。

Comments This paper was accepted for publication at the IEEE Global Communications Conference (GLOBECOM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏