LLM-TAKE: Theme Aware Keyword Extraction Using Large Language Models
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments EMNLP 2023 Findings
通过多AI代理评估大型语言模型:初步结果
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)
AI总结 本文提出多AI代理模型评估不同LLM性能,通过代码检索与验证,初步结果显示GPT-3.5 Turbo表现更优,未来将引入MBPP基准提升评估精度。
Comments 10 pages, 1 figure
Journal ref ICLR 2024 Workshop on Large Language Model (LLM) Agents, 2024
评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(journal_ref)
AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。
Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same
Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages
V2V-LLM:基于多模态大语言模型的车与车协同自动驾驶
机构 * NVIDIA ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
AI总结 本文提出基于多模态大语言模型的V2V-LLM,通过车与车协同感知提升自动驾驶安全性和性能。
Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vllm.github.io/ Code: https://github.com/eddyhkchiu/V2V-LLM Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA
AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI、cs.LG
AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。
Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv
当AI成为你的牧师:大型语言模型的神学分诊与牧灵指导基准测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究推出FMG-Bench基准测试,评估LLM在基督教神学分诊与牧灵指导场景的表现,发现结构化框架可提升模型表现与鲁棒性,且该基准仅为测量工具。
Comments Full paper. Code and dataset are available at https://github.com/FideAI/fmg-bench and https://huggingface.co/datasets/FideAI/fmg-bench
小语言模型能否处理上下文总结的多轮客户服务问答?一种合成数据驱动的比较评估
机构 * School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所) ; School of Mathematics and Computer Science, Swansea University(数学与计算机科学学院,萨默塞特大学) ; R&D, Zame AI(Zame AI研发部)
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)
AI总结 本文通过合成数据评估小语言模型在多轮客户服务问答中的表现,发现部分模型接近大语言模型性能,但整体仍存在对话连续性和上下文对齐的挑战。
Comments Published at Frontiers in Artificial Intelligence, Natural Language Processing Section
Journal ref Frontiers in Artificial Intelligence, 9:1804284, 2026
大型语言模型中的数学推理:基准测试、架构、评估与开放挑战
机构 * organization= School of Electrical Engineering ; Computer Science, National University of Science ; organization= School of Computing, Data ; Mathematical Sciences, Western Sydney University, Indonesia ; organization= Department of Communication, Quality Management ; Information Systems, Mid Sweden University, Östersund Campus, Sweden
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。
Pre-Flight: 评估大型语言模型航空运营知识的基准
机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) ; Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。
Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)
跨语言关系抽取与大语言模型:罗马尼亚语的零样本、少样本和微调评估
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 通过自动翻译数据集结合大语言模型推理,研究罗马尼亚语的跨语言关系抽取,评估Gemma 4 31B在零样本、少样本和QLoRA微调下的性能,并与四种编码器基线对比。
使用调查增强的大语言模型生成公共卫生响应
机构 * Hawk.illinoistech.edu(伊利诺伊理工学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 研究利用大语言模型生成合成调查数据,以模拟真实人群在流行病中的健康决策行为,发现合成数据能复现人口统计和信念分布,但难以捕捉因素间的协变关系,不能替代真实调查。
Comments 24 pages, 6 figures
对上中学数学中演进式大语言模型的评估
机构 * Faculty of Information Technology(信息科技学院) ; University of Jyväskylä(于韦斯屈莱大学) ; Faculty of Humanities and Social Sciences(人文与社会科学学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文评估了不同大语言模型在芬兰毕业考试中的数学能力,发现随着模型演进,其表现显著提升,部分模型接近完美,展示了LLM在数学能力上的快速进步及其在教育中的潜力。
不是什么别的吗?利用大语言模型对德国开放式调查回答进行编码:调查动机
机构 * Social Data Science & AI Lab, LMU Munich(社会科学与人工智能实验室,慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Maryland, College Park(马里兰大学学院公园分校) ; GESIS – Leibniz Institute for the Social Sciences(莱比锡社会科学研究机构)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)
AI总结 本文探讨了使用大语言模型对开放式调查回答进行编码的有效性,通过德国调查参与原因的数据,比较了不同LLM和提示方法的性能,发现仅微调的LLM能获得满意预测效果,且分类性能差异影响类别分布。
Comments to appear in Survey Research Methods
Journal ref Survey Research Methods (2025)
GPF-LiveNews: 大型语言模型中群体条件框架的流式评估协议
机构 * Clark Atlanta University(克拉克阿特兰大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
AI总结 提出GPF-LiveNews流式评估协议,通过实时新闻锚点与身份标签组合,检测LLM输出中针对不同受众的语义敏感性和情感差异,用于审计群体条件框架。
SURGE: 大型语言模型作为通用代理代码执行器的潜力
机构 * Department of Computer Science and Technology, Tsinghua(清华大学计算机科学与技术系) ; Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua(清华大学交叉信息研究院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG
AI总结 提出SURGE基准,包含1160个问题覆盖8个关键方面,通过评估21个开源和专有LLM,研究其作为代码执行预测代理模型的可行性、扩展律、数据效率和预测准确性。
Journal ref Proceedings of The 2025 Conference on Empirical Methods in Natural Language Processing
LENS:通过对齐多模态传感与语言模型实现LLM赋能的叙事合成用于心理健康
机构 * Dartmouth College(达特茅斯学院) ; University of Virginia(弗吉尼亚大学) ; Massachusetts General Hospital(麻省总医院) ; Harvard Medical School(哈佛医学院)
专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出LENS框架,通过将多模态传感数据与语言模型对齐,生成临床相关的心理健康叙述。该方法构建大规模数据集并训练补丁级编码器,提升对长时序传感器数据的处理能力,实验显示其在自然语言处理指标和症状严重性准确性上优于基线模型。
Comments Camera-ready version. Additional experiments
由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势
机构 * Communication University of China(中国传媒大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。
层流假说:通过大语言模型中的语义湍流检测对抗性突破
机构 * Brac University(布拉克大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。
JudgeBoard: 对小语言模型进行推理评估的基准测试与增强
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。
Comments 23 pages, 4 figures
机构 * Artificial Intelligence & Informatics, Mayo Clinic(人工智能与信息学,梅奥诊所) ; Vector Institute(向量研究所) ; SUNY at Old Westbury(纽约旧西伯里州立大学)
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
Comments 35 pages, 7 tables, 5 figures
当代理失效:对LLM代理中bug的全面研究与自动化标记
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。
Comments Accepted at ISSRE 2026
在野中的AI事实核查:在X平台上的LLM生成社区笔记现场评估
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文首次在X平台现场评估LLM生成的社区笔记,通过三个月的测试发现LLM笔记在不同政治立场的评价者中获得更高正面评分,证明其在事实核查中的广泛适用性。
PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略
机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) ; Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。
在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。
Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal
从因果视角测量、解释和缓解LLM生成代码中的代码异味
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文从因果视角研究LLM生成代码中的代码异味问题,提出PSC指标用于测量和缓解异味倾向,通过实验揭示生成策略和架构对代码结构的影响,并推动质量感知评估在代码生成中的应用。
大型语言模型目前尚不可靠地充当评判者:对LLM作为评判者的鲁棒性的综合评估
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究引入RobustJudge框架,评估LLM-as-a-Judge的鲁棒性,发现其易受攻击,鲁棒性对提示模板和模型选择敏感,优化攻击结合长后缀可提升PAI-Judge分数。
基于Verilog设计的大语言模型辅助硬件安全漏洞检测与修复
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 本文提出利用LLM从Verilog硬件设计中识别潜在CWE漏洞的方法,经单模块Verilog数据集迭代评估,证实LLM可增强硬件安全分析,为设计阶段漏洞识别提供自动化可扩展辅助。
Comments 6 Pages, 3 figures, technical report
面向低轨(LEO)卫星网络中基于强化学习(RL)的路由的大语言模型(LLM)驱动的自动奖励设计
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出LARGE框架结合LLM生成与迭代在环仿真,为LEO卫星网络RL路由自动设计奖励,其性能可与专家基线相当,凸显该优化方法的潜力。
Comments This paper was accepted for publication at the IEEE Global Communications Conference (GLOBECOM 2026)