Relation Extraction with Fine-Tuned Large Language Models in Retrieval Augmented Generation Frameworks
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments preprint
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments preprint
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)
Comments 21 pages, 9 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments 37 pages
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments 51 pages
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted by ICLR 2024
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments 9 pages, 5 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 10 pages, 10 figures, accepted to the 30th Asia-Pacific Software Engineering Conference (APSEC 2023)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments 28 pages, 5 figures, 2 tables, 175 references
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)
Comments Accepted to the Computers in Biology and Medicine journal
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments 28 pages, 3 figures, 16 tables
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments To be published in SEMANTICS 2023 poster track proceedings. SEMANTICS 2023 EU: 19th International Conference on Semantic Systems, September 20-22, 2023, Leipzig, Germany
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
Comments ACL 2023 (Findings)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments 12 pages, 1 figures
CASS-RTL:面向LLM的RTL生成的正确性感知子空间引导
机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida, Orlando, FL 32816, USA(电子与计算机工程系,中央佛罗里达大学,奥兰多,佛罗里达州32816,美国)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出CASS-RTL框架,通过识别LLM中与RTL正确性相关的注意力头并构建低维子空间进行轻量级干预,在无需额外监督或重训练的情况下提升RTL代码生成的功能准确性。
Comments Accepted to the IEEE International Conference on LLM-Aided Design (LAD '26)
Metanym游戏:一种自包含、自洽的LLM同行社区结构智能基准
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Metanym游戏作为LLM结构智能基准,通过同行互评和奇异值分解实现无黄金标准的客观评估,事实评分与GPQA Diamond相关性达0.92,发现评判能力比生成能力更稀缺。
Comments 69 pages (main text + four appendices: A. Mathematical Theory and Derivations B. generation/evaluation prompts, C. council-evaluation excerpt D. Auditing the Metanym Game-GPQA correlation: No Leaks Found), 3 figures, 19 tables. Github repo with pages/figures/tables/code and data for reproducing results: this https URL (https://github.com/dnordfors/metanym-game-paper)
低资源语言下的大语言模型安全对齐:系统文献综述
机构 * African Institute for Mathematical Sciences (AIMS)(非洲数学科学研究所) ; Bayero University Kano(卡诺贝罗大学) ; Brown University(布朗大学) ; Centrum Wiskunde & Informatica(数学与计算机科学中心) ; University of Pretoria(比勒陀利亚大学) ; University of Hamburg(汉堡大学) ; Imperial College London(伦敦帝国学院)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过PRISMA 2020方法学开展系统文献综述,分析50项相关研究,揭示低资源语言下LLM存在多语言安全差距,提出安全对齐分类,并给出未来研究方向。
Comments The paper was accepted at LM4UC workshop organize by IJCAI. I added a screenshot of the decision (Open Review)
在LGPD背景下简化需求工程:一项基于大语言模型(LLM)的研究
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究针对隐私法规合规转化为软件需求的挑战,探究LLM在LGPD框架下简化需求工程的可行性,提出利用法规自动生成用户故事和验收测试场景的方法,验证其能从软件初期确保合规。
Comments The document consists of 12 pages and includes 2 figures
安全测试作为LLM代码生成的可执行规范:益处、权衡与覆盖范围限制
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 该研究提出将安全测试作为LLM代码生成的可执行规范,开发SecTDD框架,通过多维度评估发现预先展示可见测试可提升联合成功率,结构化反馈修复效果更优但益处受多因素影响。
伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证
机构 * Zhejiang University(浙江大学)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)
AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。
GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间
机构 * Guangdong University of Technology(广东工业大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Shenzhen University(深圳大学) ; Xiamen University(厦门大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。
Comments 13 pages
技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。
Comments 24 pages, 8 figures
RoguePrompt: 双层加密用于自我重建以规避LLM审核
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。
Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version
从谁说了什么到他们是谁:用于说话人 diarization 的无训练模块化身份感知大语言模型优化
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对现有 SD+ASR 框架缺乏灵活性与真实说话人身份的问题,提出无训练模块化流水线,结合 SD、ASR 与 LLM 优化低置信度标签,在患者-临床医生数据集上实现 29.7% 相对误差降低,提供完整身份检测流水线。
筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)
AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。
Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)
从幻觉到谋略:一种统一的分类法和基准分析用于LLM欺骗
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出统一的LLM欺骗分类法,揭示现有基准在欺骗机制覆盖不足的问题,并为开发者和监管者提供改进建议。
Comments Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop