arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2407.02039 2026-05-18 cs.CL 86%

Prompt Stability Scoring for Text Annotation with Large Language Models

基于大语言模型的文本标注提示稳定性评分

Christopher Barrie, Elli Palaiologou, Petter Törnberg

机构 * Department of Sociology, New York University(纽约大学社会学系) Independent Researcher(独立研究者) Institute for Logic, Language, and Computation, University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文提出一种通用框架,通过传统方法改进内在和跨编码器可靠性评分,提出提示稳定性评分(PSS)及Python包promptstability,用于诊断低稳定性提示并展示功能。

Comments 39 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI 86%

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03992 2026-05-14 cs.CR cs.AI 86%

Quantitative Certification of Agentic Tool Selection

代理工具选择的定量认证

Jehyeok Yeon, Isha Chaudhary, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLMCert-T框架,通过统计方法为代理工具选择流程提供高置信度的正确性上限,揭示当前LLM代理在干扰选择和Top-N饱和规格下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11006 2026-05-13 cs.SE cs.AI 86%

An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning

一个经过执行验证的多语言基准用于代码语义推理

Yikun Li, Jinfeng Jiang, Ting Zhang, Chengran Yang, Chenxing Zhong, Yin Yide, Leow Wen Bin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

机构 * Singapore Management University(新加坡管理大学) Monash University(墨尔本大学) Nanjing University of Science and Technology(南京理工大学) GovTech Singapore(新加坡政府科技局)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TraceEval,首个经过执行验证的多语言代码语义推理基准,通过验证执行消除标注偏差,评估10个LLM在零样本下的表现,展示了其在代码语义推理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI 86%

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 评测与基准 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08687 2026-05-12 cs.DB cs.AI 86%

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?

PrepBench: 我们距离自然语言驱动的数据准备还有多远?

Jingzhe Xu, Rui Wang, Jiannan Wang, Guoliang Li

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(计算机科学与技术系,BNRist,清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PrepBench评估自然语言驱动的数据准备能力,涵盖交互澄清、代码生成和代码到工作流翻译三项核心能力,通过爬取数据挑战并设计系统性基准,揭示当前LLM在实现该范式转变中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00327 2026-05-12 cs.AI cs.HC 86%

SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Anticipation?

SayNext-Bench:为什么LLMs在下一句预测中挣扎?

Yueyi Yang, Haotian Liu, Fang Kang, Mengqi Zhang, Zheng Lian, Hao Tang, Haoyu Chen

机构 * University of Oulu(奥卢大学) College of William and Mary(威廉与玛丽学院) Tongji University(同济大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨LLM在人类对话中的下一句预测能力,指出人类可通过多模态线索预测,而LLM表现不足。提出SayNext-Bench基准,结合多模态数据集和评估框架,开发SayNext-Chat模型,证明其在多层面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07208 2026-05-11 cs.LG 86%

FAME: Forecasting Academic Impact via Continuous-Time Manifold Evolution

FAME:通过连续时间流形演变进行学术影响预测

Jianrong Ding, Jianyuan Zhong, Zhengyan Shi, Qiang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FAME框架,通过动态流形演变模型预测科研论文的学术影响,实验显示其在多维影响预测上优于现有LLM评估器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06919 2026-05-11 cs.CL 86%

Can LLMs Take Retrieved Information with a Grain of Salt?

大语言模型能否对获取的信息持谨慎态度?

Behzad Shayegh, Mohamed Osama Ahmed, Fred Tung, Leo Feng

机构 * RBC Borealis

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了八种LLM在上下文确定性服从方面的表现,发现其在不确定上下文中回忆先验知识、解释确定性表达和信任复杂上下文方面存在系统性限制,并提出结合先验提示、确定性重校准和上下文简化的方法,将服从误差降低了25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00113 2026-05-08 cs.MA cs.AI cs.CE cs.CY cs.SI 86%

AI Agents Alone Are Not (Yet) Sufficient for Social Simulation

仅靠AI代理不足以进行社会模拟

Yiming Li, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出LLM代理单独使用不足以实现真实的社会动态,提出需考虑环境互动和调度机制的统一框架。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01484 2026-05-05 cs.LG stat.ML 86%

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

通过随机游走评估大图属性估计中的LLM

Sunil Kumar Maurya, Xin Liu

机构 * University of Tokyo(东京大学) AIST(日本产业技术综合研究所)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出EstGraph基准数据集,设计四类任务估计大图属性,通过随机游走采样生成提示,评估LLM在大图场景下的推理能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01392 2026-05-05 cs.SE cs.AI 86%

Using LLMs in Software Design: An Empirical Study of GitHub and A Practitioner Survey

在软件设计中使用LLMs:GitHub和实践者调查的实证研究

Yifei Wang, Ruiyin Li, Peng Liang, Yangxiao Cai, Zengyang Li, Mojtaba Shahin, Arif Ali Khan, Qiong Feng

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Central China Normal University(中央财经大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) M3S Research Unit, University of Oulu(奥卢大学M3S研究单位) School of Computer Science, Nanjing University of Science(南京理工大学计算机学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究和调查,探讨开发者如何利用LLM进行软件设计,发现LLM在架构设计、数据模型设计等方面的应用,揭示其优势与局限性。

Comments 29 pages, 8 images, 6 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01372 2026-05-05 cs.CL 86%

Embedding-based In-Context Prompt Training for Enhancing LLMs as Text Encoders

基于嵌入的上下文提示训练:增强LLM作为文本编码器

Ailiang Lin, Zhuoyun Li, Keyu Mao, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究院) Tencent(腾讯)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EPIC方法,通过上下文学习生成高质量嵌入,减少计算负担,实验表明在MTEB基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06698 2026-05-04 cs.CL 86%

SCAN: Structured Capability Assessment and Navigation for LLMs

SCAN:面向大语言模型的结构化能力评估与导航

Zongqi Wang, Tianle Gu, Chen Gong, Xin Tian, Siqi Bao, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院) Baidu, Inc(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SCAN框架,通过细粒度评估实现对LLM能力的深入分析,揭示了同一类别下不同子能力的显著性能差异,强调了细粒度评估的重要性。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25083 2026-04-29 cs.AI cs.AR 86%

Agentic Architect: An Agentic AI Framework for Architecture Design Exploration and Optimization

代理架构:一种用于建筑设计探索和优化的代理AI框架

Alexander Blasberg, Vasilis Kypriotis, Dimitrios Skarlatos

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Agentic Architect框架,结合LLM驱动的代码进化与精确模拟,实现计算机架构设计的探索与优化,展示了在缓存替换、数据预取和分支预测等领域的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04802 2026-04-28 cs.CL 86%

Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs

注意差距:通过动作图评估LLM在模型和代理层面的漏洞

Ilham Wicaksono, Zekun Wu, Rahul Patel, Theo King, Adriano Koshiyama, Philip Treleaven

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。

Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16419 2026-04-28 cs.SE cs.LG 86%

Can LLMs Find Bugs in Code? An Evaluation from Beginner Errors to Security Vulnerabilities in Python and C++

LLMs能否发现代码中的错误?对Python和C++中初级错误到安全漏洞的评估

Akshay Mhatre, Noujoud Nader, Patrick Diehl, Deepti Gupta

机构 * 1 Dept. of Computer Information Systems, Texas A\&M University - Central Texas, TX, 76549 USA. 2 LSU Center for Computation \& Technology, Louisiana State University, Baton Rouge, LA, 70803 USA. 3 Department of Physics Astronomy, Louisiana State University, Baton Rouge, LA, 70803 USA. 4 Applied Computer Science (CCS-7), Los Alamos National Laboratory, Los Alamos, NM 87545 USA.

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了三个主流LLM在检测Python和C++中基础错误、经典安全漏洞及生产级bug的有效性,发现其在语法和语义问题上表现良好,但在复杂安全漏洞和大规模代码中性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23009 2026-04-28 cs.CL 86%

Chinese-SkillSpan: A Span-Level Dataset for ESCO-Aligned Competency Extraction from Chinese Job Ads

Chinese-SkillSpan: 一个用于从中文招聘广告中提取与ESCO对齐的胜任力的跨度级数据集

Guojing Li, Zichuan Fu, Junyi Li, Wenxia Zhou, Xinyang Wu, Jinning Yang, Jingtong Gao, Feng Huang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个中文JobSkillNER数据集Chinese-SkillSpan,采用LLM赋能的宏微协作标注流程,涵盖知识、技能、横向能力及语言能力四个维度,支持有效模型训练与评估。

Comments 18 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11772 2026-04-28 cs.LG 86%

LAMP: Extracting Local Decision Surfaces From Large Language Models

LAMP:从大型语言模型中提取局部决策表面

Ryan Chen, Youngmin Ko, Zeyu Zhang, Catherine Cho, Sunny Chung, Mauro Giuffré, Dennis L. Shung, Bradly C. Stadie

机构 * Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系) Section of Digestive Diseases, Department of Medicine, Yale School of Medicine(耶鲁医学院消化疾病科) Department of Biomedical Informatics and Data Science, Yale School of Medicine(耶鲁医学院生物医学信息学与数据科学系) Division of Gastroenterology and Hepatology, Department of Medicine, Mayo Clinic(梅奥诊所消化内科与肝病科)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.LG

AI总结 LAMP通过局部线性替代方法揭示语言模型决策表面,验证其解释与人类判断的一致性,并在多个任务中展示其对模型行为的审计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21510 2026-04-24 cs.CL 86%

OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving

OptiVerse:一个面向优化问题求解的综合基准

Xinyu Zhang, Boxuan Zhang, Yuchen Wan, Lingling Zhang, YiXing Yao, Bifan Wei, Yaqiang Wu, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) Lenovo Research(联想研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OptiVerse通过1000个跨领域问题评估LLM在复杂优化任务中的表现,揭示模型在难题上的性能下降,并提出Dual-View Auditor Agent提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12994 2026-04-24 cs.CR cs.AI 86%

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software

LogicEval: 一个系统框架用于评估自动修复技术在现实软件中逻辑漏洞的修复

Syed Md Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LogicEval框架,通过LogicDS数据集评估传统和基于LLM的修复方法,发现编译和测试失败主要由提示敏感性、代码上下文丢失和补丁定位困难导致。

Comments To appear in ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19633 2026-04-22 cs.AI cs.CE 86%

Time Series Augmented Generation for Financial Applications

时间序列增强生成用于金融应用

Anton Kolonin, Alexey Glushchenko, Evgeny Bochkov, Abhishek Saxena

机构 * SingularityNET Foundation(SingularityNET基金会)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的评估方法和基准,用于衡量LLM在金融时间序列分析中的推理能力,通过大规模实证研究验证了工具增强范式的有效性。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04925 2026-04-22 cs.CL 86%

Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences

AI生成的说服能否被检测?Persuaficial基准与AI与人类语言差异

Arkadiusz Modzelewski, Paweł Golik, Anna Kołos, Giovanni Da San Martino

机构 * NASK National Research Institute(波兰国家科研 institute) University of Padua(意大利帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨LLM生成的说服内容是否更难自动检测,通过Persuaficial基准对比人类与AI生成文本的语言差异,揭示细微说服策略对检测性能的影响。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI 86%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16167 2026-04-22 cs.HC cs.CL 86%

"You tell me": A Dataset of GPT-4-Based Behaviour Change Support Conversations

你告诉我:一个基于GPT-4的行为改变支持对话数据集

Selina Meyer, David Elsweiler

机构 * Regensburg University(莱茵河畔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于GPT-4的对话数据集,用于研究用户行为对LLM生成文本的影响,包含用户互动、语言分析和反馈数据,为行为改变系统设计提供实证支持。

Comments Preprint as accepted at the 2024 ACM SIGIR Conference on Human Information Interaction and Retrieval (CHIIR '24)

Journal ref In Proceedings of the 2024 Conference on Human Information Interaction and Retrieval (CHIIR '24). Association for Computing Machinery, New York, NY, USA, 411-416

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18389 2026-04-21 cs.CL 86%

Understanding the Prompt Sensitivity

理解提示敏感性

Yang Liu, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过泰勒展开分析LLM输出对输入提示的敏感性,推导出log概率差的上界,并发现LLM不像小网络那样聚类相似输入,导致提示敏感性难以降低至零。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16021 2026-04-21 cs.SE cs.AI 86%

Neurosymbolic Repo-level Code Localization

神经符号层面的代码定位

Xiufeng Xu, Xiufeng Wu, Zejun Zhang, Yi Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出KA-LCL问题,引入KA-LogicQuery基准测试,展示现有方法在无命名提示下的性能下降,提出LogicLoc框架结合LLM和Datalog实现精确代码定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05453 2026-04-21 cs.AI 86%

Conversational Process Model Redesign

对话过程模型重设计划

Nataliia Klievtsova, Timotheus Kampik, Juergen Mangler, Stefanie Rinderle-Ma

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨利用LLM通过迭代方式帮助领域专家进行过程模型创建与重设计,提出CPMR方法,通过识别文献中的过程变更模式并应用到模型中,同时评估LLM处理模式的能力,建议混合方法以提高用户输入质量。

Journal ref Int. J. Coop. Info. Syst. 2650004 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17778 2026-04-21 cs.LG 86%

TeleEmbedBench: A Multi-Corpus Embedding Benchmark for RAG in Telecommunications

TeleEmbedBench: 一种面向电信领域的多语料嵌入基准

Pranshav Gajjar, Vijay K Shah

机构 * NextG Wireless Lab, North Carolina State University, Raleigh, USA(NextG无线实验室,北卡罗来纳州立大学,拉斐特,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出TeleEmbedBench,首个针对电信领域RAG任务的多语料嵌入基准,评估八种嵌入模型在检索准确性和抗跨域干扰能力上的表现,发现LLM嵌入器性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17288 2026-04-21 cs.AR cs.AI 86%

Clover: A Neural-Symbolic Agentic Harness with Stochastic Tree-of-Thoughts for Verified RTL Repair

Clover:一种基于随机树-of-thoughts的神经符号代理体系用于验证RTL修复

Zizhang Luo, Yansong Xu, Runlin Guo, Fan Cui, Kexing Zhou, Mile Xia, Hongyuan Hou, Yuhao Luo, Yun Liang

机构 * Peking University(北京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Clover通过结构化搜索代码操作解决RTL修复问题,结合LLM和符号求解器动态调度任务,实现高可靠性修复,修复率高达96.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏