arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2607.00939 2026-07-02 cs.SE quant-ph 新提交 88%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12415 2026-07-02 cs.SE 版本更新 88%

SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?

SWE-Perf:语言模型能否优化真实仓库中的代码性能?

Xinyi He, Qian Liu, Mingzhe Du, Lin Yan, Zhijie Fan, Yiming Huang, Yin Zheng, Zejian Yuan, Zejun Ma

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)

AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27619 2026-06-29 cs.AI cs.CL cs.HC cs.IR cs.LG 新提交 88%

DysLexLens: A Low-Resource LLM Framework for Analysing Dyslexic Learners Insights from Online Forums

DysLexLens:面向低资源场景的LLM框架,用于分析在线论坛中阅读障碍学习者的见解

Dana Rezazadegan, Atie Kia, Phongpadid Nandavong, Dominique Carlon, Jeremy Nguyen, Abhik Banerjee, James Marshall, Anthony McCosker, Yong-Bin Kang

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DysLexLens框架,通过字典过滤、知识图谱推理和评估机制,从低资源论坛数据中分析阅读障碍学习者对AI工具的使用体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13072 2026-06-29 cs.CL cs.AI cs.LG 版本更新 88%

LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试

Xiang Long, Li Du, Yilong Xu, RongJian Xu, Qiyanhui Lu, Ying Gao, Qinhua Xie, Fangcheng Liu, Ning Ding, Haoqing Wang, Ziheng Li, Changjiang Zhou, Jianyuan Guo, Yehui Tang

机构 * Samsung Research(三星研究院) HKUST (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 88%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24973 2026-06-25 cs.CL cs.AI cs.CY cs.LG 新提交 88%

LLM Performance on a Real, Double-Marked GCSE Benchmark

LLM在真实双评GCSE基准测试中的表现

Malachy Fox, Kavi Samra, Paul Jung

机构 * Medly AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究引入包含32,534份双评真实学生GCSE模拟考试回答的数据集,测试大型语言模型与考官评分的一致性,发现顶级模型比考官之间更一致,为自动化评分提供经济有效的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14312 2026-06-15 cs.DB 新提交 88%

PLRTune: Importance Pre-Sampling and LLM-Guided Reinforcement Learning for Automatic Database Tuning

PLRTune:基于重要性预采样和LLM引导的强化学习自动数据库调优

Xinyue Yang, Chen Zheng, Yaoyang Hou, Renhao Zhang, Yinyan Zhang, Heng Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PLRTune系统,通过重要性预采样识别关键旋钮子集,结合执行引导的提示精炼和TD3强化学习,在MySQL和PostgreSQL上平均性能提升9.50%,调优速度提升9.03倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11196 2026-06-11 cs.CL cs.AI cs.CR cs.LG 新提交 88%

PoQ-Judge: A Multi-Architecture Evaluation Framework for Cost-Aware Proof-of-Quality in Decentralized LLM Inference

PoQ-Judge:去中心化LLM推理中成本感知的证明质量的多架构评估框架

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PoQ-Judge框架,训练专用裁判模型对查询-输出对进行无参考评分,研究三种架构,最佳模型在Pearson相关性上达到0.747,级联评估降低72.7%成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08807 2026-06-09 cs.CY 新提交 88%

A Classroom Study of LLM-Generated Feedback Intervention in Introductory Programming

LLM生成反馈干预在入门编程中的课堂研究

Hasnain Heickal, Andrew Lan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过随机对照实验,比较自然语言提示、AI生成测试用例和无反馈三种条件,发现自然语言反馈显著提高完成率和收敛速度,而测试用例反馈效果取决于其有效性。

Comments Accepted at IRAISE 2026 (Festival of Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07054 2026-06-08 cs.CL cs.AI cs.CR cs.LG 新提交 88%

TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

TRACE: 通过自适应跨步骤证据聚合的LLM智能体轨迹推理

Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli, Snigdha Ansu, Mohammadreza Teymoorianfard, Franck Dernoncourt, Hongjie Chen, Yu Wang, Ryan A. Rossi, Nesreen K. Ahmed

机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究) Dolby Labs(杜比实验室) University of Oregon(俄勒冈大学) Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TRACE框架,通过TIJ循环识别高信号区域、累积跨步骤证据并合成轨迹级判决,在SHADE-Arena的十个任务域上F1达0.713,召回率0.844,尤其擅长长距离证据链接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26046 2026-06-05 cs.CL cs.AI cs.LG cs.MA cs.SE 88%

When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges

当梯度冲突时:多目标提示优化用于LLM评判器的失败模式

Parth Darshan, Abhishek Divekar

机构 * IIT Jodhpur(印度理工学院乔普里尔) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多目标文本梯度优化中梯度稀释和指令干扰两种失败模式,通过分解优化器信息共享方式揭示性能下降原因。

Comments Accepted at ACL 2026 - CustomNLP4U Workshop. Code, prompts and data available at https://github.com/adivekar-utexas/when-gradients-collide

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01210 2026-06-02 cs.DB 88%

Can we trust LLM Self-Explanations for Entity Resolution?

我们能信任大语言模型在实体解析中的自解释吗?

Tommaso Teofili, Donatella Firmani, Nick Koudas, Paolo Merialdo, Divesh Srivastava

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究系统评估了大语言模型在实体解析任务中自解释的可靠性,发现其不稳定且不忠实,并提出混合解释框架Uncerta以平衡解释质量与计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08964 2026-06-01 cs.LG cs.AI cs.CL cs.CY 88%

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

语言模型智能体中目标导向性的行为与表征评估

Raghu Arghal, Fade Chen, Niall Dalton, Evgenii Kortukov, Calum McNamara, Angelos Nalmpantis, Moksh Nirvaan, Gabriele Sarti, Mario Giulianelli

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) Indiana University, Bloomington(印第安纳大学,布卢明顿) Northeastern University(东北大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合行为评估与内部表征可解释性分析的目标导向性评估框架,并以LLM智能体在2D网格世界中的导航为例,验证了其行为与表征的一致性。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26186 2026-05-28 cs.SE cs.AI cs.CL cs.LG 88%

SetupX: Can LLM Agents Learn from Past Failures in Functionality-Correct Code Repository Setup?

SetupX:LLM代理能否从过去的功能正确代码仓库设置失败中学习?

Zihang Zhou, Ziqian Ren, Yukai Wu, Yingjie Xiong, Wei Zhou, Chao Peng, Dong Zhang, Bingheng Yan, Xuanhe Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究者) Jinan Inspur Data Technology Co., Ltd.(济南 Inspur 数据技术有限公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SetupX框架,通过经验学习、推测执行和验证协议解决代码仓库设置中的跨仓库经验迁移、多步试错和鲁棒验证问题,在基准测试中达到92%通过率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20530 2026-05-27 cs.AI cs.CL cs.LG cs.SE 88%

AgentAtlas: Beyond Outcome Leaderboards for LLM Agents

AgentAtlas:超越LLM智能体的结果排行榜

Parsa Mazaheri, Kasra Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AgentAtlas框架,通过控制决策分类法和轨迹故障词汇表,将智能体评估从结果成功分离为控制决策质量和轨迹质量,并揭示仅依赖结果排行榜的测量风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21491 2026-05-22 cs.LG cs.AI cs.CL 88%

Teaching Language Models to Forecast Research Success Through Comparative Idea Evaluation

通过比较想法评估教授语言模型预测研究成功的技巧

Srujan P Mule, Aniketh Garikaparthi, Manasi Patwardhan

机构 * IISER Pune(印度理工学院帕内尔)

专题命中 评测与基准 :language model(title,abstract);SFT(abstract,abstract_cn);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了语言模型能否在无需实验的情况下预测研究想法的实证成功,通过构建基于PapersWithCode客观结果的11488对想法数据集,发现通过强化学习可提升模型性能至71.35%,证明小型语言模型可以作为有效的客观验证器,为自主科学发现提供可扩展路径。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18642 2026-05-19 eess.SY cs.SY 88%

A Benchmark on LLM-Based Power Flow Computation: Do More Structured Prompts Help?

基于LLM的潮流计算基准测试:结构化提示是否更有帮助?

Tingwei Chen, Kaiyang Huang, Kai Sun

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过对比三种LLM在不同提示格式下的表现,探讨了结构化提示在电力系统潮流计算中的有效性,并发现Gemini 2.5 Pro在简单叙述提示下表现最佳,但结构化提示反而降低了准确性,而GPT-3.5 Turbo在所有提示格式下均表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12034 2026-05-15 cs.SE cs.CR 88%

OpDiffer: LLM-Assisted Opcode-Level Differential Testing of Ethereum Virtual Machine

OpDiffer:基于LLM的以太坊虚拟机指令级差分测试

Jie Ma, Ningyu He, Jinwen Xi, Mingzhe Xing, Haoyu Wang, Ying Gao, Yinliang Yue

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 OpDiffer利用LLM和静态分析方法,针对EVM安全测试中的输入多样性不足和无法自动定位bug问题,提出指令级差分测试框架,发现26个未知bug,提升代码覆盖率达71.06%等。

Comments To appear in ISSTA'25

Journal ref Proc. ACM Softw. Eng. 2, ISSTA, Article ISSTA069 (2025), 1559-1582

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15977 2026-05-12 cs.CV 88%

Are vision-language models ready to zero-shot replace supervised classification models in agriculture?

视觉语言模型是否准备好在农业中零样本取代监督分类模型?

Earl Ranario, Mason J. Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);prompting(abstract)

AI总结 本文评估了视觉语言模型在农业图像分类中的性能,发现零样本模型在多数任务中表现逊于监督模型,但通过提示策略可提升效果,表明需结合特定接口和评估策略以提升应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03511 2026-05-12 cs.CL cs.AI cs.LG 88%

IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation

IntroLM:通过预填充阶段自我评估实现反思语言模型

Hossein Hosseini Kasnavieh, Gholamreza Haffari, Chris Leckie, Adel N. Toosi

机构 * DisNet Lab, School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院DisNet实验室) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) Department of Data Science & AI, Monash University, Australia(墨尔本大学数据科学与人工智能系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IntroLM通过在预填充阶段引入自我评估机制,使语言模型能预测自身输出质量,无需外部评估器,提升了生成效率和准确性。

Comments Accepted for publication in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06623 2026-05-11 cs.AI cs.CL cs.LG cs.MA 88%

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO:基于大语言模型的多智能体系统的联合提示优化

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15368 2026-04-20 cs.CR 88%

LogJack: Indirect Prompt Injection Through Cloud Logs Against LLM Debugging Agents

LogJack:通过云日志间接提示注入攻击大语言模型调试代理

Harsh Shah

专题命中 评测与基准 :LLM(title,summary_cn);foundation model(abstract)

AI总结 研究通过云日志内容对LLM调试代理进行间接提示注入攻击,提出LogJack基准测试集,并评估8个基础模型在不同提示条件下的表现,发现部分模型在主动条件下可执行命令,而防护措施大多失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14793 2026-04-17 q-fin.CP 88%

LR-Robot: An Human-in-the-Loop LLM Framework for Systematic Literature Reviews with Applications in Financial Research

LR-Robot:一种人机协同的LLM框架用于系统性文献综述及其在金融研究中的应用

Wei Wei, Jin Zheng, Zining Wang, Weibin Feng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对传统系统性文献综述在金融研究中难以应对大规模复杂文献的问题,提出LR-Robot框架,结合领域专家定义的分类体系与大语言模型进行高效分类,并通过人机协同评估确保可靠性,支持时间演化跟踪和增强引用网络分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00946 2026-04-08 eess.IV cs.CV 88%

Ultrasound-based detection and malignancy prediction of breast lesions eligible for biopsy: A multi-center clinical-scenario study using nomograms, large language models, and radiologist evaluation

基于超声的乳腺病变 biopsy 推荐和恶性预测:一种结合 BIRADS 特征和定量形态学特征的多中心临床场景研究,使用 nomograms、大型语言模型和放射科医生评估

Ali Abbasian Ardakani, Afshin Mohammadi, Taha Yusuf Kuzan, Beyza Nur Kuzan, Hamid Khorshidi, Ashkan Ghorbani, Alisa Mohebbi, Fariborz Faeghi, Sepideh Hatamikia, U Rajendra Acharya

机构 * Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Urmia University of Medical Science(乌尔米耶医科大学) University of Health Sciences(健康科学大学) Kartal Dr. Lütfi Kırdar City Hospital(卡尔塔尔·吕特菲·克尔达尔市医院) University of Padova(帕多瓦大学) Universal Scientific Education and Research Network (USERN)(全球科学教育与研究网络(USERN)) Tehran University of Medical Sciences(德黑兰医科大学) Danube Private University(多瑙河私立大学) Austrian Center for Medical Innovation and Technology (ACMIT)(奥地利医学创新与技术中心(ACMIT)) University of Southern Queensland(南昆士兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了结合 BIRADS 特征和定量形态学特征的 nomogram 在乳腺病变 biopsy 推荐和恶性预测中的性能,对比了放射科医生和大型语言模型的诊断效果,展示了 nomogram 的优越性。

Comments Academic Radiology (2026)

Journal ref "Ultrasound-based detection and malignancy prediction of breast lesions eligible for biopsy: A multi-center clinical-scenario study using nomograms, large language models, and radiologist evaluation." Academic Radiology (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20882 2026-03-24 cs.IR cs.AI cs.CL cs.LG 88%

RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation

RubricRAG: 通过领域知识检索实现可解释且可靠的LLM评估

Kaustubh D. Dhole, Eugene Agichtein

机构 * Department of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出RubricRAG,通过领域知识检索生成可解释的评估 rubric,提升LLM评估的透明性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18053 2026-01-27 cs.CL cs.AI cs.LG 88%

Addressing LLM Diversity by Infusing Random Concepts

通过注入随机概念来解决LLM多样性问题

Pulin Agrawal, Prasoon Goyal

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过在提示中注入随机概念提高LLM输出多样性,并提出系统评估协议以更系统地研究LLM多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05648 2026-01-12 q-bio.GN cs.AI cs.CL cs.LG 88%

Open World Knowledge Aided Single-Cell Foundation Model with Robust Cross-Modal Cell-Language Pre-training

开放世界知识辅助的单细胞基础模型与鲁棒跨模态细胞-语言预训练

Haoran Wang, Xuanyi Zhang, Shuangsang Fang, Longke Ran, Ziqing Deng, Yong Zhang, Yuxiang Li, Shaoshuai Li

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 OKR-CELL通过开放世界知识和鲁棒跨模态预训练,提升单细胞基础模型在细胞-语言跨模态任务中的表现。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17992 2025-12-23 cs.RO 88%

Unifying Deep Predicate Invention with Pre-trained Foundation Models

统一深度谓词发明与预训练基础模型

Qianwei Wang, Bowen Li, Zhanpeng Luo, Yifan Xu, Alexander Gray, Tom Silver, Sebastian Scherer, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Computer Science and Engineering Division, University of Michigan(密歇根大学计算机科学与工程系) Department of Computer Science, University of Pittsburgh(匹兹堡大学计算机科学系) Centaur AI Institute(Centaur人工智能研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 UniPred通过双层学习框架统一深度谓词发明与预训练基础模型,提升机器人任务的可扩展性和灵活性。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20578 2025-12-16 cs.SE 88%

LLPut: Investigating Large Language Models for Bug Report-Based Input Generation

LLPut: 探究大型语言模型在基于bug报告的输入生成中的应用

Alif Al Hasan, Subarna Saha, Mia Mohammad Imran, Tarannum Shaila Zaman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LLPut技术,评估三种开源生成式LLMs在从bug报告中提取相关输入方面的性能,探讨生成式LLMs在自动bug诊断中的能力和限制。

Journal ref The First International Workshop on Large Language Model-Oriented Empirical Research (LLanMER 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09051 2025-11-04 cs.CL cs.AI cs.IR cs.LG 88%

Complex QA and language models hybrid architectures, Survey

Xavier Daull, Patrice Bellot, Emmanuel Bruno, Vincent Martin, Elisabeth Murisasco

机构 * Naval Group(海军集团) Toulon Université(图卢兹大学) Aix Marseille Univ(阿维尼昂-马赛大学) CNRS(法国国家科学研究中心) LIS(信息科学实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏