arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2606.14388 2026-06-15 cs.LG 新提交 85%

A Low-Rank Subspace Analysis of LLM Interventions

LLM干预的低秩子空间分析

Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。

Comments Mechanistic Interpretability Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13247 2026-06-12 cs.AI 新提交 85%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13380 2026-06-12 quant-ph cs.AI 新提交 85%

An LLM System for Autonomous Variational Quantum Circuit Design

用于自主变分量子电路设计的大语言模型系统

Kenya Sakka, Wataru Mizukami, Kosuke Mitarai

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) The University of Osaka(大阪大学) Graduate School of Engineering Science(工学研究科)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的自主代理框架,通过迭代设计量子电路,在量子特征映射和变分量子本征求解器任务中取得优于或媲美现有方法的性能。

Comments 63 pages, 19 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12966 2026-06-10 cs.CL cs.SE 版本更新 85%

ProbeLLM: Automating Principled Diagnosis of LLM Failures

ProbeLLM:自动化的大语言模型故障原则性诊断

Yue Huang, Zhengzhe Jiang, Yuchen Ma, Yu Jiang, Xiangqi Wang, Yujun Zhou, Yuexing Hao, Kehan Guo, Pin-Yu Chen, Stefan Feuerriegel, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) LMU Munich(慕尼黑大学) Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ProbeLLM框架,通过分层蒙特卡洛树搜索在全局探索与局部细化间分配预算,结合工具增强生成与验证,将故障发现从孤立案例提升为结构化故障模式,揭示更广泛、清晰、细粒度的故障景观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09435 2026-06-09 cs.CL 新提交 85%

MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models

MUDIDI:一种基于语言模型的多语言词典数字化两阶段框架

David Setiawan, Temuulen Khishigsuren, Milind Agarwal, Pagnarith Pit, Aso Mahmudi, Ekaterina Vylomova

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Melbourne School of Psychological Sciences, The University of Melbourne(墨尔本大学墨尔本心理科学学院) LILT

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL

AI总结 提出MUDIDI两阶段框架,结合语言模型实现多语言词典数字化,在字符识别、标记保留和词条分割上优于现有OCR和视觉语言模型,并发布30本公共领域词典的标注数据集。

Comments 9 pages, preprint, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07978 2026-06-09 cs.CL 新提交 85%

MechLens: Late Crystallization of Factual Knowledge Explains Intervention Effectiveness in Language Models

MechLens:事实知识的晚期结晶解释语言模型中的干预有效性

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);language model(title);分类 cs.CL

AI总结 本文发现LLM中的事实知识在最后层突然“结晶”,而非逐层涌现,并基于此提出结晶引导的干预原则,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06881 2026-06-08 cs.LG 新提交 85%

GlucoFM-Bench: Benchmarking Time-Series Foundation Models for Blood Glucose Forecasting

GlucoFM-Bench:血糖预测的时间序列基础模型基准测试

Baiying Lu, Zhaohui Liang, Ryan Pontius, Shengpu Tang, Temiloluwa Prioleau

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院) Emory University(埃默里大学) Quantitative Biomedical Sciences(定量生物医学科学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GlucoFM-Bench基准,评估8种时间序列基础模型与监督深度学习模型在15个糖尿病数据集上的血糖预测性能,发现预训练模型在零样本和少样本场景表现优异,但全样本下轻量LSTM仍最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06031 2026-06-05 cs.CL 85%

NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language Models

NAVIRA: 解耦随机重掩码用于掩码扩散语言模型

Andrey Fomenko, Maksim Kryzhanovskiy, Svetlana Glazyrina, Roman Ischenko

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对掩码扩散语言模型并行生成中的上下文污染问题,提出NAVIRA解码策略,通过解耦质量检测与重生成、随机采样重掩码位置,提升流畅性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03852 2026-06-03 cs.SE cs.AI 85%

FLARE: Fine-Grained Diagnostic Feedback for LLM Code Refinement

FLARE: 面向大语言模型代码精炼的细粒度诊断反馈

Yinsheng Yao, Hongxiang Zhang, Weixi Tong, Tianyi Zhang

机构 * Tongji University(同济大学) Purdue University(普渡大学)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出FLARE框架,利用轻量级诊断模型预测行级可疑信号进行缺陷定位和代码精炼,通过Top-K候选搜索提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03657 2026-06-03 cs.AI 85%

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

诊断大语言模型工具使用中的知识缺口:面向新API获取的智能体基准

Jinnuo Liu, Yue Peng, Jinhan Niu, Hongyi Wen

机构 * NYU Shanghai(纽约大学上海分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出 NovelAPIBench 基准,通过动态发现新API、分解知识包并生成可执行任务,诊断模型在API使用中的六类错误,发现检索与参数调优互补。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13996 2026-06-03 cs.AI 85%

DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training

DTop-p MoE:面向基础模型预训练的稀疏度可控动态Top-p MoE

Can Jin, Hongwu Peng, Mingcan Xiang, Qixin Zhang, Xiangchi Yuan, Amit Hasan, Ohi Dibua, Yifan Gong, Yan Kang, Dimitris N. Metaxas

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DTop-p动态路由机制,通过比例积分控制器学习Top-p概率阈值并采用动态路由归一化,在全局稀疏约束下实现层间专家选择,一致优于Top-k和固定Top-p基线,且FLOPs与Top-k MoE相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01995 2026-06-02 cs.CL 85%

CARTE: A Benchmark for Mapping Language Model Knowledge Across France

CARTE:法国语言模型知识映射基准

Sarah Almeida Carneiro, Christos Xypolopoulos, Xiao Fei, Yang Zhang, Michalis Vazirgiannis

机构 * École Polytechnique, Institut Polytechnique de Paris(巴黎政治学院) National Technical University of Athens(雅典国家技术大学) Mohamed bin Zayed University of Artificial Intelligence(姆阿扎德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出CARTE基准,通过2431道多选题评估大语言模型在法国13个大区14个主题领域的细粒度区域知识,并引入CARTE-LV子集聚焦语言变异,实验发现模型在区域和规模上存在性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00875 2026-06-02 cs.CL 85%

IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs

IDEAFix: 大语言模型中创造性去固定化提示的评估框架

F. Carichon, S. Sharma, M. Girard, R. Rampa, G. Farnadi

机构 * McGill University(麦吉尔大学) Mila Concordia University(康科迪亚大学) ÉTS

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出IDEAFix框架,通过控制任务变体和提示策略系统分析大语言模型在开放式创意生成中的发散思维,发现任务表述和属性选择显著影响性能,简单提示可提升原创性但输出同质化问题依然存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29629 2026-05-29 cs.AI 85%

Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures

超越攻击成功率:LLM安全失效的时间对数可观测性

Junyoung Park, Sunghwan Park, Seongyong Ju, Jaewoo Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出时间对数可观测性(TLO)方法,通过解码过程中的合规-拒绝边际将模型-攻击条件映射到校准的二维平面,揭示攻击成功的时间模式,并基于此设计早期停止规则将成功越狱减少一半以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18430 2026-05-19 cs.LG 85%

Text2CAD-Bench: A Benchmark for LLM-based Text-to-Parametric CAD Generation

Text2CAD-Bench: 一个用于基于LLM的文本到参数化CAD生成的基准

Liang Wang, Heng Meng, Zekai Xiang, Jin Liu, Pingyi Zhou, Litao Chen, Yongqiang Tang

机构 * School of Computer Science, Wuhan University, Wuhan 430000, Hubei, China(武汉大学计算机科学学院) Spatial Design Intelligence Lab, BitInf Ltd., Shanghai 200003, China(BitInf Ltd.空间设计智能实验室) College of Computer and Information Engineering, Nanjing Tech University, Nanjing 211800, Jiangsu, China(南京理工大学计算机与信息工程学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出Text2CAD-Bench,首个系统评估文本到CAD在几何复杂度和应用多样性方面的基准,发现当前模型在基本几何上表现良好,但在复杂拓扑和高级功能上表现下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14761 2026-05-15 cs.AI cs.HC 85%

AI Outperforms Humans in Personalized Image Aesthetics Assessment via LLM-Based Interviews and Semantic Feature Extraction

人工智能在基于大语言模型的访谈和语义特征提取的个性化图像审美评估中胜过人类

Yoshia Abe, Tatsuya Daikoku, Yasuo Kuniyoshi

机构 * Graduate School of Information Science and Technology(信息科学与技术研究生院) The University of Tokyo(东京大学) Bunkyo-ku, Tokyo(东京都文京区)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合深度学习与大语言模型的系统,通过语义特征提取和主动收集偏好信息,准确预测个体图像审美评价,实验表明该系统在高评分图像上表现优异,优于人类预测者和自身再评估。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10639 2026-05-12 cs.AI 85%

Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks

在LLM评估之海中航行:探究毒性基准中的偏见

Regina Gugg, Selina Niederländer, Andreas Stöckl, Martin Flechl

机构 * Dynatrace Research, Linz, Austria(奥地利林茨Dynatrace研究机构) University of Applied Sciences Upper Austria, Hagenberg, Austria(上奥地利应用科学大学哈根贝格分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了毒性基准的鲁棒性,发现评估设置变化会导致基准行为差异,任务类型改变会增加有害内容被标记的倾向,且输入数据域变化时基准表现不稳定,需更完善的评估框架。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08800 2026-05-12 cs.CV cs.AI 85%

PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

PPU-Bench: 用于视觉语言模型个性化部分遗忘的现实世界基准

Jiahui Guang, Zexun Zhan, Zhenlin Xu, Cuiyun Gao, Haiyan Wang, Jing Li, Zhaoquan Gu, Yanchun Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Zhejiang Normal University(浙江师范大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出PPU-Bench,一个无需微调的现实世界基准,用于评估视觉语言模型中个性化部分遗忘的效果,通过24K多模态和单模态样本测试遗忘与保留的平衡及跨模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06707 2026-05-11 cs.SE cs.AI 85%

The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking

单文件测试:一项纵向的公共接口评估,评估首次输出LLM网页生成与社交传播跟踪

Diego Cabezas Palacios

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过8周的观察比较,评估了17项公共实验中收集的68个单文件HTML生成,比较了GPT、Gemini、Grok和Claude四种推理模型家族在固定公共接口协议下的表现,发现Claude在性能和一致性上表现最佳,但模型家族对代码冗余的影响大于提示词内容。

Comments 23 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24977 2026-04-29 cs.CL cs.HC 85%

A Survey on LLM-based Conversational User Simulation

基于大语言模型的对话用户模拟综述

Bo Ni, Leyao Wang, Yu Wang, Branislav Kveton, Franck Dernoncourt, Yu Xia, Hongjie Chen, Reuben Leura, Samyadeep Basu, Subhojyoti Mukherjee, Puneet Mathur, Nesreen Ahmed, Junda Wu, Li Li, Huixin Zhang, Ruiyi Zhang, Tong Yu, Sungchul Kim, Jiuxiang Gu, Zhengzhong Tu, Alexa Siu, Zichao Wang, David Seunghyun Yoon, Nedim Lipka, Namyong Park, Zihao Lin, Trung Bui, Yue Zhao, Tyler Derr, Ryan A. Rossi

机构 * Vanderbilt University(范德比大学) Adobe Research(Adobe研究) Yale University(耶鲁大学) University of Oregon(俄勒冈大学) University of California San Diego(加州大学圣地亚哥分校) Dolby Laboratories(Dolby实验室) University of California, Berkeley(加州大学伯克利分校) Cisco AI Research(思科人工智能研究) University of Southern California(南加州大学) Texas A&M University(德克萨斯阿姆斯特朗大学) UC Davis(加州大学戴维斯分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了基于大语言模型的对话用户模拟最新进展,提出新的分类体系,分析核心技术和评估方法,旨在推动未来研究。

Comments Submitted in August 2025. MOD-81000 approved survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12134 2026-04-28 cs.AI cs.HC 85%

Value Alignment Tax: Measuring Value Trade-offs in LLM Alignment

价值对齐税:在大语言模型对齐中测量价值权衡

Jiajun Chen, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

专题命中 评测与基准 :LLM(title,abstract_cn);preference optimization(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出VAT框架,用于测量对齐干预如何影响价值系统,揭示目标值与非目标值之间的系统性权衡,通过实验数据展示对齐过程中的潜在风险。

Comments Preprint. Under review. 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13413 2026-04-16 cs.LG 85%

Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models

数据层面指标削弱非确定性:扩散语言模型中的细粒度非确定性评估

Zhengyu Fang, Zhimeng Jiang, Huiyuan Chen, Xiaoge Zhang, Tianyi Li, Kaiyu Tang, Xiao Li, Jing Li

机构 * Department of Computer Data Sciences, Case Western Reserve University, Cleveland, USA Department of Computer Science \& Engineering, Texas A\&M University, College Station, USA Department of Biochemistry, Case Western Reserve University, Cleveland, USA Center for RNA Science Therapeutics, Case Western Reserve University, Cleveland, USA Department of Biomedical Engineering, Case Western Reserve University, Cleveland, USA

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.LG

AI总结 本文研究了扩散语言模型中非确定性问题,指出数据层面指标限制了对模型行为变化的洞察,并提出基于样本级预测差异的细粒度评估方法,揭示了非确定性在代码生成中的高敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11154 2026-04-14 cs.AI 85%

Environmental Footprint of GenAI Research: Insights from the Moshi Foundation Model

生成式AI研究的环境足迹:来自Moshi基金会模型的洞察

Marta López-Rauhut, Loic Landrieu, Mathieu Aubry, Anne-Laure Ligozat

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM, CNRS, 古斯塔夫·埃菲尔大学, ENPC, 巴黎综合理工学院) Université Paris-Saclay, CNRS, LISN(巴黎-萨克雷大学, CNRS, LISN) Université Paris-Saclay, CNRS, ENSIIE, LISN(巴黎-萨克雷大学, CNRS, ENSIIE, LISN) Kyutai

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过细粒度分析Moshi模型的计算消耗,首次量化了生成式多模态大语言模型(MLLM)研究的环境影响,揭示了计算密集型研究的能耗与环境成本,为可持续AI研究提供指导。

Comments 28 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15481 2026-04-14 cs.LG 85%

LLM-as-Judge on a Budget

在预算限制下的人工智能语言模型作为裁判

Aadirupa Saha, Aniket Wagde, Branislav Kveton

机构 * UIC(伊利诺伊大学芝加哥分校) Adobe

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种基于多臂老虎机理论的变异性自适应方法,用于在有限预算下优化对提示-响应对的查询分配,以最小化评估误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23966 2026-04-14 cs.CR cs.AI 85%

Policy-Guided Threat Hunting: An LLM enabled Framework with Splunk SOC Triage

基于策略的威胁狩猎:一个由LLM赋能的框架与Splunk SOC分拣

Rishikesh Sahay, Bell Eapen, Weizhi Meng, Md Rasel Al Mamun, Nikhil Kumar Dora, Manjusha Sumasadan, Sumit Kumar Tetarave, Elyson De La Cruz

机构 * Department of Management Information Systems, University of Illinois, Springfield, USA(美国伊利诺伊大学斯普林菲尔德分校管理信息系统系) School of Computing and Communications, Lancaster University, United Kingdom(英国兰卡斯特大学计算与通信学院) School of Computer Applications, Kalinga Institute of Industrial Technology, India(印度卡林加工业技术学院计算机应用学院) School of Information Technology and Artificial Intelligence, University of Cumberlands, USA(美国坎伯兰大学信息技术与人工智能学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个自动化威胁狩猎框架,结合LLM与Splunk平台,通过多层模型实现动态威胁适应与风险优先级评估,提升SOC分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09240 2026-04-13 cs.LG 85%

DiffHLS: Differential Learning for High-Level Synthesis QoR Prediction with GNNs and LLM Code Embeddings

DiffHLS: 基于GNN和LLM代码嵌入的高阶综合QoR预测差分学习

Zedong Peng, Zeju Li, Qiang Xu, Jieru Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 DiffHLS通过GNN和LLM代码嵌入预测高阶综合QoR,利用核基线与pragma插入设计变体的差分学习,降低合成成本,实验显示在PolyBench上优于GNN基线,且在ForgeHLS数据集上验证了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08779 2026-04-13 cs.LG 85%

Adaptive Simulation Experiment for LLM Policy Optimization

面向LLM策略优化的自适应模拟实验

Mingjie Hu, Siyang Gao, Jian-qiang Hu, Enlu Zhou

机构 * School of Management, Fudan University(复旦大学管理学院) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H. Milton Stewart工业与系统工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于配对比较的自适应模拟实验框架,用于从有限候选策略中识别最优策略。通过无结构和有结构策略空间,推导最优采样比例并证明算法在统计保证下达到基本数据要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04989 2026-04-10 cs.SE cs.CY cs.LG 85%

BacPrep: Lessons from Deploying an LLM-Based Bacalaureat Assessment Platform

BacPrep: 从部署一个基于大语言模型的本科评估平台中获得的教训

Adrian-Marius Dumitran, Radu Dita, Angela Liliana Dumitran

机构 * University of Bucharest(布加勒斯特大学) Universitatea Creștină "Dimitrie Cantemir"(迪米特里·坎特米尔基督教大学) Cu Drag si Sport SRL(Cu Drag si Sport 有限公司) Softbinator Technologies(Softbinator 技术公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BacPrep利用大语言模型进行自动评估,旨在为罗马尼亚本科考试提供免费资源。通过分析学生解题,发现评估中存在不一致性和误差,提出改进架构以提高准确性。

Comments First version ACCEPTED at BBGI (ITS 2025 Workshop) Second versions ACCEPTED at ITS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15494 2026-04-10 cs.SE cs.AI cs.PF 85%

Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software

AI模型是否梦想着更快的代码?对LLM在现实软件中提出性能改进的实证研究

Lirong Yi, Gregory Gay, Philipp Leitner

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过65个性能关键的开源Java项目任务,评估LLM生成复杂工程问题的性能,发现其解法波动大且低于人类开发者,指出当前算法任务基准评估过于乐观,需转向更复杂的代理系统以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06663 2026-04-09 cs.CY cs.AI 85%

Restoring Heterogeneity in LLM-based Social Simulation: An Audience Segmentation Approach

在基于大语言模型的社会模拟中恢复异质性:一种受众细分方法

Xiaoyou Qin, Zhihong Li, Xiaoxiao Cheng

机构 * School of Journalism, Fudan University(复旦大学新闻学院) College of Media and International Culture, Zhejiang University(浙江大学传媒与国际文化学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过受众细分方法恢复基于大语言模型的社会模拟中的异质性,利用美国气候意见调查数据,比较不同细分配置在两个大语言模型上的表现,发现适度细化能提升性能,但过度细化可能损害结构和预测忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏