Towards Objective-Tailored Genetic Improvement Through Large Language Models
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
Comments Accepted to the 12th International Workshop on Genetic Improvement
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
Comments Accepted to the 12th International Workshop on Genetic Improvement
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
在压力下:情感框架引发小型语言模型可测量的行为转变和结构化内部几何
机构 * Independent Researcher(独立研究者)
专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI
AI总结 该研究探讨情感框架如何影响小型本地部署语言模型的行为和内部表示,通过四个不可能约束编码任务和八个后续框架评估,发现压力框架在行为和内部几何上产生显著变化,同时揭示了模型在不同框架下的响应模式。
Comments 18 pages, 4 figures. Exploratory empirical study with fully local experiments on small open language models. Code and data: https://github.com/ranausmanai/LLMEmotionGeometry
对本地部署LLM在Python代码中检测bug的实证评估
机构 * Independent Researcher Master of Electrical(独立研究者 电气工程硕士)
专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文评估了本地部署的LLaMA 3.2和Mistral在Python bug检测中的性能,发现其准确率在43%-45%之间,但难以精确定位修复。
Comments 8 pages, 5 figures. Code available at https://github.com/insajder/llm-bug-detection
机构 * Microsoft(微软公司) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学)
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,comments);分类 cs.CL、cs.AI
Comments The collection of papers reviewed in this survey will be hosted and regularly updated on the GitHub repository: https://github.com/vyokky/LLM-Brained-GUI-Agents-Survey Additionally, a searchable webpage is available at https://aka.ms/gui-agent for easier access and exploration
PeakBench:面向大语言模型智能体的资源感知工具调用基准测试
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Nanjing University(南京大学)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 PeakBench是面向LLM智能体的资源感知工具调用基准,通过两部分评估框架解耦逻辑规划与物理调度,实验表明资源信息可减少溢出、提升利用率,为相关研究提供测试平台。
SA-Bench:评估基于大语言模型的论文复现中的语义对齐
机构 * Beihang University(北京航空航天大学) ; Shanghai Jiao Tong University(上海交通大学) ; Minzu University of China(中央民族大学) ; Peking University(北京大学) ; Zhongguancun Academy(中关村科学院)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 本研究推出SA-Bench基准,评估LLM复现论文时的语义对齐,发现现有模型复现准确率低,需优化脚手架以提升语义规范验证能力。
Comments Accepted to Findings of EMNLP 2026
WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。
Comments 8 pages, 1 figure, AAAI2027
StateTune:将大语言模型辅助的EDA流程调优转化为有状态的闭环过程
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG
AI总结 StateTune将LLM辅助的EDA调优改为有状态闭环过程,以持久优化记忆为核心,结合EHVI引导的提升策略,在六个基准模块上性能优于多个基线,验证了设计有效性。
Comments Accepted to the 2026 IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)
RENDER:控制LLM记忆评估中面向读者的证据
机构 * University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 RENDER是控制LLM记忆评估中面向读者证据的基准,实验显示其相关数据包比原始对话表现更优,效果可迁移,提示需关注评估中的读者面向人工制品。
FIDES:一种针对大语言模型生成交易策略的一致性协议
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 FIDES是针对LLM生成交易策略的一致性测量协议,通过三类产物的一致性打分发现一致性不预测收益、自我评估校准不足等关键结果,为测量保真度提供方案。
长视野多智能体大语言模型商业环境中涌现的对齐失效通信
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。
每个词元都重要:用于测量大语言模型态度与偏差的精确李克特量表分布
机构 * McGill University(麦吉尔大学) ; University Canada West(加拿大西部大学) ; Toronto Metropolitan University(多伦多都会大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 该研究提出结合人类心理测量学与LLMs机制的精确框架,通过因子实验、词元级PMFs及对应分析方法,分离LLMs的系统性原产国偏差。
超越端到端成功:诊断长视野安全大语言模型智能体的失败
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对长视野安全LLM智能体,提出带检查点的诊断方法,发现Gemini 2.5 Flash失败多因未观测到需复用状态,92种子研究显示针对性指导可提升其状态观测率至95.4%,且失败主因随模型代际变化,需诊断失败根源而非仅看总体成功。
超越原始文本记录:面向基于大语言模型的数字孪生的结构化角色提取
机构 * University of Chicago(芝加哥大学)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 本研究针对基于LLM的数字孪生,提出结构化角色提取方法,发现信息结构是性能关键,固定结构难通用,自动结构发现流水线可恢复性能并提升准确率。
Comments Preprint. Submitted to NeurIPS 2026
ReguSim:评估大语言模型智能体在金融合规中的规则落地
机构 * HKUST(香港科技大学) ; HKBU(香港浸会大学) ; NTU(新加坡南洋理工大学)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。
PersonalBench:测量大语言模型个性化中的作者差距
机构 * Independent AI Researcher(独立人工智能研究员)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 本研究推出PersonalBench基准,通过LUAR、LLM评判者、自动风格计量学评估LLM个性化方法,发现其可区分作者但未达人类水平,发布该基准为LLM个性化提供校准工具。
Comments 17 pages. Extended version
CentaurBench:评估大型语言模型在增强与自动化现实工作任务方面的能力
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 CentaurBench基准测试显示LLM的自动化能力与辅助能力仅适度相关,多数自动化优胜者在增强任务中表现不佳,辅助效果并非始终为正,表明需按模型在多智能体系统中的角色评估模型。
Comments 46 pages, 15 figures
EvoTS-Agent:一种用于金融时间序列变点检测的自进化大语言模型智能体
机构 * Alan Turing Institute(阿兰·图灵研究所) ; University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学) ; NatWest AI Research(国民西敏寺银行人工智能研究部) ; University of Edinburgh(爱丁堡大学) ; University College London(伦敦大学学院)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对金融时间序列变点检测难题,提出自进化 LLM 智能体 EvoTS-Agent,经验证引导进化检测流程,在四个基准数据集上表现优于现有同类智能体且执行成功率达100%。
AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准
机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。
Comments 38 pages, 7 figures, 6 tables
PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试
机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。
基于大语言模型的并行DEVS状态图生成与验证框架
机构 * Arizona State University(亚利桑那州立大学) ; Intel Corporation(英特尔公司)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG
AI总结 本研究提出智能体式PDEVS-LLM框架,辅助建模人员生成验证PDEVS状态图,经评估该框架可显著提升生成状态图的逻辑一致性。
Comments 22 pages, 5 figures, 9 tables, 1 algorithm
DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准
机构 * Microsoft(微软公司)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。
面向安全的大语言模型智能体:规范、验证与执行的综述
机构 * The University of Manchester(曼彻斯特大学) ; The University of Greenwich(格林威治大学) ; Technology Innovation Institute(技术创新研究院)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。
Comments 28 pages
基于锚点的点式大语言模型重排序器何时有用?检索器质量、统计范围与锚点设计
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG
AI总结 该研究以GCCP/PAGC为对象,复现并分析锚点式点式LLM重排序器,发现其增益源于对比打分,适用条件较窄,锚点构建可简化,检索器强度影响其效果。
Comments To be published in the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)
BiAxisAudit:一种评估大语言模型偏见的新框架,跨提示敏感性和响应层分歧
机构 * Southeast University, China(东南大学) ; Nanyang Technological University, Singapore(南洋理工大学)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 本文提出BiAxisAudit框架,通过双轴评估方法揭示LLM偏见的跨提示敏感性和响应层分歧,解决单一指标无法捕捉的偏见问题。
Comments 19 pages, 6 figures. Preprint
当词汇变化产生误导时:结合传统指标与基于大语言模型的指标重新思考动态主题模型评估
机构 * RPTU University Kaiserslautern-Landau(莱茵兰-普法尔茨州立大学凯撒斯劳滕-兰道分校)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL
AI总结 该研究针对动态主题模型评估中词汇变化误导的问题,对比传统指标与基于LLM的语义相似性指标,发现后者在CoNTM上与人工判断一致性更高,提出应结合两类指标开展感知词汇变化的评估。
代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。
Comments 27 pages, 5 figures, 15 tables
角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。
Comments Accepted at CIKM 2026
HoosierHelp:面向社会服务导航的大语言模型智能体基准测试
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。