A Survey on the Honesty of Large Language Models
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Project Page: https://github.com/SihengLi99/LLM-Honesty-Survey
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Project Page: https://github.com/SihengLi99/LLM-Honesty-Survey
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Technical report; updated the std error for human study; short version (v1) was accepted by LLM@IJCAI'23; 32 pages; more work: https://llm-enhance.github.io/
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI;LLM(comments)
Comments Work in progress; 7 pages; more work at: https://llm-eval.github.io/
完全循环子任务图用于工具使用LLM代理:多代理工作流程中的灵活性、成本和瓶颈
机构 * Lebanese American University(黎巴嫩美国大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文研究了完全循环子任务图,通过分析不同基准测试发现,多代理工作流程中灵活性可能带来协调成本和推理成本,而外部任务瓶颈可能主导性能。
Comments 37 pages, 8 figures. Published in Transactions on Machine Learning Research (TMLR), 2026. Supplementary material included as ancillary material
面向研究的基础模型以人为中心的评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.CL
AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。
EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试
机构 * Jiutian Research, China Mobile(中国移动九天研究院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 研究针对企业RAG部署的可靠性问题,推出含983个样本的EnterpriseRAG基准,评估13个LLM发现其指令遵循崩溃,为生产级RAG提供可复现的评估基础
IDRAAK:从多智能体自然语言处理到用于技术需求语义漂移检测的少样本提示
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.CL
AI总结 IDRAAK是基于语义需求表示的可解释框架,通过含6个少样本示例的LLM单次调用检测技术需求语义漂移,性能优于多种替代方案,证明少样本提示是高效替代方法。
基于模块化大语言模型(LLM)的安全智能体的事后轨迹风险验证
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文针对模块化LLM安全智能体的轨迹风险验证问题,提出生成树替代方案,在两阶段入侵检测实验中实现92.7%±2.4%的平均轨迹覆盖率,量化了联合访问缺失的成本。
Comments 18 pages, 11 tables; preprint
多智能体大语言模型流水线中的对抗攻击:揭示智能体AI架构的结构性漏洞
专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);分类 cs.AI
AI总结 该研究针对多智能体LLM流水线的结构性漏洞,通过在GPT-5-mini等模型上的实验,发现对抗性漏洞源于架构而非模型能力,推动流水线级防御的发展。
Comments This paper has been accepted at the 2026 IEEE Global Communications Conference (GLOBECOM)
当LLM停止遵循步骤:语言模型中程序执行的诊断研究
机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈丁加尔)
专题命中 评测与基准 :language model(title,abstract);LLM(title_cn,abstract_cn);large language model(abstract);分类 cs.CL
AI总结 本研究通过构建受控诊断基准,评估大型语言模型在程序执行任务中的忠实性,发现随着步骤增加准确率从63%降至20%,并揭示了缺失答案、过早答案、自我修正和执行不完整等失败模式。
Comments 24 pages, 19 figures, 4 Tables
从文本需求到微服务架构 —— 基于大语言模型的设计合成综合评估
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究探讨OpenAI o3能否仅从文本需求生成微服务架构,经实验发现少样本提示下其服务识别与通信恢复的一致性优于零样本,为需求驱动的架构合成提供了潜力。
守护者与违规者:大语言模型有害内容生成与安全缓解研究综述
机构 * University of South Florida(佛罗里达州立大学) ; Missouri University of Science and Technology(密苏里科技大学)
专题命中 评测与基准 :LLM(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。
评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Independent Researcher, China(独立研究者,中国) ; Singapore Management University, Singapore(新加坡管理大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。
Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench
量化预算约束下代理LLM搜索中的准确性与成本影响
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。
Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)
PerspectiveGap: 多智能体编排提示的基准测试
机构 * University of Maryland(马里兰大学) ; The Chinese University of Hong Kong(香港中文大学) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,abstract);分类 cs.CL
AI总结 提出PerspectiveGap基准,评估LLM为多智能体系统编写编排提示的能力,实验显示模型平均通过率仅14.9%,表明该能力独特且未被充分评估。
在大语言模型生成中解耦任务解决与输出格式
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。
Comments Update to the latest ACL published version and add a link to the released code
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781
COALA:通过对比正则化器和偏差分数估计实现用于ASR的鲁棒上下文语音增强语言建模
机构 * National Taiwan Normal University(国立台湾师范大学)
专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究旨在增强复杂多实体场景中的语音增强语言模型,提出COALA框架,通过将SLM潜在表示映射到判别空间量化匹配强度,并解决训练崩溃问题,在LibriSpeech基准上实现了卓越的上下文偏差性能。
Comments Accepted at INTERSPEECH 2026
RuleChef:将LLM任务知识扎根于可人工编辑的规则
机构 * KR Labs(KR实验室) ; TU Wien(维也纳工业大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。
Comments 8 pages
校准,而非编译:检测和修复语言模型编写的错误指定概率程序
机构 * RIKEN iTHEMS ; RIKEN AIP ; South China University of Technology(南方科技大学) ; Columbia University(哥伦比亚大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出用贝叶斯工作流(后验预测检查、模拟校准等)作为验证器,检测和修复LLM编写的概率程序中的统计错误,在检测(AUC 0.97)和修复(显著优于单元测试反馈)上表现优异。
提问的语言:语言条件对LLM分析争议性政治文件时的意识形态分歧的影响
机构 * Microsoft(微软)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究通过俄语和乌克兰语语义等价提示,发现ChatGPT和Claude Opus在分析同一乌克兰公民社会文件时,输出出现系统性意识形态分歧,且分歧程度因模型而异。
非完全人类品味:LLM调查替代者的程式化杂食性
机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL
AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。
ToolPrivacyBench: 对使用工具的LLM代理进行目的绑定隐私基准测试
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算先进创新中心)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有评估忽略多工具轨迹中目的绑定信息流的问题,提出ToolPrivacyBench基准,通过策略知识库审计工具参数和后端日志,评估任务完成与隐私过度披露,发现成功执行任务可能伴随不必要的隐私泄露。
Comments 24 pages, 7 figures, 15 tables
逆图灵基准:评估语言模型作为人类与AI对话的裁判
机构 * University of Rochester(罗切斯特大学) ; Stony Brook University(石溪大学) ; Independent Researcher(独立研究者)
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);prompting(abstract);分类 cs.CL
AI总结 提出逆图灵基准,评估LLM区分人类与AI多轮对话的能力,发现GPTZero、Claude Opus-4.6和GPT-5.5准确率最高,统计方法有语义盲点而语义方法易受角色提示影响。
ShoppingBench:面向LLM智能体的真实世界意图导向购物基准
机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)
专题命中 评测与基准 :LLM(title,title_cn);language agent(abstract);分类 cs.CL
AI总结 提出ShoppingBench基准,包含多层级真实购物意图任务,通过模拟环境和250万商品评估LLM智能体,发现GPT-4.1成功率低于50%,并提出轨迹蒸馏策略提升小模型性能。
Comments Accepted for oral presentation at AAAI 2026
LLM代理中的探索结构用于多文件变更定位
机构 * School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡国立管理学院)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 针对多子系统变更场景,提出非线性、领域范围的并行代理探索结构,在SWE Bench Pro基准上,小规模Haiku类模型通过领域代理并行生成实现高微F1分数,优于线性顺序探索。
TimeRouter: 时间序列基础模型的高效自适应路由
机构 * University of Connecticut(康涅狄格大学) ; Salesforce AI Research ; JP Morgan AI Research(摩根大通人工智能研究院)
专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.LG
AI总结 提出TimeRouter框架,通过轻量判别路由、选择性门控和集成回退实现时间序列基础模型的自适应选择,无需LLM推理,在GIFT-EVAL榜单取得最优性能。
GhazalBench: 评估大语言模型对波斯抒情诗的理解与规范表层形式访问
机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰理工大学电气与计算机工程学院) ; Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出GhazalBench基准,评估LLM在波斯抒情诗中的诗意理解与规范表层形式访问能力,发现模型普遍能理解诗意但难以生成精确诗句,而识别任务缩小差距,英语表现更好,表明训练数据差异是关键。
LLM医疗分诊中的性别依赖性诊断替代:相同症状,不同紧急程度
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大型语言模型在相同神经症状下,仅因患者性别和年龄不同而产生不同的分诊建议,发现年轻女性被系统性低估紧急程度,机制为诊断替代。
Comments 7 pages, 3 tables. Multi-model replication across Gemini, Claude, and GPT. Code and data: https://github.com/wongqihan/ai-behavioral-experiments
LLM 法官在安全标准和危害类别上不一致地存在分歧
机构 * National Research Council, Canada(加拿大国家研究理事会) ; IMDA, Singapore(新加坡信息通信技术发展局)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究评估了自动法官在无参考设置下进行多维安全评估的一致性,发现大型语言模型在识别金融等受监管领域中机器生成建议的安全问题时不可靠,且不一致程度因安全标准、内容语言和风格而异,不同法官之间也存在高度分歧。
Comments 8 pages plus appendices, under review
经验更优:用于证据基础健康社区笔记的自进化LLM智能体
机构 * National University of Singapore(国立新加坡大学) ; Yunnan University(云南大学) ; The Ohio State University(俄亥俄州立大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出EvoNote框架,通过自进化经验记忆和细粒度信用分配,在健康社区笔记生成中实现证据获取、分析与撰写,显著提升笔记质量并缩短生成时间。