ArtiMo: Agent-Driven Articulated Mesh Animation
ArtiMo:智能体驱动的关节网格动画
专题命中 推理与问题求解 :language model(abstract)
AI总结 ArtiMo是一种智能体驱动的零样本框架,结合URDF运动学约束与LLMs/VLMs,生成文本引导的关节网格动画,通过视觉自改进机制修正错误,在新基准数据集上优于基线。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ArtiMo:智能体驱动的关节网格动画
专题命中 推理与问题求解 :language model(abstract)
AI总结 ArtiMo是一种智能体驱动的零样本框架,结合URDF运动学约束与LLMs/VLMs,生成文本引导的关节网格动画,通过视觉自改进机制修正错误,在新基准数据集上优于基线。
大型语言模型的六大误解:一个极简模型与诊断分类法
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)
AI总结 该研究提出以四组区分为核心的LLM极简模型,诊断六大误解,应用于出版商AI政策案例,为纠正民间理论错误提供诊断工具。
Comments 20 pages, 1 figure, 2 tables, and 2 boxes. Published in PNAS Nexus
情感语境会放大大型语言模型(LLM)回复中的奉承行为
机构 * Penn State University(宾夕法尼亚州立大学) ; Villanova University(维拉诺瓦大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究发现,在主观评价互动中,7个LLM在两个Reddit数据集上的奉承偏差会被用户的负面情绪(尤其是孤独、痛苦)放大,模型会通过回避型奉承抑制关键反馈。
FL-MAESTRO:面向资源受限联邦学习的多智能体大语言模型编排框架
机构 * University of Calgary(卡尔加里大学) ; University of Michigan(密歇根大学)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI
AI总结 FL-MAESTRO是面向资源受限联邦学习的多智能体LLM编排框架,通过三个专业LLM智能体联合决策,在非IID CIFAR-10基准上,准确率与最强能量感知基线相当,浪费轮次能量从超三分之一降至近零。
Comments Accepted at IEEE GLOBECOM 2026
用于大规模推荐解释的LLM评判模型的生命周期
机构 * Netflix(网飞公司)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。
LLM生成代码中的库幻觉:基于开发者查询的风险分析
机构 * King’s College London(伦敦国王学院) ; University College London(伦敦大学学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。
Comments 28 pages, 1 figure, 13 tables. Accepted to Proceedings of EMNLP 2026
不要以封面判断代码:探索LLM评委在代码评估中的偏见
机构 * IPAI, Seoul National University(IPAI,首尔国立大学) ; Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) ; LG AI Research(LG人工智能研究)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文研究了LLM评委在评估代码时存在的偏见问题,揭示了其在处理语义等价但表面不同的代码时的不稳定性,并指出需要更稳健的评估方法。
Comments Accepted to EACL 2026 (Findings)
超越黄金标准:用于形式化数学推理的LLM评判者的认知集成
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究提出基于LLM评判者的认知与形式化基础集成(EFG),用于系统自动评估形式化数学推理中的语句自动形式化任务,实验证实其比粗粒度模型更具适用性。
TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。
评估大型语言模型在国际海运危险货物规则合规性上的性能
机构 * NCB Hazcheck Limited(NCB Hazcheck有限公司) ; Durham University(杜伦大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究构建首个IMDG规则合规性基准DGEval,评估13个LLM的性能,发现其在积载等安全关键领域表现弱,仅可辅助结构化查询,需人工监督。
Comments 28 pages, 2 figures
ExpertIVS:大型语言模型中由社会学专家驱动的个体价值观模拟
机构 * The International Joint Institute of Tianjin University(天津大学国际联合研究院) ; Tianjin University(天津大学) ; TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) ; National Governance Institute, Tianjin Normal University(天津师范大学国家治理研究院) ; College of Computer and Information Engineering, Tianjin Normal University(天津师范大学计算机与信息工程学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究针对大型语言模型社会模拟中个体价值观建模的不足,提出ExpertIVS框架,通过14个社会学专家智能体重构个体画像,经多国家多人群实验验证其在价值观还原、泛化等方面性能优于基线。
Know2Guess: 一种面向大型语言模型知识边界评估的污染感知多区域基准
机构 * Anhui University(安徽大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出一种污染感知多区域基准,通过冻结构建时标签测量从可回答知识到应弃权未知的转变,评估模型在回答与弃权间的可靠性。
Comments 28 pages, 11 figures, Accepted as a regular paper at the International Conference on Neural Information Processing (ICONIP 2026)
Metanym游戏:一种自包含、自洽的LLM同行社区结构智能基准
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Metanym游戏作为LLM结构智能基准,通过同行互评和奇异值分解实现无黄金标准的客观评估,事实评分与GPQA Diamond相关性达0.92,发现评判能力比生成能力更稀缺。
Comments 69 pages (main text + four appendices: A. Mathematical Theory and Derivations B. generation/evaluation prompts, C. council-evaluation excerpt D. Auditing the Metanym Game-GPQA correlation: No Leaks Found), 3 figures, 19 tables. Github repo with pages/figures/tables/code and data for reproducing results: this https URL (https://github.com/dnordfors/metanym-game-paper)
PromptResponse:优化大语言模型编码任务的提示词
机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) ; HU Berlin(柏林洪堡大学)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出PromptResponse,通过对HumanEval数据集的5种变体让GPT-4o执行8200次编码任务,发现统一格式(尤其JSON)可提升代码效率与稳定性,LLM调优提示词会降低性能,还发布了相关数据集与评估流程。
Comments 22 pages, 7 figures, 10 listings
基于LLM作为评判者的5G领域知识与故障分析大模型自由文本评估
机构 * Surrey Institute for People-Centered Artificial Intelligence(萨里以人为本人工智能研究院) ; Google(谷歌)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 本文以自由文本格式评估Claude-Haiku-4.5等三个轻量型LLM的5G领域知识与故障分析能力,发现其故障诊断准确率超90%但规范召回不足,Gemini-3.1-Flash-Lite效率最优适合生产部署。
Comments 6pages, 4figures. Accepted for presentation in IEEE CSCN conference
ProofJudge:基于工具的大语言模型(LLM)对Mathlib中形式化证明质量的评估工具
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 本研究提出ProofJudge系统,通过智能体式LLM从五个维度评估Mathlib形式化证明质量,在218个声明数据集上验证其与人类偏好对齐度,发布开源制品支持相关研究。
Comments 4 pages, 1 figure, 1 table
LLM人格的双重性质:聚合倾向与框架依赖的几何结构
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。
大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)
AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。
从法规到实施:对工业中大型语言模型(LLM)辅助法规合规性的批判性评估
机构 * School of Engineering Technology, Purdue University(普渡大学工程技术学院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 该研究针对工业中LLM辅助法规合规性的研究缺口,探索数据提取指令和法规模糊性对LLM生成合规文档质量与一致性的影响,发现不同严格程度的法规指南对LLM输出的一致性和幻觉情况有不同影响。
Comments 10 pages, 4 figures
ClawSentry:一种用于保护自主大语言模型智能体的渐进式多层安全监控器
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ClawSentry是一种开源、与框架无关的智能体运行时安全监控网关,通过渐进式多层机制防护自主LLM智能体,可大幅降低攻击成功率,同时保持较高的任务安全率。
Comments 35 pages, 14 figures. Code: this https URL (https://github.com/Elroyper/ClawSentry)
通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统
机构 * AstraZeneca(阿斯利康) ; Chalmers University of Technology(查尔姆斯理工大学) ; University of Gothenburg(哥德堡大学) ; Science for Life Laboratory (SciLifeLab)(生命科学实验室)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。
UpgradeBench:面向微调LLM专用模型升级的决策导向基准
机构 * Alibaba Group(阿里巴巴集团) ; Cheung Kong Graduate School of Business(长江商学院)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.AI
AI总结 该研究提出UpgradeBench基准,针对LLM专用模型升级的决策问题,在多模型序列与任务上验证了适配器迁移等策略的效果,实现低成本高效升级。
Comments 23 pages, 12 tables, 3 figures
aiXamine:针对大语言模型安全、安全与隐私的跨维度权衡的统一黑盒评估
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究推出aiXamine统一黑盒平台,对超120个LLM开展大规模联合评估,发现安全、隐私等跨维度权衡现象,揭示当前对齐方法将多维度可信性视为单一目标的缺陷。
我们能信任智能体吗?基于大语言模型的多智能体系统用于伦理AI的案例研究
机构 * Tampere University(塔尔皮奥大学) ; University of Jyväskylä(耶夫斯克耶拉大学) ; University of Vaasa(瓦萨大学)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究通过设计LLM-MAS多智能体原型,评估其在处理AI伦理问题时的代码生成能力,发现其能生成大量相关代码,但存在源代码集成等实际挑战。
将黑盒机器学习模型蒸馏为用于学习分析的小型自解释语言模型
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)
AI总结 本研究提出两阶段微调流水线,将黑盒ML模型蒸馏为小型自解释LLM,可在普通设备上离线预测解释,在教育数据集上表现良好且数据不外泄。
完全循环子任务图用于工具使用LLM代理:多代理工作流程中的灵活性、成本和瓶颈
机构 * Lebanese American University(黎巴嫩美国大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文研究了完全循环子任务图,通过分析不同基准测试发现,多代理工作流程中灵活性可能带来协调成本和推理成本,而外部任务瓶颈可能主导性能。
Comments 37 pages, 8 figures. Published in Transactions on Machine Learning Research (TMLR), 2026. Supplementary material included as ancillary material
并非双关:面向以人为中心的大语言模型评估的合理未知姓名(PUN)
机构 * Technische Universität Berlin(柏林工业大学) ; Weizenbaum Institute for the Networked Society(魏茨曼网络社会研究所) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM评估中人名使用导致的测量混淆问题,提出PUN协议构建合理未知姓名,经204人研究验证其有效性并发布300个对照姓名。
Comments Under review
大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化调查与研究议程
机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究调查了LLMs在软件工程与软件安全交叉领域的进展,提出保证框架,识别有效性威胁与最低报告协议,制定研究议程,主张以任务适配证据而非单一基准评判模型能力。
TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络
机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) ; Zayed University(扎耶德大学)
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG
AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。
超越端到端成功:诊断长视野安全大语言模型智能体的失败
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对长视野安全LLM智能体,提出带检查点的诊断方法,发现Gemini 2.5 Flash失败多因未观测到需复用状态,92种子研究显示针对性指导可提升其状态观测率至95.4%,且失败主因随模型代际变化,需诊断失败根源而非仅看总体成功。