The Bitter Lesson of Tool Calling
工具调用的惨痛教训
专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL
AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
工具调用的惨痛教训
专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL
AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。
TRAJDEBUG:追踪错误生命周期以识别长视野智能体轨迹中的关键失败
机构 * Tsinghua University(清华大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Tencent Hunyuan(腾讯混元)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对长视野智能体轨迹调试的级联错误与关键错误定位难题,提出TrajDebug框架,构建含486条轨迹的TrajErrBench基准,实验显示其性能优于现有基线,可提供改进智能体的可操作反馈。
Tytan:从关系数据交互式神经符号构建分析语义模式
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 TYTAN是从关系数据自动构建分析语义模式的交互式神经符号系统,在多数据库评估中实现了100%覆盖率、检索正确性及高语义角色一致性,盲测表现优异。
Comments 20 pages, 4 figures, 6 tables
SkillTV-Bench:评估评判者在技能增强型智能体执行任务中的表现
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 SkillTV-Bench是含681个案例的智能体轨迹基准,用于评估技能感知轨迹验证;提出SkillTV-Evolve优化JudgeSkill,使智能体评判者准确率提升14.8个百分点,选定轨迹成功率大幅提高。
面向端到端多语言隐喻处理:整合检测、翻译与评估
机构 * Leiden University(莱顿大学) ; Leiden University Medical Centre(莱顿大学医学中心)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究拟开发端到端多语言隐喻处理框架,整合隐喻检测、面向隐喻的翻译评估及联合建模,结合语言学理论与大语言模型,以提升多语言NLP系统处理比喻语言的能力。
Comments Scientific report on PhD thesis plans and milestones achieved (current progress)
MatrAIx:用83亿个 persona 智能体模拟世界
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 MatrAIx是含83亿 persona 智能体的模拟用户评估基础设施,含Persona 8B、MatrAIx Playground及1010个多领域任务,经验证可高效评估AI系统与数字产品。
Comments Project website: https://matraix.ai
世界杯竞技场:前沿大语言模型在实时赛事上的前瞻性、无泄露评估
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究构建世界杯竞技场基准,在2026世界杯期间让6个前沿LLMs实时预测,发现其平均准确率63.9%,无明显差异,将相关数据和代码作为基准发布。
Comments Project page: https://co-minder.github.io/worldcup2026
通过对比激活加法实现Qwen3的跨期偏好调控
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究针对Qwen3-32B大模型,通过对比线性探针识别时间范围方向,利用对比激活加法调控实现跨期偏好的双向大幅改变,还提升了规划相关能力,为相关AI系统及安全问题提供支撑。
像素上的模式:测量多模态代码生成中的模式完成偏差
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。
Comments 41st IEEE/ACM International Conference on Automated Software Engineering
LiveEvalBench:面向网页生成的开放世界评估
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察
MMLongBench-Doc-V2:MMLongBench-Doc的修正标注、语义感知修订版
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 针对MMLongBench-Doc基准的标注错误等问题,推出MMLongBench-Doc-V2,修正106个标注、调整评估方式,移除错误文件名和重复问题,形成不可与V1分数对比的新基准。
VeriTrace:类人时间探索完成智能体动作空间
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 VeriTrace是一种多智能体系统,通过赋予Inspector智能体完整调试动作空间实现类人时间探索,在VerilogEval-V2基准测试上首次达到100% Pass@1,准确率较最强复现基线提升5.1%。
Comments ICLAD 2026, Long Oral
ISEE:数据库字段的交互式语义丰富
机构 * Purdue University(普渡大学) ; Adobe(奥多比公司)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出ISEE系统,通过评分、收集领域知识并与用户协作丰富数据库字段语义,可降低认知负荷、提升描述质量并增强下游任务性能。
AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。
PredAct-Bench:可控工具噪声下的工具增强对话基准
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究推出PredAct-Bench基准,以教育为测试平台评估带噪声工具的对话智能体,扩展信任校准指标并评估13种LLMs,发现当前模型无法在工具噪声下为教师提供足够可见性,助力构建更优AI决策支持系统。
编码智能体作为测试套件审计器:在接近官方测试套件检测能力的同时发现官方套件遗漏的问题
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出编码智能体作为测试套件审计器,结合认证链识别官方套件遗漏的缺陷提交,在接近官方套件覆盖度的同时,无官方套件时其构建的套件表现最优。
Comments 24 pages, 4 figures
ProtoAct:将湿实验室协议转化为具身机器人动作
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。
Comments 15 pages, 13 figures
CraftAlign:面向AI故事的基于特征的评估与修订指导
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 CraftAlign是对齐AI故事与人类叙事技巧的框架,含特征估计器与能量模型,可评估写作模式并生成修订指导,实验显示其区分能力及指导效果优于基线。
Comments 17 pages, 5 figures, includes appendix
PATH-Bench:面向终身智能体的路径依赖评估基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。
当协作成为触发因素:多智能体系统中的集体证据阈值后门
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 针对多智能体系统的新型集体证据阈值后门威胁,提出BCBI注入后门、LATTE防御方法,在基准测试中实现高效后门激活与低干扰防御效果。
Comments 26 pages,11 figures
GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法
机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。
AdvPlan-Bench:结构化计划生成智能体的对抗性评估基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出AdvPlan-Bench,这一结构化计划生成智能体的对抗性评估离线基准,通过多维度指标开展实验验证,为相关研究提供可复现的基准支持。
人工智能与建模及仿真:概述
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本报告概述人工智能与建模及仿真的交叉领域,阐述二者双向促进关系,沿建模及仿真各阶段展示大语言模型等技术的应用,提供概念路线图助力领域探索。
面向智能体工作流的组合式元路由学习:一个可执行基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出一个智能体工作流的可执行基准和感知预算的组合式元路由器,在保留测试集上实现100%成功率,成本比静态策略低43%,但在词汇偏移挑战任务上表现不佳,凸显词汇泛化是主要限制。
Comments 7 pages, 1 figure; AAAI 2027 anonymous submission
可化学回收聚合物的合成可及宇宙
专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 本研究结合VFS与polyBART、POLYT5模型生成100万个可合成的ROP聚合物结构数据集,经严格筛选后可作为下游可持续应用的宝贵资源。
面向异构文档知识图谱构建的本体引导、去重感知抽取层
机构 * Konectu(科内克图)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一套本体引导的去重感知抽取层,用Qwen3.5-9B模型从异构文档抽取实体与关系,经五阶段优化后,在情报语料上使搜索召回率从70%升至95%且修正多类质量缺陷。
用于污水管网管道严重程度预测的基于模糊规则的神经符号方法
机构 * Can Tho University(芹苴大学) ; Istituto di Scienza e Tecnologie dell’Informazione, CNR - ISTI(意大利国家研究委员会信息科学与技术研究所)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出一种基于模糊规则的神经符号框架,将神经感知与符号推理解耦,结合Swin Transformer、Weka J48算法和模糊逻辑,在污水管网管道严重程度预测任务中,较仅图像分类提升了多项关键指标。
元任务:将终端任务综合转化为可扩展智能体训练的终端任务
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 Meta-Task框架将终端任务综合转化为Terminal-Bench格式任务,通过多阶段机制等提升任务质量,生成3221条轨迹微调Qwen3系列模型,效果优于同期方法且训练数据更少。
Comments 17 pages, 5 figures
MMHBench:用于长视频心理健康理解的多视角基准测试集
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。
耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。
Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research