ReLog: Execution-Aware Logging with Runtime Feedback for LLM-Oriented Debugging
为LLMs实现人类级日志记录:通过执行和运行时反馈重新思考日志记录
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文提出ReLog框架,通过运行时反馈迭代生成日志,提升日志在下游任务中的实用性,实验表明其在缺陷定位和修复任务中优于现有方法。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
为LLMs实现人类级日志记录:通过执行和运行时反馈重新思考日志记录
专题命中 评测与基准 :LLM(title,abstract)
AI总结 本文提出ReLog框架,通过运行时反馈迭代生成日志,提升日志在下游任务中的实用性,实验表明其在缺陷定位和修复任务中优于现有方法。
正则化潜在动态预测是行为基础模型的强基线
机构 * Department of Computing Science, University of Alberta, Canada(阿尔伯塔大学计算机科学系) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨零样本强化学习中复杂表征学习目标的必要性,提出正则化潜在动态预测方法,通过正则化保持特征多样性,优于现有方法,并在低覆盖场景中表现优异。
Comments ICLR 2026 Update 08/25/2026: (i) Fixed a typo in eq. 7. (ii) Updated lemma 1 to a stronger bound for RLDP
AllMusicCaps:将专辑评论作为Music CLAP的补充监督
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 本研究提出AllMusicCaps,利用AllMusic专家专辑评论经LLM预处理构建标题语料库,结合SigReg正则化优化CLAP模型,提升了文本到音乐检索等任务性能并发布相关资源。
Comments Accepted at ISMIR 2026. Code, weights, and data available at https://github.com/MTG/allmusiccaps
OpenSanctions Pairs:基于大语言模型的大规模实体匹配
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 OpenSanctions Pairs通过对比LLM与规则基础匹配器,展示了LLM在实体匹配任务中的优越性能,并揭示了规则系统与LLM在失败模式上的互补性,推动了合规流程中更高效的管道组件开发。
Comments 14 pages, 3 figures
可跨多种嗅觉任务迁移的通用分子基础模型
机构 * University of Michigan(密歇根大学)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 本文研究在单一嗅觉任务上微调的Uni-Mol2能否跨多种机器嗅觉任务迁移,发现其性能与专用基线相当且可稳定迁移,三维表征能区分镜像分子,支持机器嗅觉的跨任务迁移范式。
Comments 18 pages, 6 figures. Supplementary information included
在采集分布偏移下你能信任冻结的血液学基础模型吗?
机构 * Virginia Tech(弗吉尼亚理工大学) ; Accenture(埃森哲)
专题命中 评测与基准 :foundation model(title);pretraining(abstract);分类 cs.AI
AI总结 该研究审计15种冻结编码器在采集分布偏移下的鲁棒性,发现跨域性能骤降,提出CBR方法改善部分场景,强调血液学FM基准需同时审计准确率、校准等多维度指标。
Comments Accepted at the HemaRAI 2026 workshop (MICCAI 2026 satellite event), oral presentation; to appear in MICCAI 2026 Satellite Events, LNCS, Springer. 25 pages (10 main incl. references + 15 supplementary), 4 figures. Project page: https://jaishrm07.github.io/hematology-fm-robustness/
基于基础模型条件扩散的降水降尺度方法
机构 * IBM Research(IBM研究院) ; Fathom ; STFC Hartree Centre(STFC哈特雷中心)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 该研究针对降水降尺度问题,探究三种扩散模型条件策略,发现交叉注意力条件优于通道拼接,且Prithvi WxC基础模型在数据有限场景下性能良好。
用于大语言模型代理中污点限制的代理权限策略代数
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。
Comments 21 pages, 3 figures. v2: Major revision with updated title, MCP protocol gateway architecture, 3-model empirical benchmark (6,600 episodes), recovery ablations, gradual security typing, and complete formal safety proofs
语言模型评估器在不同语言间存在偏差
机构 * University of Cambridge(剑桥大学) ; Language Technology Lab(语言技术实验室)
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL
AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。
GlucoFM: 一种用于连续血糖监测的双流基础模型
机构 * Google Research(谷歌研究) ; University of New South Wales(新南威尔士大学)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 提出GlucoFM,一种轻量级CGM基础模型,通过将血糖动态分解为慢生理状态和瞬态事件流,在7个临床预测任务上平均PR-AUC比最佳CGM专用模型提高4.1点。
SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)
专题命中 评测与基准 :language model(title,abstract)
AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。
Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture
迷失在振动中:视觉语言模型在动态刻度测试中失败
专题命中 评测与基准 :language model(title,abstract)
AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。
漏洞评估中的AI垃圾内容与幻觉:关于推理失败及可信缓解措施的综述
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI
AI总结 本综述针对LLMs用于漏洞评估时产生的AI垃圾内容与幻觉问题,分析其源于专家演绎推理与LLMs自回归生成的差距,提出神经符号验证等缓解方案及CVE-Bench等评估工具,为AI驱动的安全分诊系统提供路线图。
Comments Accepted to SiMLA 2026
从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。
自动事实核查系统的鲁棒性如何?跨基准评估
机构 * Leuphana University of Lüneburg(吕讷堡勒芬纳大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of Zurich(苏黎世大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究对九种模型在四个跨领域数据集上开展自动事实核查系统的跨基准评估,发现系统性能依赖领域与指标,检索是主要瓶颈,并发布资源支持可复现研究。
关键点分析需要结构恢复:任务定义、数据集诊断及结构感知基准
机构 * King’s College London(伦敦国王学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 该研究定义关键点分析(KPA)为结构化预测问题,诊断现有KPA基准缺陷,构建人机协同标注的结构感知基准并发布相关资源,为KPA研究提供支持
为何图学习无法充分受益于文本教师?
机构 * SOKENDAI(总研究大学院大学) ; National Institute of Informatics(情报学研究所)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对结合自监督GNN与交替优化语言模型的多模态图学习模型未充分提升性能的问题,分析了六个关键影响因素并通过分阶段实验验证。
Comments 21 pages, 1 figure, 7 tables
基于潜在向量调控的可控情感生成
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Tencent Jarvis Lab(腾讯Jarvis实验室)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型对齐后情感响应平淡的问题,提出轻量框架EmoVec,通过调控潜在向量实现可控情感生成,实验验证其能提升情感显著性且保留语义等特性。
FuzzingBrain-Bench V1:评估大语言模型的开放式漏洞发现能力
机构 * Texas A&M University(得克萨斯农工大学) ; University of Novi Sad(诺威萨大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出FuzzingBrain-Bench V1基准,评估Claude系列大模型的开源软件漏洞发现能力,其中Claude Opus 4.8表现最佳,在77项挑战中60项触发崩溃,得196分。
Comments 21 pages, 12 figures, 7 tables. Ze Sheng and Aleksandar Kezic contributed equally. Benchmark corpus and harnesses: https://github.com/fuzzingbrain/FuzzingBrain-Bench Counts verified against the built PDF and sources: 21 pages, 12 figure environments, 7 tables
可检索但不可靠:检索增强生成中的攻击与防御研究综述
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本综述针对检索增强生成(RAG)的安全与鲁棒性问题,形式化其各阶段威胁模型,分类攻击目标并梳理各阶段防御及评估方法,为该领域提供统一研究框架。
Comments 24 pages, 6 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Peer-reviewed through ACL Rolling Review (ARR)
多模态异常检测:一项综述
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Software, Beihang University(北京航空航天大学软件学院) ; Shandong Inspur Intelligent Production Technology Co., Ltd(山东浪潮智能生产技术有限公司)
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 该综述从假设驱动视角梳理多模态异常检测(MMAD),划分两种互补方法范式,探讨基础模型对MMAD的重塑,汇总基准与评估协议并指出未来方向。
Comments Accepted for publication in IEEE Transactions on Big Data
EduAgentQG:具有显式多样性和目标感知评估的多智能体个性化数学问题生成
机构 * East China Normal University(东华大学) ; Shanghai Institute of Al for Education(上海人工智能教育研究院) ; The Chinese University of Hong Kong, Shenzhen School of Data Science(香港中文大学(深圳)数据科学学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文针对现有数学问题生成方法难以兼顾目标对齐与可控多样性的问题,提出多智能体框架EduAgentQG,构建专属基准并验证其在多项指标上优于COT等基线方法。
Comments Accepted to IPM 2026
耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败
专题命中 评测与基准 :LLM(title)
AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。
面向多模态知识图谱的多粒度上下文增强检索增强生成
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Utah(犹他大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有多模态知识图谱RAG方法的语义鸿沟问题,本文提出CEMMKG框架,通过多粒度局部与全局上下文增强,有效提升了多模态GraphRAG的性能与适用性。
Comments Preprint
ToST:用于多路径引导与并行思考的思维树式苏格拉底教学框架
机构 * Beijing Normal University(北京师范大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出ToST框架,采用多路径范式与并行策略,建立MPSG-Bench基准,可提升LLMs苏格拉底教学的引导成功率,助力学生探索多解决方案路径。
MMJailBench:用于解耦多模态越狱漏洞的因子化基准
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。
Homo-RAG:基于同源性引导检索增强生成的跨物种基因功能预测
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出Homo-RAG框架,整合同源性引导多跳检索与证据感知排序,实现跨物种基因功能预测,在150个查询及7200份文档的评估中表现优异,为未充分研究生物的基因功能注释提供了实用方案。
Comments 29 pages, 9 figures
OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准
机构 * East China Normal University(华东师范大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。
Comments Accepted to Findings of EMNLP 2026
基于证据的多模态人体感知心理跨诊断维度映射
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究提出临床医生参与的基准,评估LLMs能否从多模态证据生成B-HiTOP条目画像,发现两阶段预测可提升部分证据的兼容性,但语义抽象会成为间接行为传感的信息瓶颈。
PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?
机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。