Tracing Mathematical Proficiency Through Problem-Solving Processes
通过问题解决过程追溯数学能力
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出StatusKT框架,通过教师-学生-教师三阶段LLM流水线,利用学生问题解决过程提取数学能力,提升知识追溯的预测性能和可解释性。
Comments 18 pages, 4 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过问题解决过程追溯数学能力
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出StatusKT框架,通过教师-学生-教师三阶段LLM流水线,利用学生问题解决过程提取数学能力,提升知识追溯的预测性能和可解释性。
Comments 18 pages, 4 figures
具有序列计划反思和候选交叉的深度研究员(深度研究员反思进化)
机构 * Saurav Prateek(独立研究者)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 深度研究员通过序列计划反思和候选交叉算法,实现对博士级别研究任务的高效处理,取得优于现有方法的性能。
Comments 11 pages, 6 figures, 2 tables, source code: https://github.com/SauravP97/deep-researcher-reflect-evolve/
重新思考创造力评估:对现有创造力评估方法的批判性分析
机构 * Graduate Institute of Communication Engineering, National Taiwan University(台湾大学通信工程研究院) ; Computer Science Department, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) ; Graduate Institute of Networking and Multimedia, National Taiwan University(台湾大学网络与多媒体研究院) ; Department of Electrical Engineering, National Taiwan University(台湾大学电子工程系)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 本文批判性分析现有创造力评估方法,发现其在不同领域和度量标准间存在局限性,需发展更稳健的评估框架。
Comments EACL 2026
帮助约翰尼理解隐私政策的LLMs
机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI) Dresden/Leipzig, Leipzig University(可扩展数据分析与人工智能中心(ScaDS.AI)德累斯顿/莱比锡,莱比锡大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 PRISMe通过结合LLM的政策评估与交互式界面,帮助用户更有效地理解和参与隐私政策,同时揭示了设计和技术上的挑战。
Comments 21 pages, 3 figures, 3 tables, ACM CHI 2026
2025年人重识别:监督、自监督和语言对齐。什么有效?
机构 * MoiiAi Inc.(摩艾AI公司)
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI
AI总结 本文探讨了2025年人重识别中监督、自监督和语言对齐模型的性能,分析了跨域应用中的鲁棒性和泛化能力。
在先进文本到语音模型时代的声音深度伪造检测
机构 * UncovAI
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 本文评估了三种先进TTS模型在声音深度伪造检测中的表现,发现单一范式检测器效果有限,多视角方法更具鲁棒性。
Comments This work was performed using HPC resources from GENCI-IDRIS (Grant 2025- AD011016076)
大规模分类器校准:对模型无关后验方法的实证研究
机构 * University of Oslo(奥斯陆大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 本研究评估了多种模型无关后验校准方法在二分类任务中的表现,发现文恩-阿伯斯预测器在降低对数损失方面表现最佳,而Platt缩放效果较弱,同时指出某些常用校准方法可能对现代模型产生负面影响。
Comments 61 pages, 23 figures
RubricHub: 通过自动化粗到细生成构建一个全面且高度判别性的评分标准数据集
机构 * Li Auto Inc. ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))
专题命中 评测与基准 :post-training(abstract);分类 cs.AI
AI总结 RubricHub通过自动化粗到细生成方法构建了一个大规模多领域评分标准数据集,通过后训练流程显著提升了模型在HealthBench上的表现。
基于随机森林的分布外检测用于鲁棒肺癌分割
机构 * MSKCC
专题命中 评测与基准 :pretraining(abstract);分类 cs.LG
AI总结 本文提出RF-Deep方法,利用预训练变换器编码器的深度特征,通过随机森林检测分布外数据,提升肺癌分割的鲁棒性。
Comments Accepted at SPIE Medical Imaging 2026
TREC 2025 词语遗忘追踪任务概述
专题命中 评测与基准 :LLM(abstract)
AI总结 TREC 2025通过扩展任务范围和引入多样化查询源,提升了词语遗忘检索任务的挑战性和实用性。
说再见吧!通过自然语言编辑生成细节保留的肖像收集
专题命中 评测与基准 :language model(abstract)
AI总结 本文提出了一种通过自然语言编辑生成细节保留肖像收集的新任务,并提出了首个大规模数据集和先进框架SCheese,实现了高保真细节和身份一致性。
量化大型语言模型中的非确定性漂移
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过实验量化大型语言模型在无操作员条件下的非确定性漂移,揭示了不同模型大小和部署类型下的输出变化模式,并探讨了语义方法在评估漂移缓解技术中的应用。
Comments 10 pages, 3 figures, 1 table. Empirical measurement study reporting new repeated-run experiments quantifying baseline nondeterministic drift in large language models. This manuscript presents original empirical results (not a review or position paper) and establishes a baseline reference for future drift-mitigation work
ProToken: 联邦大语言模型中的令牌级归因
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 ProToken通过令牌级归因方法,解决联邦大语言模型中客户端贡献识别问题,提升隐私保护下的模型调试与信任验证能力。
超越随机采样:通过课程学习实现高效的语言模型预训练
专题命中 效率与部署 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过课程学习优化语言模型预训练,发现压缩比、词汇多样性和可读性是关键难度指标,显著提升训练效率。
NoWag:一种用于大型语言模型形状保持压缩的统一框架
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Princeton University(普林斯顿大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 NoWag提出了一种统一的单次形状保持压缩框架,通过向量量化和剪枝技术有效压缩大型语言模型,展示了其在性能上的优势。
结构上的人类,语义上偏见:利用嵌入和图神经网络检测LLM生成的参考文献
机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) ; SEAS, Harvard University(哈佛大学工程学院)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文通过嵌入和图神经网络检测LLM生成的参考文献,发现其拓扑结构接近人类,但语义特征可被识别。
Comments 34 pages, 20 figures. Accepted at ICLR 2026
基于芯片组的异构近内存加速用于边缘多模态大语言模型推理
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 CHIME通过异构近内存加速方案,提升边缘多模态大语言模型推理的效率和能效。
超越以GEMM为中心的NPUs:使高效的扩散LLM采样成为可能
机构 * Imperial College London(伦敦帝国学院) ; University of Edinburgh(爱丁堡大学) ; University of Cambridge(剑桥大学)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种针对扩散LLM采样的NPU架构优化方案,通过轻量级向量原语、内存重用策略和混合精度内存层次结构,实现了2.53倍的加速性能。
NLPrompt: 噪声标签提示学习用于视觉-语言模型
机构 * ShanghaiTech University(上海科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) ; University of Technology Sydney(悉尼科技大学) ; University of Melbourne(墨尔本大学)
专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.LG
AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。
脉冲神经网络压缩:针对脉冲神经网络的后训练二次压缩
机构 * School of Engineering Mathematics and Technology, University of Bristol, England(工程数学与技术学院,布里斯托大学,英格兰)
专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG
AI总结 本文提出Spiking Brain Compression(SBC)框架,通过一次性后训练压缩提升脉冲神经网络的效率,实现比传统ANN基线更高的准确率。
Comments Preliminary work accepted at non-archival OPT-ML workshop at NeurIPS 2025. The workshop version is available in an earlier version of this arXiv paper
LogSieve: 任务感知的CI日志缩减以实现基于大语言模型的可持续分析
机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) ; Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) ; Faculty of Information University of Toronto Toronto Ontario Ontario(信息学院多伦多大学多伦多安大略安大略) ; University of Toronto(多伦多大学) ; Trent University(特伦特大学)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG
AI总结 LogSieve通过任务感知的日志缩减技术,有效减少CI日志体积并提升大语言模型推理的可持续性与可解释性。
Comments Preprint. Accepted for presentation at Mining Software Repositories (MSR'26), co-located ICSE 2026. The final version will appear in the ACM Digital Library as part of the MSR'26 conference proceedings
LAPS:一种长度感知的LLM服务系统
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI
AI总结 LAPS通过长度感知的调度策略优化LLM服务,降低预填充延迟并减少SLO违规,提升吞吐量。
Comments 12 pages
通过利用人类方法诊断视觉语言模型的感知能力:针对色觉缺陷的色觉研究
机构 * Nara Institute of Science and Technology(奈良科学技术研究所)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL
AI总结 本研究通过Ishihara测试评估视觉语言模型对色觉差异的感知能力,发现模型无法再现色觉缺陷个体的感知结果,揭示了多模态AI在包容性部署中的不足。
Comments Accepted to appear in the main conference of EACL 2026
DaMO:一种数据高效的多模态协调器,用于视频LLM的时序推理
机构 * College of Artificial Intelligence, National Yang Ming Chiao Tung University(人工智能学院,阳明交通大学) ; Institute of Population Health Sciences, National Health Research Institutes(人口健康科学研究所,国家健康研究院) ; Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 DaMO是一种专为视频LLM设计的数据高效多模态协调器,通过时序感知Fuseformer和四阶段训练范式提升时序推理能力,实现更精确的多模态理解。
无线JEPA:一种利用空间-时间无线潜在预测的多天线基础模型
专题命中 效率与部署 :foundation model(title,abstract)
AI总结 WirelessJEPA通过空间-时间无线潜在预测,实现多天线信号的通用表示学习,适用于多种下游任务。
理解高效服务大语言模型推理的瓶颈:KV卸载
专题命中 效率与部署 :LLM(title,abstract)
AI总结 本文通过分析KV缓存卸载的瓶颈,提出优化硬件互连、模型架构和调度算法以提升大语言模型推理效率的方法。
Comments Submitted to MLSys 2026
融合重要性与多样性:KV缓存压缩的联合优化
机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 效率与部署 :language model(title,abstract)
AI总结 MixKV通过融合重要性与多样性,优化KV缓存压缩,提升多模态模型的存储效率与推理性能。
Comments Accepted by ICLR 2026. Our code is available at https://github.com/xuyang-liu16/MixKV
最低跨度置信度:一种用于高效且黑盒幻觉检测的零样本度量
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出了一种名为最低跨度置信度(LSC)的零样本度量,用于高效且黑盒检测大型语言模型中的幻觉问题。
M2XFP:一种元数据增强的微缩放数据格式,用于高效低比特量化
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 M2XFP通过引入元数据增强的微缩放数据格式,实现高效低比特量化,显著降低精度损失并提升加速器性能
Comments 17 pages, 13 figures, ASPLOS 2026
快速失败,大获成功:通过扩散大语言模型重新思考推测解码的起草策略
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学) ; Google(谷歌) ; Rice University(里士满大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 FailFast通过动态调整推测长度,利用扩散大语言模型的并行解码优势,实现快速失败和大获成功,提升推测解码效率。