BABE: Biology Arena BEnchmark
BABE:生物学竞技场基准
机构 * Peking University(北京大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 BABE基准通过评估生物AI系统的实验推理能力,解决现有生物学基准未能评估实验结果与上下文知识整合能力的问题。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
BABE:生物学竞技场基准
机构 * Peking University(北京大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 BABE基准通过评估生物AI系统的实验推理能力,解决现有生物学基准未能评估实验结果与上下文知识整合能力的问题。
扩散模型对齐:基础、挑战与未来
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Baidu Inc.(百度公司) ; The University of Bologna(博洛尼亚大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文综述了扩散模型对齐的基础、挑战及未来方向,探讨了对齐技术、评估方法及当前挑战的解决方案。
Comments Accepted at ACM Computing Surveys. 35 pages, 5 figures, 4 tables. Paper List: github.com/xie-lab-ml/awesome-alignment-of-diffusion-models
验证验证者:揭示事实验证器中的陷阱与潜力
机构 * Yonsei University(延世大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Seoul National University(首尔国立大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究评估了多种大语言模型和事实验证器,揭示了数据标注问题、前沿模型性能及小型验证器的改进潜力。
Comments Accepted to COLM 2025
超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。
来自NAMSS的通用多样化2D地震图像数据集
机构 * Instituto de Computação Universidade Estadual de Campinas (Unicamp)(计算研究所 Campinas 州立大学)
专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 Unicamp-NAMSS数据集通过多样化和广泛分布的2D地震剖面,为地球物理学中的机器学习研究提供支持,适用于预训练、自监督学习和领域适应等任务。
GenArena: 如何在视觉生成任务中实现人对齐的评估?
机构 * University of Science(科学大学) ; Shanghai Innovation Institute(上海创新研究所) ; Tencent(腾讯) ; National University of Singapore(新加坡国立大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 GenArena通过成对比较范式实现视觉生成任务的人对齐评估,使开源模型超越专有模型,提升评估准确性达20%以上。
Comments Project Page: https://genarena.github.io/, Code: https://github.com/ruihanglix/genarena
SOMA-1M: 一种大规模SAR-光学多分辨率对齐数据集用于多任务遥感
机构 * School of Remote Sensing Information Engineering, Wuhan University(遥感信息工程学院,武汉大学) ; Hubei LuoJia Laboratory(湖北珞珈实验室) ; Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, Ministry of Natural Resources(粤港澳大湾区自然资源数据协同应用技术创新中心,自然资源部)
专题命中 评测与基准 :foundation model(abstract)
AI总结 SOMA-1M是首个大规模SAR-光学多分辨率对齐数据集,用于提升多任务遥感图像处理的性能和准确性。
SurgLaVi:大规模分层数据集用于外科视觉-语言表示学习
机构 * Intuitive Surgical, Inc.(Intuitive Surgical公司) ; Center for Research and Formation in Artificial Intelligence (CinfonIA), Universidad de los Andes(人工智能研究中心(CinfonIA))
专题命中 评测与基准 :foundation model(abstract)
AI总结 SurgLaVi是一个大规模分层外科视觉-语言数据集,通过自动化流程生成高质量标注,用于提升手术视频的表示学习和多任务迁移能力。
A$^2$-LLM:一种端到端的对话音频虚拟形象大语言模型
机构 * State Key Laboratory of Information Photonics(信息光子学国家重点实验室) ; Optical Communications, Beijing University of Posts(邮电大学光学通信学院) ; Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村人工智能研究院) ; School of Finance and Statistics, East China Normal University, Shanghai, China(东华大学金融与统计学院)
专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 A$^2$-LLM通过统一框架联合推理语言、音频语调和3D面部运动,实现端到端的情感表达对话虚拟形象,提升实时效率与情感表现力。
Comments 13 pages, 3 figures
转向外部性:良性激活转向无意中增加大语言模型的劫持风险
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI
AI总结 本文研究了大语言模型中良性激活转向对安全性的负面影响,发现其无意中增加劫持风险,并通过实验验证了这一现象。
DistillER: 基于大语言模型的实体解析中的知识蒸馏
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 DistillER通过知识蒸馏方法,利用大语言模型和小型语言模型,提升实体解析的效率和效果。
PPE:用于多模态大语言模型中token压缩的位置保持嵌入
机构 * Huawei Technologies(华为技术有限公司)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)
AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能
Comments ICLR 2026
超越提示:通过logit空间整合实现语音大语言模型的高效且鲁棒的上下文偏差(LOGIC)
专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 LOGIC通过logit空间整合实现语音大语言模型的高效且鲁棒的上下文偏差,有效降低实体识别错误率。
Comments This paper is withdrawn temporarily to ensure full compliance with internal institutional publication approval processes
迈向绿色AI:解码LLM推理中的能耗在软件开发中
机构 * University of Twente(特文特大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究分析了LLM推理能耗,发现prefill阶段影响解码能耗,通过抑制babbling行为可实现高达89%的能耗节省。
SDFP:基于FIT剪枝模型的投机解码用于无训练和即插即用的大语言模型加速
机构 * Tsinghua University(清华大学) ; Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SDFP通过FIT剪枝技术实现无训练、即插即用的大语言模型加速,提升解码速度而不影响输出分布。
Opt4GPTQ: 为异构平台上的4位GPTQ量化LLM推理共同优化内存与计算
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)
AI总结 Opt4GPTQ通过整合三种平台优化策略,提升异构平台上4位GPTQ量化LLM推理的性能和吞吐量。
CommCP:通过基于大语言模型的通信实现高效的多智能体协调
机构 * Trustworthy Autonomous Systems Laboratory at the University of California, Riverside, CA, USA(加州大学河滨分校可信自主系统实验室)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 CommCP通过基于大语言模型的通信框架,提升多智能体协作任务的成功率和探索效率。
Comments IEEE International Conference on Robotics and Automation (ICRA 2026); Project Website: https://comm-cp.github.io/
CompactRAG: 减少多跳问答中的LLM调用和令牌开销
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) ; Isoftstone Information Technology (Group) Co.,Ltd.(伊软石信息技术(集团)有限公司) ; College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) ; School of Electronic Information, Central South University(电子信息学院,中南大学)
专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 CompactRAG通过解耦离线语料重组与在线推理,减少多跳问答中的LLM调用和令牌消耗,提升效率。
TIDE:面向自我改进LLM推理的时序增量草稿引擎
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 TIDE通过整合在线草稿适应和自适应运行时控制,提升LLM推理效率并减少训练时间。
通过生成顺序和令牌空间的联合搜索改进扩散语言模型解码
机构 * stanford(斯坦福大学) ; zju(浙江大学)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究通过联合搜索生成顺序和令牌空间,改进扩散语言模型的解码性能,在多个基准测试中取得显著优势。
上下文时间序列预测器
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种基于上下文的时间序列预测方法,通过将时间序列预测任务转化为输入标记,提高了参数效率并减少了过拟合问题。
Comments Camera-ready version. Accepted at ICLR 2025
Journal ref Proceedings of the Thirteenth International Conference on Learning Representations (ICLR 2025)
LittleBit:通过潜在因子分解实现超低比特量化
机构 * Samsung Research(三星研究院)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LittleBit通过潜在因子分解实现超低比特量化,实现高达31倍的内存压缩,同时在亚1比特域内提升模型性能,达到FP16的11.6倍推理加速。
Comments Accepted to NeurIPS 2025. Banseok Lee and Dongkyu Kim contributed equally
Stream-Voice-Anon: 通过神经音频编解码器和语言模型提升实时语音匿名化的效用
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Institute for Infocomm Research, A STAR, Singapore(信息通信研究所,新加坡) ; The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港)
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI
AI总结 Stream-Voice-Anon通过神经音频编解码器和语言模型提升实时语音匿名化效果,实现更高的可懂度和情绪保留,同时保持低延迟和隐私保护。
Comments Accepted by ICASSP2026. Demo/code: https://paniquex.github.io/Stream-Voice-Anon/
TabPFN-2.5:推动表格基础模型的最新进展
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG
AI总结 TabPFN-2.5通过提升表格基础模型的性能,在多个基准测试中超越传统树模型,并提供更高效的部署方案。
正确性优化残差激活透镜(CORAL):可转移且校准感知的推理时间引导
机构 * Department of Computer and Information Science, University of Pennsylvania, Philadelphia, USA(计算机与信息科学系,宾夕法尼亚大学,费城,美国)
专题命中 效率与部署 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI、cs.LG
AI总结 CORAL通过正则化探针提取模型内部分布式信息,提升推理时多项选择问答的准确性与校准性能。
SWE-Replay:面向软件工程代理的高效测试时间扩展
机构 * Siebel School of Computing(计算科学系) ; Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 SWE-Replay通过重用历史轨迹和动态选择探索或利用策略,实现了高效且可推广的软件工程代理测试时间扩展。
Dolphin-v2:通过可扩展的锚点提示实现通用文档解析
专题命中 效率与部署 :prompting(title);language model(abstract)
AI总结 Dolphin-v2通过可扩展的锚点提示实现通用文档解析,改进了文档类型分类、布局分析和元素检测,提升了对拍摄文档的解析能力并减少错误率。
生成式AI用于6G RAN中的意图驱动网络管理:Mamba模型的案例研究
机构 * School of Electrical Engineering and Computer Science, University of Ottawa(电气与计算机科学学院,渥太华大学) ; Ericsson(爱立信)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出基于Mamba模型的意图驱动网络管理架构,通过生成式AI提升网络自动化性能,实现70%的服务质量漂移降低和80 Mbps吞吐量提升。
Comments Paper submitted to IEEE for possible publication. The contents of this paper may change at any time
评估Tenstorrent的RISC-V矩阵乘法加速能力
机构 * University of Bologna(博洛尼亚大学) ; Cineca(Cineca公司)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文评估了Tenstorrent Grayskull e75 RISC-V加速器在降低精度下的矩阵乘法性能,对比了其与NVIDIA GPU和Intel处理器的能耗与计算效率。
Comments Accepted to the Computational Aspects of Deep Learning Workshop at ISC High Performance 2025. To appear in the ISC High Performance 2025 Workshop Proceedings
Journal ref Proc. High Performance Computing: ISC High Performance 2025 International Workshops, Hamburg, Germany
TurboBoA: 更快且精确的注意力感知量化无需反向传播
机构 * Samsung Research(三星研究院) ; SNU.ac.kr(首尔国立大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 TurboBoA是一种无需反向传播的高效PTQ算法,通过联合量化和误差补偿提升精度与速度,实现比BoA更快的量化过程。
Comments ICLR 2026