Adaptive Orchestration: Scalable Self-Evolving Multi-Agent Systems
自适应编排:可扩展的自进化多智能体系统
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出了一种自进化多智能体系统,通过动态专家混合方法解决大规模自主代理的泛化-专业化困境,提升任务成功率并减少资源消耗。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
自适应编排:可扩展的自进化多智能体系统
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出了一种自进化多智能体系统,通过动态专家混合方法解决大规模自主代理的泛化-专业化困境,提升任务成功率并减少资源消耗。
BabyLMs中的偏见动态:朝着更高效的计算 sandbox 以民主化预训练去偏研究
机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) ; ALTA Institute, University of Cambridge(ALTA研究所,剑桥大学)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI
AI总结 通过低成本BabyLMs研究偏见动态,降低预训练成本,促进公平语言模型的民主化研究。
Comments 21 pages, 18 figures
SageAttention3: 微缩放FP4注意力用于推理及8位训练的探索
机构 * Dept. of Comp. Sci. and Tech.(计算机科学与技术系) ; Institute for AI(人工智能研究院) ; BNRist Center(BNRist中心) ; THBI Lab(THBI实验室) ; Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) ; Tsinghua University(清华大学)
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 SageAttention3通过FP4和8位注意力提升推理与训练效率,实现5倍加速和无损微调性能。
离散费曼-科茨校正器
专题命中 效率与部署 :language model(abstract);分类 cs.LG
AI总结 本研究提出离散费曼-科茨校正器,通过序贯蒙特卡洛算法在推理时控制离散扩散模型的生成分布,实现高效采样和奖励优化。
Comments Code: https://github.com/hasanmohsin/discrete_fkc
可预测可靠性中的显式回避调节器用于视频问答
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Rutgers University(罗格斯大学)
专题命中 效率与部署 :language model(abstract);分类 cs.AI
AI总结 本文提出通过置信度阈值控制视频问答中的错误率,验证了在分布偏移下置信度回避机制的可靠性。
Comments Preprint. Diagnostic study of confidence-based abstention under evidence truncation
具备技能的数据选择与微调用于数据高效的推理蒸馏
机构 * University of Michigan(密歇根大学)
专题命中 效率与部署 :SFT(abstract);分类 cs.CL
AI总结 本文提出了一种基于技能的蒸馏框架,通过数据选择和微调提升推理效率,实验证明在数学推理基准上优于随机微调基线。
Memo-SQL: 结构化分解与经验驱动的自我修正以实现无训练的NL2SQL
机构 * City University of Hong Kong(香港城市大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 效率与部署 :prompting(abstract);分类 cs.AI
AI总结 Memo-SQL通过结构化分解和经验驱动的自我修正,实现了无训练的NL2SQL系统,在BIRD数据集上达到68.5%的执行准确率,同时资源消耗显著降低。
神经网络的硬件加速:全面综述
专题命中 效率与部署 :LLM(abstract)
AI总结 本文综述了神经网络硬件加速的技术现状,涵盖多种加速器架构和优化方法,探讨了未来神经网络加速的发展方向。
LADFA:利用大型语言模型和检索增强生成进行隐私政策中个人数据流分析的框架
机构 * Institute of Cyber Security for Society (iCSS) \& School of Computing, University of Kent Canterbury United Kingdom ; Honda Research Institute Europe GmbH Germany ; Institute of Cyber Security for Society (iCSS) \& School of Computing, University of Kent ; Honda Research Institute Europe GmbH
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 LADFA利用大型语言模型和检索增强生成技术,实现对隐私政策中个人数据流的自动化分析与可视化。
信用C-GPT:一种面向越南债务催收的领域专用大语言模型
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 Credit C-GPT是一种针对越南债务催收场景优化的领域专用大语言模型,通过整合多任务对话智能,提升对话理解、情感识别和意图检测等能力,为企业呼叫中心提供实时帮助和分析解决方案。
Comments 8 pages, 0 figures, 3 tables. Preprint
评估大型语言模型以实现公平和可靠的器官分配
机构 * University of Southern California(南加州大学)
专题命中 领域大模型 :large language model(title);language model(title);分类 cs.AI、cs.LG
AI总结 本文评估了大型语言模型在器官分配中的公平性,发现基于暴露的指标显示公平结果,而基于概率的指标揭示了系统性的偏好排序,强调了对公平性评估和人类监督的必要性。
行动者、框架和论点:利用大语言模型对金融新闻中气候话语的多十年计算分析
专题命中 领域大模型 :large language model(title);language model(title)
AI总结 利用大语言模型分析金融新闻中气候话语的演变,揭示了从风险与监管负担到经济机会与创新的转变,以及金融机构在其中的主导作用。
OUTLINEFORGE: 基于显式状态的分层强化学习用于科学写作
机构 * UC San Diego(圣迭戈大学) ; Ohio State University(俄亥俄州立大学)
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 OUTLINEFORGE通过分层强化学习和显式状态管理,提升科学写作的全局结构和引用一致性,改进文档规划和事实准确性。
SciNets: 图约束多跳推理用于科学文献综合
机构 * Jaypee Institute of Information Technology(杰伊佩 Institute 信息科技学院)
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SciNets通过图约束多跳推理实现科学文献综合,通过多跳路径连接罕见共现的概念,提升机制解释的稳定性和多样性。
Comments 19 pages, 2 figures
R-LAM:具有可重复性约束的大型动作模型用于科学工作流自动化
机构 * 1, Department of AI \& Data Science, RMK Engineering College, Chennai, India
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 R-LAM通过引入结构化动作模式、确定性执行策略和显式溯源跟踪,提升科学工作流自动化的可重复性和可靠性。
Comments 9 pages, 3 figures, 1 Table, 2 Artifacts
五年 SciCap:我们学到了什么以及科学图表描述的未来方向
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 SciCap项目通过五年研究总结了科学图表描述领域的技术经验,并提出了未来研究的五个关键方向。
Comments Accepted to the 5th Annual AAAI Workshop on AI to Accelerate Science and Engineering (AI2ASE 2026). SciCap Website: http://scicap.ai/
SIN-Bench:在长上下文多模态科学交织文献中追踪原生证据链
机构 * Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; KuaiShou Inc.(快手公司) ; Stanford University(斯坦福大学) ; Harvard University(哈佛大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 SIN-Bench 通过构建科学交织语料库和四个逐步任务,评估多模态模型在长上下文科学文献中追踪证据链的能力,揭示接地是主要瓶颈。
临床文档元数据提取:一项综述
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了临床文档元数据提取的研究,分析了方法学趋势和应用,并指出了未来研究方向。
从LLMs中阐释隐性监管知识以实现需求的自动形式化,用于合规测试用例生成
机构 * Shanghai Key Laboratory of Trustworthy Computing, ECNU(上海可信计算实验室,华东师范大学) ; Dishui Lake International Software Engineering Institute, ECNU(迪希湖国际软件工程研究院,华东师范大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 RAFT通过从多个LLMs中阐释隐性监管知识,实现需求自动形式化和合规测试生成,提升测试用例生成的精度和效率。
Comments 16 pages, 8 figures, 4 tables
逐步因果:基于多智能体树查询和对抗性置信度估计的透明因果发现
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) ; Zhili College, Tsinghua University, Beijing, China(清华大学哲利学院)
专题命中 领域大模型 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Tree-Query框架,通过多专家LLM和对抗性置信度估计,实现透明、可解释的因果发现,提升数据自由环境下的因果推理能力。
填补基准测试中的临床空白:日本医疗系统的健康基准案
机构 * Nara Institute of Science and Technology(奈良科学技术大学)
专题命中 领域大模型 :LLM(abstract);分类 cs.CL
AI总结 本研究指出日本医疗系统中医疗大语言模型评估的空白,提出建立本地化的J-HealthBench以提升评估的准确性和安全性。
Comments draft v0.3 Code and analysis data is available at https://zenodo.org/records/17405321
VQ-Seg: 基于向量量化令牌扰动的半监督医学图像分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 领域大模型 :foundation model(abstract)
AI总结 VQ-Seg通过向量量化和量化扰动模块提升半监督医学图像分割性能,有效解决传统dropout正则化问题。
Comments Accepted by NeurIPS 2025
VERHallu: 评估和缓解视频大语言模型中的事件关系幻觉
机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学计算机科学与技术学院,符号计算与知识工程重点实验室,教育部,吉林大学) ; College of Software, Jilin University(吉林大学软件学院) ; Facemind Group(FaceMind集团) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 本文提出VERHallu基准,用于评估和缓解视频大语言模型中的事件关系幻觉,通过关键帧传播策略提升多事件理解能力。
Comments 11 pages, 6 figures
大语言模型中的幻觉检测与缓解
机构 * CIBC(加拿大帝国商业银行)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文提出了一种系统化的框架,通过分层架构和闭环反馈机制,提升大语言模型在金融等高风险领域的可靠性,减少幻觉问题。
ProbFM:具有不确定性分解的概率时间序列基础模型
专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 ProbFM提出一种基于变压器的概率模型,利用深度证据回归实现理论基础的不确定性分解,提升金融预测的准确性和不确定性量化能力。
Comments Accepted for oral presentation at the AI Meets Quantitative Finance Workshop at ICAIF 2025. An enhanced version was accepted for oral presentation at the AI for Time Series Analysis Workshop at AAAI 2026
QoSBERT:基于预训练语言模型的不确定性感知方法用于服务质量预测
机构 * Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学)) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Key Laboratory of Dependable Service Computing in Cyber Physical Society (Chongqing University), Ministry of Education, China(网络物理社会可信服务计算重点实验室(重庆大学)) ; School of Big Data and Software Engineering, Chongqing University(重庆大学大数据与软件工程学院) ; Department of Computer Science at the University of Victoria(维多利亚大学计算机科学系)
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL
AI总结 QoSBERT基于预训练语言模型,通过不确定性估计提升服务质量预测的准确性和可靠性。
Journal ref IEEE Transactions on Services Computing ( Volume: 18, Issue: 6, Nov.-Dec. 2025)
循环作为桥梁:循环变换器能否真正连接表示空间和自然语言输出?
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了循环变换器是否能通过迭代机制弥合内部知识与自然语言输出之间的差距,发现循环次数增加虽缩小差距,但内部知识退化是主因,且表征感知能力仅在最终循环中存在。
Comments 9 pages,6 figures
宽松的信息流分析用于大型语言模型
机构 * University of Cambridge(剑桥大学) ; Microsoft(微软公司) ; Mila
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种更宽松的信息流分析方法,通过传播对模型输出有影响的样本标签来提高大型语言模型的安全性和隐私保护效果。
五种大语言模型中的合作与背叛策略
专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 研究五种大语言模型在重复囚徒困境中的合作与背叛策略,分析其在不同参数和框架下的适应性及一致性。
基于图的群体异常检测基础模型GFM4GA
机构 * Tencent(腾讯)
专题命中 其他LLM :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 GFM4GA是一种用于群体异常检测的新型图基础模型,通过双层对比学习预训练和参数受限的少样本微调,有效提升群体异常检测性能。