ORCA: Observability-Grounded Program Repair for Microservice Incidents
ORCA:基于可观测性的微服务故障程序修复
专题命中 推理评测 :verifier(abstract)
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ORCA:基于可观测性的微服务故障程序修复
专题命中 推理评测 :verifier(abstract)
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
GazeXPErT: 一种用于肿瘤FDG-PET/CT扫描可解释和可解释AI的专家眼动数据集
专题命中 推理评测 :reasoning(abstract)
AI总结 GazeXPErT通过专家眼动数据提升肿瘤FDG-PET/CT图像的可解释AI性能,包括病变分割和意图预测。
大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择
专题命中 其他推理 :CoT(summary_cn,abstract);分类 cs.LG
AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。
Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化
专题命中 其他推理 :CoT(summary_cn,abstract);分类 cs.LG
AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。
ThinkLog:利用推理进行日志语句生成
专题命中 其他推理 :reasoning(title,abstract)
AI总结 针对现有端到端日志语句生成方法准确性有限的问题,提出ThinkLog,该方法基于LLM,通过将推理融入提示作为少样本示例,引导LLM生成日志语句,在准确率提升15.4%的同时,推理成本约为现有最佳方法的50%。
Comments 16 pages, Accepted at the 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026), Short Papers Track
基于SAM3的关键帧推理:第8届LSVOS挑战赛MeViS-Text赛道第三名解决方案
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 其他推理 :reasoning(title)
AI总结 该研究提出两阶段无训练方案,依托Gemini-3.1 Pro分解视频事件选关键帧,用SAM3-agent生成掩码并双向传播,获第8届LSVOS挑战赛MeViS-Text赛道第三名。
基于图结构在线难度估计的高效RLVR调度
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。
评分需要评分标准,而非智能
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出any-to-bench设计原则,证实小型语言模型依据明确评分标准评分的可靠性与高成本模型相当,评分标准中的官方答案是关键,可将评分与评分者智能解耦。
SGHA:基于证据的研究问题发现,使用本地语言模型
机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) ; Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。
Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent
上游决策,下游生成:定位与定价多语言MoE模型的跨语言拒绝回路
机构 * Gödel Machines(哥德尔机器) ; IIT Madras(印度马德拉斯理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对多语言MoE模型的跨语言拒绝不均衡问题,在sarvam模型中定位到由注意力对抗者约束的混合专家生成器回路,揭示其机制并量化了安全修复的成本。
Comments Accepted to the actionable Interpretability workshop at COLM 2026
AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。
Comments COLM 2026
大型语言模型在规则应用中展现出概念掌握能力的证据
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。
CABLE:通过基于互补前项的链接与扩展扩展记忆检索的覆盖范围
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 CABLE是一种插件式记忆检索增强模块,通过构建互补关联扩展检索覆盖范围,在多个模型和数据集上的系统级评估中提升了证据可及性的LLM评判分数。
Comments Accepted by COLM 2026
GUPO:面向后训练大语言模型的梯度不确定性感知策略优化
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 针对GRPO中组梯度冲突导致策略更新效果差的问题,提出GUPO方法,通过贝叶斯框架建模组梯度并结合狄利克雷公式校准梯度贡献,经多基准实验验证其有效性。
迈向更安全的检索增强生成(RAG):仅具备系统2思考能力的智能体可访问不可信文档
机构 * University of Isfahan(伊斯法罕大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究针对RAG系统的知识投毒漏洞,提出仅具备系统2推理能力的智能体可访问不可信文档的安全原则,通过实证证明该原则能提升模型对被破坏证据的鲁棒性且无需严格隔离。
LLM 能否可靠地自我报告对抗性预填充,以及如何实现?
机构 * KAIST(韩国科学技术院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。
Comments In submission
TiMi: 通过多模态专家混合增强时间序列变换器
机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 TiMi通过多模态专家混合机制,利用大语言模型生成未来推断以提升时间序列预测的因果推理能力,实现多模态数据的有效整合与高精度预测。
大型语言模型在持续预训练中如何学习概念?
机构 * UC Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学) ; UCLA(加州大学洛杉矶分校) ; Meta AI
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究揭示了大型语言模型在持续预训练中概念学习的动态机制,通过分析概念电路揭示了概念获取、遗忘及相互作用的规律,为设计更可解释的训练策略提供依据。
Comments 19 pages, 27 figures
融合分层出口的紧凑型大语言模型推荐系统
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出FLEXRec框架,通过在紧凑型LLM的Transformer层插入预测头并自适应融合,结合AC-Router与目标k铰链损失,在三个数据集上以Qwen 3 1.7B和Llama 3.2 3B实现紧凑型主干方法中最优准确率且效率高。
Comments Accepted by ICDM'26
基于大语言模型的大规模频谱接入
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出基于群体相对策略优化的LSA框架,通过分层状态序列化机制解决超长提示导致的计算崩溃问题,实现高效频谱管理。
Comments 11 pages, 2 figures, 8 tables. Submitted to IEEE Transactions on Mobile Computing (TMC)