Deciphering Political Entity Sentiment in News with Large Language Models: Zero-Shot and Few-Shot Strategies
专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted in PoliticalNLP workshop co-located with LREC-COLING 2024
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted in PoliticalNLP workshop co-located with LREC-COLING 2024
专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments 7 pages, 3 figures
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Dist2ill: 基于分布的蒸馏用于大语言模型中单次传递的不确定性估计
机构 * Rutgers University(罗格斯大学) ; Vanderbilt University(范德比尔特大学) ; Meta
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG
AI总结 Dist2ill通过在单次推断中生成多个多样化的推理路径,利用轻量级模块近似置信度分数,实现大语言模型中更准确的不确定性估计。
Comments Preprint; work in progress. Update Log: 05/2025 (v1&v2): Introduced Dist2ill (previously named EUD) for efficient uncertainty estimation, focusing on discriminative reasoning tasks. 02/2026 (v3): Extended Dist2ill to a unified framework supporting both discriminative and generative reasoning
PolicyGuide:从单一动作防护到合规LLM智能体的全流程引导
机构 * KAIST(韩国科学技术院)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PolicyGuide将领域政策编译为工作流图,通过主动验证器引导LLM智能体合规执行,在多领域提升了合规率,且工作流可跨模型迁移,攻击成功率低、程序性合规性强。
Comments 26 pages, 15 figures, including appendices
快速分叉:高效估计文本生成中的不确定性动态
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对文本生成中不确定性动态估计成本高的问题,本研究开发统计模型平滑低采样推理数据以近似高采样数据,提升重采样分析效率,揭示不确定性动态的稳定模式及噪声来源。
Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。
Comments 13 pages, 4 figures, and 3 tables
测试时的AI辅助AI:通过 harness 实现强模型到弱模型的能力迁移
机构 * Salesforce AI Research(Salesforce人工智能研究院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出在测试时通过构建 harness,无需重新训练即可将强模型的认知结构迁移给弱模型,使目标模型在四个心理理论基准上的平均性能从0.49提升至0.91,为模型能力迁移提供了新的思路。
Comments 23 Pages, 12 Figures, 6 Tables
记忆还是检索:考虑RAG的缩放规律
机构 * Stanford University(斯坦福大学) ; Independent Researcher(独立研究员) ; Patronus AI ; The Ohio State University(俄亥俄州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨了预训练知识与检索知识的平衡,提出三维缩放框架,揭示在不同模型规模和任务类型下检索的边际效用,为语言模型设计提供数据资源分配指导。
Comments Code available at https://github.com/DegenAI-Labs/RAG-Scaling-Laws
PhysAgent:用于可靠远程心率估计的多智能体框架
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 PhysAgent是一种推理时多智能体候选验证框架,以多个基础rPPG估计器输出为待验证生理假设,结合Qwen3-VL-4B多模态大语言模型推理与确定性融合,提升远程心率估计的稳定性与可靠性。
EPM-RL:电商产品映射的强化学习方法
机构 * AI Research, Enhans(AI研究,Enhans)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出EPM-RL框架,通过强化学习提升电商产品映射的准确性和效率,解决传统方法依赖外部API和高成本的问题,实现私有部署和低成本运营。
Comments preprint
Journal ref Proceedings of the AAAI Symposium Series, vol. 9, no. 1, p. 227, 2026
FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型
专题命中 测试时计算 :reasoning(abstract);planning(abstract)
AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。
基于重新定义的逐步优势的自引导过程奖励优化用于过程强化学习
机构 * Terminus Group(Terminus集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对过程强化学习中引入奖励模型计算开销大且缺乏统一优势估计框架的问题,提出SPRO框架,通过从策略模型导出奖励及重新定义优势进行过程感知强化学习,实验显示其训练效率高、准确率提升且无额外开销。
通过潜在蒸馏探索大语言模型
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(人工智能通用基础理论国家重点实验室,BIGAI,北京,中国) ; School of Information Science and Technology, ShanghaiTech University, Shanghai, China(信息科学与技术学院,上海交通大学,上海,中国)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Exploratory Sampling方法,通过蒸馏模型引导生成过程,提升语义多样性与推理效率,在数学、科学和代码生成中表现优异。
Comments 25 pages, 5 figures. Accepted in ICML 2026
StructAgent:利用统一因果结构驾驭长时程数字智能体
机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) ; Aether AI Lab(以太人工智能实验室)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。
多语言视觉多项选择题中小视觉语言模型的测试时缩放
机构 * ImageCLEF Lab(图像CLEF实验室) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究小型视觉语言模型在多语言视觉多项选择题中的测试时缩放,比较多种方法,发现运行条件重要,可解析性是关键,增加解码预算有帮助,复杂方法贡献小,最佳配置在测试集上表现出色,位居排行榜首位。
Comments 14 pages, 2 figures, accepted at ImageCLEF 2026
HKVLM:通过将语言查询绑定到冻结检测器实现忠实推理定位
机构 * Bo Ma
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 提出HKVLM框架,通过将定位从语言路径中分离,利用冻结检测器和语言模型,仅训练轻量对齐钩子实现推理定位,在少样本冷启动场景下显著提升定位精度并减少幻觉。
SEVA: 具有过程奖励的自进化验证代理用于事实归因
机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) ; University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。
Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent
当更多采样有害时:测试时扩展的模态上限与相关性上限
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文揭示测试时扩展中采样过多会导致选择性能停滞甚至下降,提出模态上限和相关性上限,并给出有效采样数作为停止准则。
Comments 24 pages, 10 figures, 3 tables. Code and data: https://github.com/bay-yearick-lab/sampling-ceilings
用Co-Scientist加速科学发现
机构 * Google Cloud AI Research(谷歌云人工智能研究) ; Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究) ; Stanford University School of Medicine(斯坦福大学医学院) ; Houston Methodist(休斯顿卫理公会医院) ; Sequome ; Fleming Initiative and Imperial College London(弗莱明倡议与伦敦帝国理工学院)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Co-Scientist是一种基于Gemini的多智能体AI系统,通过异步任务框架和竞赛进化过程,提升科学假设生成质量,应用于药物再利用、新靶点发现和抗菌机制解释,验证了其加速科学发现的能力。
Comments 157 pages in total (main 42 pages, supplementary information 115 pages), 4 main figures, 1 main table, 6 extended data figures, 2 extended data tables, 9 supplementary figures, 4 supplementary tables, 37 main references, 117 supplementary references. Nature (2026)
最强的教师并不总是最好的教师:以学生为中心的答案选择
机构 * University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Southern California(南加州大学) ; Independent Researcher(独立研究者) ; National University of Singapore(新加坡国立大学) ; Microsoft(微软) ; Google(谷歌) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Northwestern University(西北大学) ; Allen Institute for AI (AI2)(人工智能研究院(AI2))
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。
思考令牌有助于安全性吗?
机构 * Princeton Language and Intelligence(普林斯顿语言与智能)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现前沿推理模型的安全性行为并非真正基于思考,早期令牌即可预测拒绝/顺从结果,思考过程更像前缀补全而非审慎修订。
PEAR: 置换等变自适应路由多智能体辩论
机构 * University of Edinburgh(爱丁堡大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PEAR协议,通过动态重配置通信角色和稀疏拓扑,消除固定拓扑中的位置偏差,提升多智能体辩论的准确性和鲁棒性。
OCELOT:面向隐私保护LLM代理的推理泄露预算
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。
PRInTS:面向长程信息检索的奖励建模
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。
Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS
使用合成理由数据进行监督微调损害真实世界疾病预测
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Merced(加州大学默塞德分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。
关于 Max@K 策略梯度的优势估计
机构 * The University of Tokyo(东京大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对稀疏奖励下推理模型后训练困难,提出一种新的优势估计方法 MaxPO,通过 Leave-Two-Out 基线实现中心化优势,降低梯度方差并提升性能。
MesaNet: 通过局部最优测试时训练进行序列建模
机构 * Google(谷歌) ; Paradigms of Intelligence Team(智能范式团队) ; Google DeepMind(谷歌DeepMind) ; MIT CSAIL(麻省理工学院CSAIL)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种基于共轭梯度求解器实现局部最优测试时训练的Mesa层,在保持常数推理成本的同时,在语言建模困惑度和下游基准性能上超越现有RNN模型。
Comments Published at ICLR 2026
Agentic AI 在遥感中的应用:技术挑战与研究方向
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract)
AI总结 本文指出遥感中的多步分析工作流存在结构性的地理空间约束,提出面向地球观测的原生智能体设计原则,包括结构化地理空间状态、工具感知推理、验证器引导执行和有效性感知学习评估。
Comments 31 pages. Position Paper