Orca: Ocean Significant Wave Height Estimation with Spatio-temporally Aware Large Language Models
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.LG
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL
Comments Accepted by WWW 2024
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL
专题命中 推理与问题求解 :language model(title);small language model(title);分类 cs.AI
Comments Added url to model weights fixed typo in Author name
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Fudan University(复旦大学) ; CUHK(香港中文大学) ; Tsinghua University(清华大学) ; CUHK-Shenzhen(香港中文大学深圳校区) ; UESTC(电子科技大学) ; USTC(中国科学技术大学)
专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract);language model(abstract);post-training(abstract)
Comments This paper focuses on LLM-as-a-Judge, and the project is currently in progress
基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力
机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) ; Oxford University Innovation(牛津大学创新公司) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所) ; King’s College London(伦敦国王学院)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。
打破最弱环节以规避视觉语言模型
机构 * ESILV(ESILV高等工程师学院) ; Thales(泰雷兹集团)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究针对视觉语言模型(VLMs)提出仅优化视觉编码器的梯度攻击方法,在Qwen2.5-VL等模型上验证微小扰动可规避模型,凸显其对抗操纵的脆弱性并呼吁强化安全机制。
Comments 17 pages
面向大语言模型推理的强化学习的期望最大化视角
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出EM策略梯度(EMPG)框架,将大语言模型推理的强化学习转化为期望最大化问题,在简化优化流程的同时,在GSM8K、MATH Hard数据集上取得与GRPO相当或更优的性能,且能生成更简洁的结构化推理轨迹。
Comments 20 pages
判断-结果差距:医疗决策中的大语言模型道德推理
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现LLMs在医疗决策中存在判断-结果差距,即虽认同患者对危害健康行为负有责任,但拒绝将该判断用于稀缺医疗资源分配,且随推理能力提升会放大与人类的道德分歧。
Comments Accepted at AIES 2026
通过可验证的推理过程监督获得正确答案:语言模型的可验证过程监督
机构 * KAIST AI(KAIST人工智能研究所) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Rice University(里士满大学) ; Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学) ; Sentient Labs(Sentient实验室)
专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 本文提出VPS框架,通过联合优化预测准确性和推理质量,在可验证领域使语言模型同时获得准确和可靠的推理能力。
Comments COLM 2026
叠加的幻觉?语言模型中潜在思维的原理性分析
机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学)
专题命中 推理与问题求解 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 本文探讨了连续链式思维(Latent CoT)中叠加现象的出现条件,发现仅从头训练的模型表现出叠加特性,而其他训练方式下模型倾向于使用捷径解法。
Comments 9 pages
Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。
Comments 7 pages, comments welcome!
用于虚假订单欺诈检测的可追溯大语言模型推理
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对大规模虚假订单欺诈检测难题,提出基于大语言模型的DeepScrub框架,通过语义统一、持续预训练及SURE机制实现可追溯推理。实验及试点结果显示,该框架提升了欺诈审查精度与召回率,减少工作量并节省成本。
Comments 15 pages, 3 figures
PPL-Factory:从语言建模到推理的任务感知和预算感知数据选择
机构 * McGill University(麦吉尔大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 研究如何从语言建模到推理进行任务和预算感知的数据选择,提出PPL-Factory框架,结合任务感知困惑度得分与数据预算感知标准,实验表明该框架在GSM8K等任务上仅用少量训练集就能超越其他方法,有效提升微调效率。
Comments 13 pages, 4 figures, 5 tables
ShopX:面向智能购物中意图到商品实现的基础模型
专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。
Comments The new version adds additional results and details
用于无训练语言模型推理的深度熵引导采样
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究旨在提升无训练语言模型推理能力,提出深度熵引导采样(DEGS)方法,利用逐层熵坍缩作为质量信号,结合序列似然性与深度熵结构,在多个模型和基准测试中达到无训练最优精度,在域外和难题测试中表现出色。
大语言模型预测器知道但不说的内容:探究校准和忠实性的内部表示
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对预测微调的大语言模型校准和忠实性问题,通过在中间激活上训练表示池探测器,发现其校准效果更好,还能评估CoT忠实性、追踪行为变化等,证明探究内部表示可用于校准、审计和分类语言模型预测器及推理模型。
大多数大语言模型的从众现象无需说话者:在同伴压力基准测试中测量无说话者底线
机构 * Illinois Institute of Technology(伊利诺伊理工学院) ; Amazon(亚马逊)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型从众现象,发现多数从众在去除同伴后仍存。因标准提示混杂线索致现有基准无法分辨。引入无来源条件测试,发现其在多数案例中致有害修正,还揭示来源框架对底线的调节作用及相关问题,强调从众基准测试应先测无说话者底线。
CCBENCH:通过健康查询使用隐式信号规范评估大语言模型的文化能力
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究引入CCBENCH框架,以健康领域为案例创建CCBENCH-Health评估大语言模型文化能力。通过60个角色、3120次互动对五个领先模型进行基准测试,发现模型文化恰当回应比例低,提示关注文化线索能适度提升性能,还揭示了模型与文化线索互动的一些特点。
Comments 34 pages
语言模型中的伪 deliberation:当推理无法使价值观与行动一致时
机构 * New York University(纽约大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。
Comments 9 pages, 5 main figures
使用大型视觉语言模型审核不安全的用户生成内容游戏中的非法在线图像推广
机构 * University at Buffalo(布法罗大学) ; Northeastern University(东北大学) ; Clemson University(克莱姆森大学) ; The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 针对社交媒体上非法推广不安全UGC游戏的图像,提出UGCG-Guard系统,利用大型视觉语言模型和条件提示策略实现零样本域适应,检测准确率达94%。
Comments In Proceedings of the 33rd USENIX Conference on Security Symposium (SEC '24), August 14-16, 2024
少即是多:用最小测试时干预提升大语言模型推理能力
机构 * HKUST(GZ)(香港科技大学(广州)) ; Kuaishou Technology(快手科技) ; AIML(人工智能实验室) ; ZJU(浙江大学) ; Ant Group(蚂蚁集团) ; HKUST(香港科技大学)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型推理中高计算成本问题,提出最小测试时干预(MTI)框架,通过仅在不确定位置应用分类器自由引导和轻量负提示引导,在保持高效的同时提升推理准确性和稳定性。
Comments Code: https://github.com/EnVision-Research/MTI
残差上下文扩散语言模型
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 提出残差上下文扩散(RCD)模块,通过回收丢弃令牌的上下文残差提高扩散语言模型的解码效率,在长/短CoT任务上以极少额外计算提升准确率4-11个百分点。
建模复杂行为:视觉语言模型中的多人格组合与动态切换
机构 * Xi'an Jiaotong University(西安交通大学) ; Beihang University(北京航空航天大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究在视觉语言模型中引入显式人格条件,建立包括单人格、多人格和人格切换的系统评估框架,发现人格提示可提升图像描述但损害精确推理任务,并观察到多特质组合与动态切换中的平衡与残留效应。
Comments 16 pages, 4 figures, 10 tables
人类与DeepSeek-R1大语言模型数学推理的全面解剖
机构 * UCL Centre for Artificial Intelligence(伦敦大学人工智能中心)
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 通过AIME 2025所有30道题目的10247个推理步骤注释,发现DeepSeek-R1存在拓扑模仿(表面模仿推理而非真正推理),但成功轨迹中分支与回溯的稳定使用以及反射在演绎推理中的有效放置是真正推理的信号。
CLASH:从多个视角评估语言模型在高风险困境中的判断
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Department of Philosophy(哲学系) ; University of Michigan Ann Arbor(安娜堡大学)
专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出CLASH数据集,用于研究基于价值观的决策过程,发现语言模型在处理矛盾决策、心理不适和价值观变化时存在显著不足。
Comments Published as a conference paper at ICLR 2026
ReasonOps: 大语言模型推理轨迹的算子分割
机构 * Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 提出无监督方法ReasonOps,从思维链轨迹中提取7种通用推理算子,揭示模型推理结构并用于模型识别与正确性预测。
流形上的推理:扩散语言模型中用于自我验证的双向一致性
机构 * Institute of Science and Technology for Brain-Inspired Intelligence(脑启发智能科学与技术研究院) ; Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; IEG, Tencent Inc.(腾讯IEG)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 提出双向流形一致性(BMC),一种无训练、无监督的度量方法,通过前向掩码和后向重建循环量化生成序列的稳定性,用于扩散语言模型的诊断、推理和对齐。
Comments 31 pages, 7 figures. Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version
Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026
ContextGuard: 语言模型中上下文学习的结构化自我审计
机构 * Peking University(北京大学) ; SCUT(上海交通大学) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 提出ContextGuard框架,通过结构化自我审计机制使大语言模型在复杂上下文任务中忠实遵循所有上下文约束,包括外围、持久和格式敏感要求。
路径很重要:学习扩散语言模型的令牌提交策略
机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) ; Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TraceLock,一种轻量级可插拔控制器,通过学习可复用的轨迹状态策略来优化扩散语言模型中的令牌提交决策,从而改善质量与步数之间的权衡。