arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5849 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5849 篇

2602.10635 2026-06-17 cs.AI cs.LG 版本更新 62%

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

OmniSapiens: 一种通过异质性感知相对策略优化进行社会行为处理的基础模型

Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Prince Sattam bin Abdulaziz University(普森·萨塔姆·本·阿卜杜勒阿齐兹大学) University of Rochester(罗切斯特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对行为数据异质性导致的训练不平衡问题,提出Omnisapiens-7B 2.0基础模型,采用异质性感知相对策略优化(HARPO)方法,在10个行为任务和5个零样本泛化基准上取得最佳性能。

Comments Accepted to ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16285 2026-06-16 cs.CL cs.LG 新提交 62%

HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents

HiMPO:面向长周期智能体的后见知情记忆策略优化以减少纠缠信用分配

Jiangze Yan, Yi Shen, Wenjing Zhang, Jieyun Huang, Zhaoxiang Liu, Ning Wang, Kai Wang, Shiguo Lian

机构 * Unicom Data Intelligence, China Unicom(联通数据智能有限公司,中国联通) Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出HiMPO框架,通过比较记忆更新前后的任务相关信息估计局部效用,并利用后见相关性作为回顾性滤波器,减少记忆写入动作的信用纠缠,提升长周期智能体性能。

Comments Preprint. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16281 2026-06-16 cs.CL cs.AI 新提交 62%

Who Should Lead Decoding Now? Tracking Reliable Trajectories for Ensembling Masked Diffusion Language Models

现在谁应该主导解码?跟踪可靠轨迹以集成掩码扩散语言模型

Heecheol Yun, Joonhyung Park, Joowon Kim, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对掩码扩散语言模型集成问题,提出TIE框架,通过跟踪答案相关位置的置信度动态,迭代识别并传递可靠解码轨迹,实现多模型协同生成。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17106 2026-06-16 cs.CL cs.LG 版本更新 62%

HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

HyDRA:异构LLM池的混合动态路由架构

Aashna Garg, Siddharth Singha Roy, Jinu Jang, Federico Brancasi, Shengyu Fu

机构 * Microsoft(微软)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。

Comments preprint v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01182 2026-06-16 cs.AI cs.CL cs.HC cs.IR cs.MA 62%

Question-to-Knowledge (Q2K): Multi-Agent Generation of Inspectable Facts for Product Mapping

问题到知识(Q2K):多智能体生成可检查的事实以实现产品映射

Wonduk Seo, Taesub Shin, Hyunjin An, Dokyun Kim, Seunghyun Lee

机构 * The University of Tokyo(东京大学) KISTI(韩国科学技术院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Q2K通过多智能体框架利用大语言模型实现可靠的产品SKU映射,通过生成辨析问题、网络搜索和去重来提高准确性与鲁棒性,适用于复杂场景如捆绑识别和品牌来源辨析。

Comments Accepted by IEEE BigData 2025 Industry Track

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 2646-2653

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14476 2026-06-15 cs.AI cs.LG 新提交 62%

When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More

当工具决定时:LLM代理盲目服从图神经网络工具,更强的骨干网络服从更多

Zhongyuan Wang, Pratyusha Vemuri

机构 * raptorX.ai

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM代理在使用GNN工具时是否真正判断而非盲目服从,发现代理在97.6-99.2%的情况下完全采纳GNN输出,且更强的骨干网络服从更多,选择性调用设计受限。

Comments 9 pages, 2 figures. Under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13115 2026-06-12 cs.CL cs.AI 新提交 62%

G-Long: Graph-Enhanced Memory Management for Efficient Long-Term Dialogue Agents

G-Long:面向高效长期对话代理的图增强记忆管理

Minjun Choi, Yoonjin Jang, Sangwon Youn, Youngjoong Ko

机构 * Sungkyunkwan University(成均馆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出G-Long框架,利用微调小语言模型进行结构化三元组提取和关联检索,并引入注意力感知重要性评分机制,在降低计算开销的同时,在响应生成和记忆检索上达到最优性能。

Comments 22 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24079 2026-06-12 cs.CL cs.AI 版本更新 62%

The Pragmatic Persona: Discovering LLM Persona through Bridging Inference

实用人格:通过桥接推理发现LLM人格

Jisoo Yang, Jongwon Ryu, Minuk Ma, Trung X. Pham, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, 06974, Republic of Korea(Chung-Ang大学人工智能系) Department of Computer Science, University of British Columbia, Vancouver, BC V6T 1Z4, Canada(不列颠哥伦比亚大学计算机科学系) Van Lang University, Ho Chi Minh City, Vietnam(文-lang大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出基于桥接推理的框架,通过构建话语级知识图谱捕捉LLM对话中的隐含语义关联,实现从话语连贯性层面发现稳定人格特征,优于基于频率或风格的基线方法。

Comments 15 pages, 4 figures, accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10968 2026-06-11 cs.LG cs.AI 版本更新 62%

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

超越大语言模型强化学习中的统一令牌级信任区域

Renjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对PPO风格信任区域在自回归生成中的位置无关问题,提出CPPO方法,通过位置加权阈值和累积前缀预算动态调整令牌级约束,提升训练稳定性和推理准确性。

Comments Project Page: https://hunyuan-cppo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 62%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11173 2026-06-10 cs.AI cs.LG 新提交 62%

The Role of Feedback Alignment in Self-Distillation

反馈对齐在自蒸馏中的作用

Semih Kara, Oğuzhan Ersoy

机构 * Gensyn

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过自蒸馏提升语言模型性能时,反馈与模型推理的结构对齐是关键因素,步级对齐批评比二元奖励或参考解更有效。

Comments Accepted to the ICML 2026 Workshop on RL from World Feedback (RLxF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10087 2026-06-10 cs.CL cs.LG 新提交 62%

CodeAlchemy: Synthetic Code Rewriting at Scale

CodeAlchemy:大规模合成代码重写

Ankit Gupta, Aditya Prasad, Rameswar Panda

机构 * MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出CodeAlchemy框架,通过5种策略生成超过500B token的合成代码数据,引入DevEval和TraceEval基准,3B模型在多项任务上超越10倍大小的前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08893 2026-06-09 cs.LG cs.AI cs.CR 新提交 62%

Cheap Reward Hacking Detection

廉价奖励黑客检测

Iván Belenky, Joaquín Itria, Steven Johns

机构 * Tamarillo

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出用小Transformer编码器将轨迹映射到单位球面,使嵌入距离近似奖励与元数据的L1距离,线性探针检测奖励黑客,AUC达0.9467,成本比LLM-as-judge低四个数量级。

Comments 20 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07865 2026-06-09 cs.LG cs.AI physics.comp-ph stat.ML 新提交 62%

Instrumented data for causal scientific machine learning

因果科学机器学习的仪器化数据

Daniel N. Wilke

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出仪器化数据作为观测数据和模板合成数据之外的第三种选择,每个数据点携带产生它的机制模型、显式不确定性及可执行的反事实族,通过V&V仪器化图像到模拟管道实现,支持因果干预。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07526 2026-06-09 cs.CL cs.AI 新提交 62%

GraphLoRA: Structure-Aware Low-Rank Adaptation for Large Language Model Recommendation

GraphLoRA: 面向大语言模型推荐的结构感知低秩适配

Lin Mu, Guoji Wang, Li Ni, Lei Sang, Zhize Wu, Peiquan Jin, Yiwen Zhang

机构 * Anhui University(安徽大学) Hefei University(合肥大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出GraphLoRA框架,通过在低秩适配路径中嵌入可训练的图消息传递网络,实现结构信号传播,从而深度融合图结构与文本语义,提升LLM推荐性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16928 2026-06-09 cs.CL cs.AI 版本更新 62%

Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps

全注意力再临:在数百次训练步骤内将全注意力转化为稀疏

Yanke Zhou, Yiduo Li, Hanlin Tang, Maohua Li, Kan Liu, Tao Lan, Lin Qu, Yuan Yao, Xiaoxing Ma

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RTPurbo方法,通过利用模型内在稀疏性,在少量训练步骤内实现高效的稀疏注意力,从而在保持接近无损精度的同时,显著提升推理效率。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09193 2026-06-09 cs.CL cs.AI cs.HC 62%

(Ir)rationality and Cognitive Biases in Large Language Models

非理性与大语言模型中的认知偏差

Olivia Macmillan-Scott, Mirco Musolesi

机构 * University College London(伦敦大学) University of Bologna(博洛尼亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过心理学文献中的任务评估七种语言模型,发现其在非理性表现上与人类相似,但表现形式不同,且存在响应不一致的额外非理性特征。

Journal ref Royal Society Open Science 11(6) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10196 2026-06-09 cs.LG cs.AI 版本更新 62%

Large Models for Time Series and Spatio-Temporal Data: A Survey and Outlook

时间序列与时空数据的大模型:综述与展望

Ming Jin, Yaxuan Kong, Yuxuan Liang, Chaoli Zhang, Siqiao Xue, Xue Wang, James Zhang, Yi Wang, Haifeng Chen, Xiaoli Li, Vincent S. Tseng, Yu Zheng, Lei Chen, Hui Xiong, Shirui Pan, Qingsong Wen

机构 * Griffith University(格里菲斯大学) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang Normal University(浙江师范大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Deloitte Service LLP(德勤服务有限责任公司) The University of Hong Kong(香港大学) NEC Laboratories America(NEC美国实验室) A*STAR National Yang Ming Chiao Tung University(阳明交通大学) JD Technology(京东科技) Squirrel Ai Learning

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 综述了面向时间序列和时空数据的大模型,按数据类型、模型类别、范围和应用领域分类,总结了通用与领域专用模型,并整理了相关资源与开放问题。

Comments Accepted by ACM Computing Surveys; 35 Pages; Github Repo: https://github.com/qingsongedu/Awesome-TimeSeries-SpatioTemporal-LM-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06464 2026-06-08 cs.CL cs.AI 交叉投稿 62%

Human Adults and LLMs as Scientists: Who Benefits from Active Exploration?

人类成人与LLM作为科学家:谁从主动探索中受益?

Mandana Samiei, Eunice Yiu, Anthony GX-Chen, Dongyan Lin, Jocelyn Shen, Blake A. Richards, Alison Gopnik, Doina Precup

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) University of California Berkeley(加州大学伯克利分校) New York University(纽约大学) Meta FAIR MIT Media Lab(麻省理工学院媒体实验室) Montreal Neurological Institute(蒙特利尔神经科学研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过主动探索实验,发现主动探索能显著提升成人对合取因果规则的推理能力,但合取规则仍需更多测试;同时比较了大型语言模型的表现,发现部分模型在假设推断准确率上接近人类,但探索策略效率较低且存在类似的合取-析取性能差距。

Comments Accepted at the 48th Annual Conference of the Cognitive Science Society (CogSci 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01850 2026-06-08 cs.CV cs.AI cs.LG cs.MM 版本更新 62%

MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs

MoDA: 面向指令型多模态大语言模型的细粒度视觉定位的调制适配器

Wayner Barrios, Andrés Villa, Juan León Alcázar, SouYoung Jin, Bernard Ghanem

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MoDA调制适配器,通过指令引导的通道级乘法调制增强细粒度视觉定位,在12个基准上对三种MLLM架构取得一致提升,计算开销极小。

Comments Accepted at ICML 2026. Code is available at https://github.com/waybarrios/MoDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06098 2026-06-05 cs.CL cs.LG 62%

IR3DE: A Linear Router for Large Language Models

IR3DE:面向大型语言模型的线性路由器

Eros Fanì, Oğuzhan Ersoy

机构 * Gensyn

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出基于岭回归的线性路由器IR3DE,以低成本快速为每个提示选择最合适的领域专家大语言模型,在推理任务中超越基线方法,并支持动态添加或移除专家模型。

Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05983 2026-06-05 cs.AI cs.CL 62%

Framing, Judging, Steering: An Assessable Competency Model for Teach-ing Students to Reason With Generative AI

框架构建、判断、引导:一种可评估的能力模型,用于教授学生与生成式AI进行推理

Alexander Apartsin, Yehudit Aperstein

机构 * Holon Institute of Technology(霍洛恩技术学院) Afeka College of Engineering(阿菲卡工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CoRe-3能力模型,将有效使用AI分解为框架构建、判断和引导三种可评估技能,并通过模拟实验验证其区分效度。

Comments 18 pages, 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05749 2026-06-05 cs.CL cs.AI 62%

MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

MARDoc:面向多模态长文档问答的记忆感知精炼智能体框架

Kaifeng Chen, Hongtao Liu, Qiyao Peng, Jian Yang, Yongqiang Liu, Xiaochen Zhang, Qing Yang

机构 * Tianjin University(天津大学) Qifu Technology(启福科技) Beihang University(北航) Jiangnan University(江南大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MARDoc框架,通过解耦为探索、精炼和反思三个智能体,并利用结构化记忆替代完整交互历史,减少上下文噪声,提升多模态长文档问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL 62%

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05538 2026-06-05 cs.LG cs.CL 62%

Less is MoE: Trimming Experts in Domain-Specialist Language Models

少即是MoE:修剪领域专家语言模型中的专家

Haoze He, Xinkai Zou, Xuan Jiang, Xingyuan Ding, Ao Qu, Juncheng Billy Li, Heather Miller

机构 * Carnegie Mellon University(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) MIT(麻省理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对MoE模型部署时参数过多的问题,提出基于Fisher重要性的中间维度修剪方法Fisher-MoE,在50%压缩比下保持模型能力,减少约45%权重内存并提升21%推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11632 2026-06-05 cs.CL cs.AI 62%

Macro: Enhancing Multilingual Counterfactual Explanations through Alignment-as-Preference Optimization

Macro: 通过偏好对齐优化提升多语言反事实解释

Yilong Wang, Qianli Wang, Bohao Chu, Yihong Liu, Jing Yang, Simon Ostermann

机构 * Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) University of Duisburg-Essen(杜伊斯堡- Essen大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Saarland Informatics Campus(萨尔兰州信息学校区) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20980 2026-06-05 cs.LG cs.AI stat.AP stat.ML 62%

From Causal Discovery to Dynamic Causal Inference in Neural Time Series

从因果发现到神经时间序列中的动态因果推断

Dmitry Zaytsev, Valentina Kuskova, Michael Coppedge

机构 * Lucy Family Institute for Data & Society(数据与社会卢西家族研究所) University of Notre Dame(诺克斯达大学) Political Science University of Notre Dame(政治学诺克斯达大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出动态因果网络自回归(DCNAR)两阶段框架,通过神经自回归因果发现学习稀疏有向因果网络,并将其作为结构先验用于时变神经网络自回归,实现无需预设网络结构的动态因果推断。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07253 2026-06-05 cs.AI cs.CL 62%

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

从分布外检测到幻觉检测:一个几何视角

Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过将幻觉检测重新定义为分布外检测问题,利用几何视角提出了一种无需训练、基于单样本的检测方法,在推理任务中实现了高准确率。

Comments ICML 2026 main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04516 2026-06-04 cs.LG cs.AI 62%

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling

GeoMin: 基于几何分布建模的数据高效半监督RLVR

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang, Bowen Song, Weiqiang Wang, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出GeoMin方法,通过建模标注数据的全局特征分布来解码正确与错误展开的结构差异,从而建立稳健先验评估自奖励信号可靠性,以少量标注数据高效利用未标注数据,在仅用10%标注时超越全监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02834 2026-06-04 cs.LG cs.AI 62%

What Structural Inductive Bias Helps Transformers Reason Over Knowledge Graphs? A Study with Tabula RASA

什么结构归纳偏置帮助Transformer在知识图谱上进行推理?Tabula RASA研究

Jonas Petersen, Camilla Mazzoleni, Gian-Alessandro Lombardi, Federico Martelli, Riccardo Maggioni

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过最小化Transformer修改的消融实验,发现稀疏邻接掩码是驱动多跳推理的主要结构归纳偏置,而关系参数贡献有限。

Comments Accepted at GFM, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏