arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1676 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1676 篇

2608.18105 2026-08-20 cs.CL cs.AI cs.LG 新提交 75%

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体

Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

机构 * IIIT-Delhi(德里印度信息技术学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 75%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 75%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08225 2026-08-11 eess.SP cs.SY eess.SY 新提交 75%

Toward Intelligent Skies: Signal Processing and AI Foundations of Low-Altitude Wireless Networks

迈向智能天空:低空无线网络的信号处理与人工智能基础

Weijie Yuan, Geng Sun, Jiacheng Wang, Jun Wu, Yuanhao Cui, Jiahui Li, Wei Zhang, George K. Karagiannidis, Sumei Sun, Yonina C. Eldar

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本教程从AI与信号处理视角,全面阐述低空无线网络(LAWN)的架构基础、信号处理与AI技术,结合案例分析其融合应用,指出未来发展挑战与机遇。

Comments Invited Overview Paper in JSTSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09591 2026-08-11 cs.RO cs.CV 新提交 75%

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

FactorDrive:面向端到端自动驾驶的、由规划关键因素驱动的自适应多步推理

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

机构 * Southeast University(东南大学) Universiti Malay(马来亚大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 推理与问题求解 :language model(abstract);instruction tuning(abstract);post-training(abstract)

AI总结 该研究针对现有端到端自动驾驶方法在空间物理证据融合、推理适应及推理路径优化上的不足,提出FactorDrive框架,通过PCF-CoT数据集与QS-GRPO算法优化推理,在两类基准上取得最优规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06701 2026-08-10 cs.SE cs.AI cs.CL cs.LG 新提交 75%

Online Monitoring and Corrective Steering of Programming Agents

编程智能体的在线监控与纠正引导

Shuyang Liu, Saman Dehghan, Ji Young Kim, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LivePlan,通过解耦判断与建议的设计,在SWE-agent基础上实现编程智能体的在线监控与纠正,在SWE-bench数据集上显著提升问题解决率,且成本增量极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05631 2026-08-07 cs.CV 新提交 75%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision:基于潜在状态重构的时序推理

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00629 2026-08-04 cs.GR 新提交 75%

ParticleGen: A Multi-Agent System for Particle Effects Generation

ParticleGen:用于粒子效果生成的多智能体系统

Junhao Zhuge, Junyi Yang, Yuqing Wang, Kangzhan Wang, Sipeng Yang, Xiaogang Jin

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出多智能体框架ParticleGen,可从自然语言描述合成结构化可编辑粒子系统,经Unreal Engine 5的Niagara系统多场景验证,能降低创作门槛、提升迭代效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00200 2026-08-04 cs.AI cs.CL cs.ET cs.LG 新提交 75%

TRACE-TS: Attribution-Grounded and Traceable Sensor-Language Reasoning for Human Activity Understanding

TRACE-TS:面向人类活动理解的归因基础且可追踪的传感器-语言推理

Sparsh Rastogi, Tanmay Kumar, Baiyu Chen, Jatin Bedi, Zechen Li, Flora D. Salim

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有传感器-语言推理与信号关联弱、解释不可靠的问题,提出TRACE-TS框架,通过专家归因识别关键传感器区域并构建可追踪推理轨迹,在7个可穿戴基准上实现最优性能。

Comments 24 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00004 2026-08-04 cs.CL cs.AI cs.LG 新提交 75%

Cost-Effective Automated Judging of Natural-Language Mathematical Proofs

自然语言数学证明的高性价比自动评判

Benjamin Grayzel

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究以 IMO-GradingBench 为基准,验证 GPT-OSS 120B 等三个低成本模型作为数学证明评判器的效果,发现全票通过规则的低成本方案与前沿模型效果相当,成本低达 100 倍。

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27145 2026-07-30 cs.CV 新提交 75%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交 75%

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交 75%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);SFT(abstract)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23153 2026-07-28 cs.LG cs.AI cs.CL 新提交 75%

In-Context Learning as Implicit Policy Gradient

上下文学习即隐式策略梯度

Masahiro Kaneko, Timothy Baldwin

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型上下文学习现象,证明分数条件上下文学习与策略梯度优化有结构对应,通过自注意力机制等进行分析推导,经多模型实验验证,表明大语言模型能利用分数信息优化输出分布,注意力权重与示例分数相关。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23828 2026-07-28 math.CO 新提交 75%

Powers of the Vandermonde determinant are eventually non-SNP

范德蒙德行列式的幂最终是非 SNP 的

Thien Le, Melanie Weber

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 证明范德蒙德行列式每个固定正幂在足够多变量中是非 SNP 的猜想,对偶数幂$k\geq4$,通过戴森常数项恒等式等展示牛顿多胞体中系数为零的格点,奇数情况由交错性得出,二次情况已知,关键构造和策略源于语言模型提示。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19703 2026-07-23 cs.SE 新提交 75%

Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development

架起行为与实现的桥梁:用于行为驱动开发的自动化Java胶水代码生成

Xinyu Shi, Zhou Yang, An Ran Chen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对行为驱动开发中胶水代码开发维护难题,提出分层多智能体框架AutoGlue,遵循行为优先工作流程。经实验评估,相比少样本提示,其在代码生成指标上有显著提升,能有效连接行为规范与项目代码,支持软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18362 2026-07-22 cs.RO 新提交 75%

FARO: Feasibility-Aware Robot Motion Optimization

FARO:可行性感知机器人运动优化

Michal Ciebielski, Shafeef Omar, Aaron Johnson, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Advanced Study, Technical University of Munich(慕尼黑工业大学高级研究所) Carnegie Mellon University(卡内基梅隆大学) SIEMENS AG(西门子公司) Huawei-TUM joint laboratory(华为-慕尼黑工业大学联合实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对机器人在未知场景快速规划新行为的挑战,提出嵌套运动动力学框架,结合可行性引导树搜索和大语言模型采样策略,能改善搜索过程,生成的轨迹可用强化学习控制器跟踪,质量高可用于实际运动操作场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16492 2026-07-21 cs.CV 新提交 75%

WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

WeedExpert-R1:通过强化学习激励多模态大语言模型进行精准杂草定位的植物推理

Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence, Xin Qiao, Benjamin Riggan, Chi-En Chiang, Fuchen Li

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校) Panhandle Research and Extension Center(狭长地带研究与推广中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对精准杂草控制问题,提出通过可验证奖励学习视觉基础植物推理的WeedExpert-R1模型,利用特定合成管道生成数据微调,经群体相对策略优化训练。该模型在多种杂草测试中表现优异,优于同类模型,展现开放词汇能力和跨区域部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16165 2026-07-20 cs.CV cs.AI cs.CL cs.LG 新提交 75%

An Exam for Active Observers

主动观察者的测试

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多模态大语言模型是否具备主动观察能力,引入ActiveVision基准测试,发现前沿模型表现不佳,即便能编写视觉代码差距仍存,表明当前模型缺乏主动视觉观察,呼吁构建闭合感知 - 推理循环的架构和训练目标。

Comments 17 pages, 8 figures, 4 tables. Project page: https://activevision.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13439 2026-07-16 cs.CR cs.SE 新提交 75%

DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection

DREA:用于仓库级漏洞检测的解耦推理与探索代理

Mingyang Sun, Guozhu Meng

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型用于仓库级漏洞检测时的不足,提出DREA框架,通过规划与探索代理解耦,实现目标导向上下文获取。构建RepoPairBench评估,提升配对正确性,降低成本,还发现安全推理质量是当前大语言模型的瓶颈。

Comments Accepted for presentation at Internetware 2026. 12 pages, 4 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13081 2026-07-16 cs.CR cs.AI cs.CL cs.LG 新提交 75%

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

SingGuard-NSFA:通过生成式推理和实时分类实现的可扩展智能体人工智能护栏

SingGuard Team

机构 * Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对智能体人工智能系统操作威胁,提出NSFA分类法构建基准套件,开发双模式方法,发布四个不同参数模型,在基准测试和跨源评估中表现出色,证明方法可扩展性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11611 2026-07-14 cs.PL 新提交 75%

Mizzle: A Complete Concurrent Incorrectness Logic for Preventing False Alarms in Agentic Bug Finding

Mizzle:一种用于在智能体错误查找中防止误报的完整并发错误逻辑

Alexandre Moine, Sam Westrick, Joseph Tassarotti

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型在程序错误查找中产生大量误报的问题,提出Mizzle方法,它是一种用于并发程序的错误分离逻辑,在Rocq证明助手实现机械化,能防止误报且完整,还通过三种错误概念实例化并展示其可用于证明错误存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11106 2026-07-14 cs.CV 新提交 75%

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10315 2026-07-14 cs.CR 新提交 75%

Understanding Implicit Trust Errors in Core Carrier Networks through Multi-Agent Flaw Discovery and Analysis

通过多智能体缺陷发现与分析理解核心承载网络中的隐式信任错误

Ziyu Lin, Ziting Wang, Xinfeng Li, Wei Dong, XiaoFeng Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究蜂窝核心网络向云原生部署过渡时出现的隐式信任错误问题,设计iFinder多智能体系统,通过总结已知缺陷形成检测模式来发现新漏洞,运行该系统发现多个未知漏洞,确认了会话劫持等问题。

Comments To appear in the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10114 2026-07-14 cs.CL cs.AI cs.LG 新提交 75%

Cost of Reasoning in non-English Languages: A Case Study on Japanese

非英语语言的推理成本:以日语为例

Yuu Jinnai

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练日语推理模型的可行性,开发Qwen - 3 - Swallow - 8B的日语推理变体并用GRPO训练,在多基准测试中发现推理语言控制可行,但性能与英语推理基线相当,在日本文化基准上表现不如基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08798 2026-07-13 cs.GR cs.CV 新提交 75%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06278 2026-07-08 cs.NI 新提交 75%

Quality-Aware Personalized AI Service Provisioning in UAV-Assisted 6G Networks

无人机辅助6G网络中质量感知的个性化人工智能服务供应

Mohammad Farhoudi, Masoud Shokrnezhad, Tarik Taleb

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究无人机辅助6G网络中质量感知的个性化AI服务供应问题,提出HyPE框架,集成移动感知预测、学习增强决策和启发式服务放置与路由,模拟实验显示其在覆盖范围、延迟、服务个性化等方面优于基线,突出预测学习增强供应的前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05482 2026-07-08 cs.SE cs.RO 新提交 75%

TypeGo: An OS Runtime for Embodied Agents

TypeGo:一种用于具身智能体的操作系统运行时

Guojun Chen, Alex Schott, Lin Zhong

机构 * Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对具身智能体大语言模型规划与实时控制等的矛盾,提出TypeGo运行时,将基于大语言模型的规划构建为异步循环,管理智能体物理身体,通过自然语言指令编程,能降低延迟并支持并发任务,提供了初步设计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04645 2026-07-07 cs.CL cs.AI cs.CR cs.LG 新提交 75%

Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations

追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示

Samira Hajizadeh

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03166 2026-07-07 cs.CL cs.AI cs.LG 新提交 75%

KARMA: Knowledge graph-based Automated Reasoning Materialization and Alignment

KARMA:基于知识图谱的自动推理实例化与对齐

Jinkyeong Choi, Chaebin Jeong, Donghyeon Park

机构 * Sejong University(世宗大学)

专题命中 推理与问题求解 :LLM(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对基于模板对比合成的问题,提出KARMA方法,通过枚举知识图谱路径生成对比候选,用解耦槽级目标进行偏好监督,在多领域基准测试中表现优于基线。

Comments First version, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏