arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1658 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2607.27923 2026-07-31 cs.SE 新提交 86%

The Case for Vibe Modeling: A Missing Step in AI-Based Trustworthy Software Development

氛围建模的必要性:基于AI的可信软件开发中缺失的一环

Shalini Chakraborty, Michael Mittermaier, Judith Michael

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出在AI辅助软件开发中引入氛围建模作为轻量中间抽象,通过学生调查验证其在提升LLM输出理解、降低验证工作量及增强信任方面的潜力,为可信AI软件工程研究提供方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18869 2026-07-22 cs.CR 新提交 86%

Tracing the Shadows: Automatic Tracking and Analysis of Crypto Money Laundering via Transaction Semantic Analysis

追踪阴影:通过交易语义分析对加密货币洗钱进行自动跟踪与分析

Hao Wu, Haijun Wang, Shangwang Li, Yin Wu, Ming Fan, Ting Liu, Xiapu Luo

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对加密货币洗钱问题,提出AMLGuard语义感知框架,结合静态规则分析与LLM推理,对复杂DeFi交易语义分析,实现非法资金流追踪,在真实案例评估中取得高精度召回率,有效应对加密货币洗钱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09979 2026-07-14 cs.SE 新提交 86%

Using LLMs to Adjudicate Static-Analysis Alerts with Error Reduction Techniques

使用具有错误减少技术的大语言模型来判定静态分析警报

William Klieber, David Svoboda, Lori Flynn, Ruben Martins

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究用大语言模型判定静态分析警报,采用一致性检查和LLM推理评估两种方法,在三个测试套件上评估多个LLMs,中级推理LLMs经错误缓解后召回率和特异性高,还探讨了相关问题及合成程序作为证据的结果。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06990 2026-07-09 cs.RO 新提交 86%

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

用于鲁棒多机器人操作的闭环多智能体框架

Yi-Xiang He, Lan Wei, Haoming Cen, Jian-Jian Jiang, Zhuohao Li, Guanxing Lu, Yihan Yang, Dandan Zhang, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Imperial College London(帝国理工学院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对多机器人操作中高级推理应用于实际执行的挑战,提出基于分层闭环智能体的LLM框架,含规划、操作、验证智能体。经实际实验验证,该框架成功率高、适应性强,为多样操作任务提供可推广方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31483 2026-07-02 cs.RO 新提交 86%

A Large-Language-Model Supported Personalized Driving Framework for Lane Change in Highway Scenarios

大语言模型支持的高速公路换道场景个性化驾驶框架

Dong Bi, Yongqi Zhao, Paul Kovacevic, Tomislav Mihalj, Ji Zhou, Jiayuan Gong, Arno Eichberger

机构 * Hubei University of Automotive Technology(湖北汽车工业学院) Graz University of Technology(格拉茨技术大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种LLM支持的个性化驾驶框架,通过映射自然语言指令到Apollo规划参数,结合聚类和风格强度排序生成可区分的换道行为,并利用检索增强生成解释隐式指令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25484 2026-06-25 cs.CY econ.GN q-fin.EC stat.AP 新提交 86%

From Causal Discovery to Implementation: An Agentic AI Framework for E-Scooter Mobility Hub Planning Across 29 German Cities

从因果发现到实施:面向29个德国城市的电动滑板车出行枢纽规划的智能体AI框架

Meng Jin, Melanie Handrich, Simone Martinenz, Nicholas Hoeser, Ziyue Li

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一个三阶段智能体AI框架,利用29个德国城市的公共GBFS数据构建因果模板库,通过LLM驱动的因果发现揭示城市类型与集群类型对热点需求的因果驱动差异,并在海尔布隆指导两个枢纽站点建设。

Comments 32 Pages, Submitted to Transportation Research Part D: Transport and Environment. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25404 2026-06-25 cs.RO 新提交 86%

HEART: Coordination of Heterogeneous Expert Agents for Physically Grounded Robotic Task Planning

HEART: 异构专家智能体协调实现物理接地机器人任务规划

Junho Lee, Seabin Lee, Wonjong Lee, Nayoung Kim, Moonjeong Kang, Changjoo Nam

机构 * Sogang University(西江大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出异构多LLM框架HEART,将指令分解为原子推理任务分配给角色专家,通过约束驱动规划合成,提升机器人任务规划的物理可行性和效率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23157 2026-06-23 cs.RO 新提交 86%

Bridging Semantics and Kinematics: A Modular Framework for Zero-Shot Robotic Manipulation

桥接语义与运动学:零样本机器人操作的模块化框架

Ali Alabbas, Dipshikha Das, Camillo Murgia, Sainul Ansary, Alaa Elkamash, Philip Long

机构 * Atlantic Technological University(大西洋理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出一种模块化免训练框架,通过视觉感知、语义路由和任务编排三阶段,实现零样本语言引导的机器人操作,在两种零样本实验中达到62%端到端成功率。

Comments Accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22312 2026-06-23 cs.NI cs.ET cs.IR cs.LO cs.MA 新提交 86%

SHACR: A Graph-Augmented Semi-Autonomous Framework for Multi-Class Conflict Resolution in Smart Home IoT Automation

SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架

Leena Marghalani, Walid Aljoby, Suayb S. Arslan

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16703 2026-06-16 cs.IR 新提交 86%

Harmonizing Semantic and Collaborative in LLMs: Reasoning-based Embedding Generator for Sequential Recommendation

在LLMs中协调语义与协同:基于推理的序列推荐嵌入生成器

Qidong Liu, Mingyao Huang, Moranxin Wang, Wenxuan Yang, Haiping Zhu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出ReaEmb框架,通过潜在推理增强对比学习和协同奖励强化学习,利用LLM推理能力并显式注入协同信号,解决序列推荐中的长尾问题。

Comments 11pages,5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14613 2026-08-18 cs.AI 新提交 85%

Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Agent Interaction over A2A/MCP

大语言模型智能体是否进行理性协商?面向A2A/MCP的可验证多智能体交互机制设计框架

Wael Albayaydh, Rui Zhao

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对A2A/MCP协议提出可验证多智能体交互机制设计框架,实验发现机制激励兼容性无法自动迁移至大语言模型智能体行为,相关成果连接经典多智能体理论与现代LLM智能体基础设施。

Comments 20 pages , 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14610 2026-08-18 cs.AI 新提交 85%

When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning

大型语言模型何时适用错误法律?诊断大型语言模型在时间法律推理中的失败

Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang Cao

机构 * Institute of Science Tokyo(东京科学大学) Osaka University(大阪大学) NII LLMC(日本信息学研究所语言、语言学与媒体中心) Nara Institute of Science and Technology(奈良科学技术研究所) Center of Juris-Informatics, ROIS-DS(日本学术研究推进机构跨学科科学研究中心法学信息学中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文构建基准评估LLMs的时间适用法律判定能力,发现LLMs存在适用最新法律的偏差,该偏差源于强化学习塑造的显式推理导致推理路径多样性减少,通用推理能力更强的模型在时间法律推理中表现更差,为相关优化提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02149 2026-08-04 cs.AI 新提交 85%

Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning

超越均值:面向大语言模型推理的多时刻策略优化

Yijun Zhang, Yule Xie, Jiaxin Ding, Xin Ding, Fan Xu, Haoxiang Zhang, Luoyi Fu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 85%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 推理与问题求解 :language agent(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 85%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22621 2026-07-28 cs.AI 新提交 85%

Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning

Opti-Q:一种用于多语言模型问题规划的基于约束的优化框架

Aamir Hamid, Bharg Barot, Satvik Racharla, Tim Finin, Primal Pappachan, Roberto Yus

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Portland State University(波特兰州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多语言模型预算部署难题,提出OPTI-Q框架。该框架将模型调用建模为执行DAG操作符,利用PERFDB估计质量和成本,经帕累托前沿搜索选计划,在指定预算下于MMLU-Pro和SimpleQA上提升QoA,实现更好的质量-资源权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20500 2026-07-24 cs.AI 新提交 85%

FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts

FlowEdit:针对涉及冲突的不适定问题的大语言模型推理流的信息论控制

Sizhe Tang, Guangyu Jiang, Yu Li, Rongqian Chen, Ioannis G. Kevrekidis, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对开放世界中因条件冲突等导致的不适定问题,提出FlowEdit框架利用信息论原理控制大语言模型推理流,能生成多样替代响应,实验证明其优于专有模型,提升了准确率和响应信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16269 2026-07-21 eess.SP cs.AI 新提交 85%

From Intent to Infrastructure: LLM-Driven Agent Compilers for ISAC Networks

从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器

Lijie Zheng, Xudong Zhong, Baoquan Ren, Xiangwu Gong, Xinghui Zhu, Ji He

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17641 2026-07-21 cs.AI cs.SE 新提交 85%

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法

Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。

Comments 18 pages, 10 figures, 10 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15778 2026-07-20 cs.CV cs.AI 新提交 85%

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

用于多事件长视频理解的模块化动态粒度视频语言模型

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14187 2026-07-17 cs.AI cs.RO 新提交 85%

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型

Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14103 2026-07-17 cs.CL cs.MA 新提交 85%

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性

Markus Wenzel

机构 * Constructor University(康斯坦丁大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09452 2026-07-13 cs.SE cs.AI 新提交 85%

Practical Source Code Recovery from Binary Functions Using Anchor-Based Retrieval and LLM Reasoning

使用基于锚点的检索和大语言模型推理从二进制函数中进行实用的源代码恢复

Charles Edward Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * McGill University(麦吉尔大学) Defence Research and Development Canada(国防研究与发展加拿大)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何从二进制函数恢复源代码,结合逆向工程、基于锚点检索和大语言模型推理,在基于高保真数据库对tcpdump二进制文件评估中,匹配方法实现95.2%汇编指令覆盖率,在GitHub数据库实验中平均覆盖率35.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09195 2026-07-13 cs.AI cond-mat.mtrl-sci 新提交 85%

Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

迈向可审计的人工智能科学家:大语言模型智能体的假设演化协议

Izumi Takahara, Teruyasu Mizoguchi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学产业科学研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在让大语言模型智能体在科学发现中发挥核心作用。提出假设演化协议(HEP),使假设生成等操作可审计。在材料科学任务中,该协议能让智能体运行关键循环,跨问题概括并随模型能力提升更充分利用协议,迈向可审计的人工智能科学家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00049 2026-07-02 cs.SE cs.AI 新提交 85%

Prompting GPT-5 on Scrum Certification Questions: An Empirical Accuracy Study

在Scrum认证问题上提示GPT-5:一项实证准确性研究

Mirko Perkusich, Danyllo Albuquerque, João Paiva, Robson Vilar, Emanuel Dantas, Ademar França de Sousa Neto, Rohit Gheyi, Kyller Gorgônio, Angelo Perkusich

专题命中 推理与问题求解 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过三种提示技术(零样本、思维链、带源引用)测试GPT-5在993个PSM认证问题上的准确性,发现所有提示均达到85%以上准确率,其中带源引用最佳(89.1%),并分析了错误类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00447 2026-07-02 cs.CL 新提交 85%

Understanding Why Language Models Hallucinate: Testing Reasoning Against Priors

理解语言模型为何产生幻觉:针对先验知识的推理测试

Yangfan Hu, Xuhan Tong, Haoyue Bai, Xi Ding, Shashank Muralidhar Bharadwaj, Siyang Cao, Robert Nowak, Jiawei Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出推理错位假说,认为幻觉源于模型偏向统计显著的潜在关联而非遵循提示约束,并通过TrapQA测试集验证了两种偏差模式。

Comments Project page: https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26041 2026-06-25 cs.CV cs.CL 新提交 85%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08649 2026-06-09 cs.CR cs.AI 新提交 85%

Sample-Efficient LLM-Based Detection of Malicious Web Server Logs with Forensically Explainable Reasoning

基于大语言模型的恶意Web服务器日志检测与取证可解释推理的样本高效方法

Bernhard Kneip, Nhien-An Le-Khac, Hong-Hanh Nguyen-Le

机构 * University of Tuebingen(图宾根大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出CEF-Log策略,通过五步推理模板使大语言模型学习日志分析方法,在CSIC 2010数据集上仅用4个示例达到F1=0.99,样本效率提升10倍,并引入新数据集ForenWebLog。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08300 2026-06-09 cs.LG 新提交 85%

QueryWeaver: Reliable Multi-Tool Query Execution Planning via LLM-Based Graph Generation

QueryWeaver: 基于LLM图生成的可靠多工具查询执行规划

Aishwarya Chakravarthy, Vidhi Kulkarni, Duen Horng Chau

机构 * School of Computational Science and Engineering, Georgia Institute of Technology, Atlanta, GA, USA(计算科学与工程学院,佐治亚理工学院,亚特兰大,GA,美国)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 提出将自然语言查询转换为结构化图并通过确定性规划器执行的系统,利用深度优先搜索解决跨工具依赖,实现高可靠性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07441 2026-06-08 cs.CL 新提交 85%

Sycophantic Praise: Evaluating Excessive Praise in Language Models

谄媚式赞美:评估语言模型中的过度赞美

Daniel Vennemeyer, Phan Anh Duong, Meryl Ye, Ruihong Huang, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学) Texas A&M University(德克萨斯大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出参数化框架衡量赞美是否过度,发现谄媚式赞美在社交和解释性领域远多于客观推理领域,且现有方法无法可靠测量。

详情

展开后加载摘要…

URL PDF HTML 收藏