arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2604.22577 2026-04-27 cs.AI cs.CL 62%

QuantClaw: Precision Where It Matters for OpenClaw

QuantClaw:在OpenClaw中至关重要的精度

Manyi Zhang, Ji-Fu Li, Zhongao Sun, Xiaohao Liu, Zhenhua Dong, Xianzhi Yu, Haoli Bai, Xiaobo Xia

机构 * Huawei Technologies(华为技术有限公司) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 QuantClaw通过动态分配精度优化任务性能,降低计算成本和延迟,提升多轮推理效率。

Comments Blog: https://sparkengineai.github.io/QuantClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 62%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01965 2026-04-23 cs.IR cs.AI cs.CL cs.DL 62%

Do We Need Bigger Models for Science? Task-Aware Retrieval with Small Language Models

我们是否需要更大的模型用于科学?基于任务的检索与小型语言模型

Florian Kelber, Matthias Jobst, Yuni Susanti, Michael Färber

机构 * TU Dresden, Germany(德累斯顿理工大学,德国) FIZ Karlsruhe, Germany(卡尔斯鲁厄研究所,德国) ScaDS.AI, TU Dresden, Germany(ScaDS.AI,德累斯顿理工大学,德国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨小型语言模型在科学应用中的可行性,通过设计轻量级检索增强框架,结合全文科学论文和结构化元数据,展示检索与模型规模的互补性。

Comments Accepted at NSLP@LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00414 2026-04-23 cs.AI cs.CL 62%

Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training

认知内核-Pro:深度研究代理及代理基础模型训练的框架

Tianqing Fang, Zhisong Zhang, Xiaoyang Wang, Rui Wang, Can Qin, Yuxuan Wan, Jun-Yu Ma, Ce Zhang, Jiaqi Chen, Xiyun Li, Yonglin Wang, Jingchen Ni, Tianshi Zheng, Chun Chen, Wenhao Yu, Zhenwen Liang, Hongming Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Cognitive Kernel-Pro框架,旨在通过开放源代码和免费资源促进高级AI代理的开发与评估,重点研究高质量训练数据的构建及代理测试时的反思与投票策略,实现了在GAIA上的领先性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18177 2026-04-22 cs.CL cs.AI 62%

STaD: Scaffolded Task Design for Identifying Compositional Skill Gaps in LLMs

STaD:基于支架任务设计的LLM组合技能缺口识别

Sungeun An, Swanand Ravindra Kadhe, Shailja Thakur, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 STaD框架通过生成受控变体任务,系统探测LLM在组合技能上的不足,揭示不同模型的独特技能缺口。

Comments 9 pages, 3 figures, 3 tables, ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08608 2026-04-22 cs.CR cs.AI cs.LG 62%

Semantic Intent Fragmentation: A Single-Shot Compositional Attack on Multi-Agent AI Pipelines

语义意图碎片化:一种针对多智能体AI流水线的单次组合攻击

Tanzim Ahad, Ismail Hossain, Md Jahangir Alam, Sai Puppala, Yoonpyo Lee, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯理工大学计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡本代尔分校计算机学院) Hanyang University(翰阳大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出语义意图碎片化攻击,通过单个合法请求导致任务分解为看似无害但联合违反安全策略的子任务,利用OWASP LLM06:2025框架实现无注入内容、无系统修改的攻击,验证了组合安全漏洞的可修复性。

Comments This paper got accepted for AAAI 2026 Summer Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14550 2026-04-21 cs.AR cs.AI cs.LG cs.MA cs.PL 62%

VeriGraphi: A Multi-Agent Framework of Hierarchical RTL Generation for Large Hardware Designs

VeriGraphi:一种用于大规模硬件设计的分层RTL生成多智能体框架

Sazzadul Islam, Tasnim Tabassum, Hao Zheng

机构 * Dept. of Computer Science \& Eng. University of South Florida Tampa, Florida, United States

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VeriGraphi通过构建基于规范的图谱,解决LLM在生成分层RTL时的结构失真问题,实现可靠生成并保持功能正确性。

Comments 9 pages, 2 figures, Case studies, v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10779 2026-04-21 cs.CL cs.AI 62%

Improving Speech Recognition of Named Entities in Classroom Speech with LLM Revision and Phonetic-Semantic Context

通过LLM修订和音义上下文提高课堂语音中命名实体的语音识别

Viet Anh Trinh, Xinlu He, Jacob Whitehill

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM修订和音义上下文提升课堂语音中命名实体的识别准确率,通过MIT课程数据集验证,实现30%的WER降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15306 2026-04-17 cs.AI cs.LG 62%

Generalization in LLM Problem Solving: The Case of the Shortest Path

大模型问题解决中的泛化能力:最短路径问题的案例

Yao Tong, Jiayuan Ye, Anastasia Borovykh, Reza Shokri

机构 * National University of Singapore(新加坡国立大学) Capital Fund Management(资本基金管理公司) Google Research(谷歌研究)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了大模型在最短路径问题中的泛化能力,发现模型在空间迁移表现良好,但在长度扩展上因递归不稳定性而失败,分析了不同学习阶段对系统性问题解决的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14856 2026-04-17 cs.CL cs.AI 62%

ClimateCause: Complex and Implicit Causal Structures in Climate Reports

气候原因:气候报告中的复杂和隐含因果结构

Liesbeth Allein, Nataly Pineda-Castañeda, Andrea Rocci, Marie-Francine Moens

机构 * Department of Computer Science, KU Leuven, Belgium(比利时库勒芬大学计算机科学系) Department of Electronics and Information Systems, Ghent University, Belgium(比利时根特大学电子与信息系统系) Institute of Argumentation, Linguistics, and Semiotics (IALS), Università della Svizzera italiana, Switzerland(瑞士意大利大学论证、语言学与象征学研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClimateCause数据集,通过专家标注揭示气候报告中的高阶因果结构,包括隐含和嵌套因果关系,用于提升因果推理和可读性量化。

Comments Accepted to ACL 2026 [Findings]

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13634 2026-04-16 cs.CL cs.LG 62%

Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference

校准的推测解码:基于频率的候选选择以实现高效的推理

Xuwen Zhou, Fangxin Liu, Chao Wang, Xiao Zheng, Hao Zheng, Min He, Li Jiang, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Cloud Computing(阿里云 computing)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出校准的推测解码,通过频率引导的候选选择和概率保护的接受机制,提升大语言模型推理效率,实测效果优于现有方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13318 2026-04-16 cs.AI cs.CL 62%

WebXSkill: Skill Learning for Autonomous Web Agents

WebXSkill:自主网页代理的技能学习

Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI

AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18847 2026-04-16 cs.CV cs.AI cs.CL 62%

Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions

失败让智能体更强:通过结构化反思提升准确性以实现可靠的工具交互

Junhao Su, Yuanliang Wan, Junwei Yang, Hengyu Shi, Tianyang Han, Junfeng Luo, Yurui Qiu

机构 * Vision Agent Team, Meituan(美团视觉代理团队) MeiGen AI Team, Meituan(美团MeiGen AI团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结构化反思方法,通过显式反思和优化提升工具交互的可靠性,实验表明在多轮工具调用中显著提高成功率并减少冗余调用。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08791 2026-04-16 cs.CL cs.AI 62%

Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments

通过自动化构建环境提升大语言模型的反馈驱动工具使用

Junjie Ye, Changhao Jiang, Zhengyin Du, Yufei Xu, Xuesong Yao, Zhiheng Xi, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自动化环境构建流程和可验证奖励机制,提升大语言模型的工具使用能力,实验表明在不降低通用能力的情况下显著增强工具使用性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00919 2026-04-15 cs.CL cs.AI 62%

Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving

基于检索增强生成在奥林匹克级物理问题求解中的基础模型评估

Shunfeng Zheng, Yudi Zhang, Meng Fang, Zihan Zhang, Zhitan Wu, Mykola Pechenizkiy, Ling Chen

机构 * AAII, University of Technology Sydney, New South Wales, Australia(AAII,悉尼大学,新南威尔士州,澳大利亚) Eindhoven University of Technology, Eindhoven, The Netherlands(埃因霍温理工大学,埃因霍温,荷兰) University of Liverpool, Liverpool, United Kingdom(利物浦大学,利物浦,英国) University of New South Wales, New South Wales, Australia(新南威尔士大学,新南威尔士州,澳大利亚)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过PhoPile多模态数据集评估检索增强生成在奥林匹克级物理问题求解中的表现,探讨了基础模型结合检索与物理语料对性能提升的影响及存在的挑战。

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-04-14 cs.CL cs.AI 62%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10874 2026-04-14 cs.CL cs.AI 62%

AOP-Smart: A RAG-Enhanced Large Language Model Framework for Adverse Outcome Pathway Analysis

AOP-Smart:一种增强检索的大型语言模型框架用于不良后果路径分析

Qinjiang Niu, Lu Yan

机构 * Nanyang Normal University(南阳师范学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AOP-Smart框架,通过检索增强生成技术提升大型语言模型在不良后果路径分析中的可靠性与准确性,实验表明其显著缓解了模型幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23516 2026-04-14 cs.CL cs.AI cs.IR 62%

MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens

MSA:内存稀疏注意力用于高效端到端内存模型扩展至100M标记

Yu Chen, Runkai Chen, Sheng Yi, Xinda Zhao, Xiaohong Li, Jianjin Zhang, Jun Sun, Chuanrui Hu, Yunyun Han, Lidong Bing, Yafeng Deng, Tianqiao Chen

机构 * Evermind Shanda Group(盛大集团) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSA,一种高效的端到端可训练内存模型框架,通过可扩展稀疏注意力和文档级RoPE实现线性复杂度,支持从16K到100M标记的扩展,同时保持稳定性,且在100M标记推理中实现2xA800 GPU的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10031 2026-04-14 cs.CL cs.AI 62%

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

CoSToM: 为大语言模型内在理论思维对齐的因果导向引导

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * National Engineering Research Center for Big Data Technology and System, Services Computing Technology and System Lab, Cluster and Grid Computing Lab, Huazhong University of Science and Technology(华中科技大学国家大数据技术与系统工程技术研究中心、服务计算技术与系统实验室、集群与网格计算实验室) Singapore Management University(新加坡管理大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSToM框架,通过因果追踪和激活引导提升大语言模型的社会推理能力与对话质量。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09676 2026-04-14 cs.LG cs.AI 62%

A Comparative Theoretical Analysis of Entropy Control Methods in Reinforcement Learning

强化学习中熵控制方法的比较理论分析

Ming Lei, Christophe Baehr

机构 * Shanghai Jiao Tong University(上海交通大学) Météo France/CNRS, Université de Toulouse, CNRM UMR 3589(法国气象局/法国国家科学研究中心,图卢兹大学,国家气象研究中心 UMR 3589)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了传统熵正则化与基于协方差的熵控制方法,揭示了熵变化由log-probabilities与logit更新的协方差决定,传统方法引入持续偏差导致次优策略,而基于协方差方法通过稀疏正则化实现无偏性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20821 2026-04-13 cs.CL cs.AI cs.CE 62%

MultiFinRAG: An Optimized Multimodal Retrieval-Augmented Generation (RAG) Framework for Financial Question Answering

MultiFinRAG:一种优化的多模态检索增强生成(RAG)框架,用于金融问答

Chinmay Gondhalekar, Urjitkumar Patel, Fang-Chun Yeh

机构 * S&P Global Ratings(标普全球评级)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MultiFinRAG通过多模态提取和分层回退策略,提升金融问答任务中跨模态推理的准确性,比ChatGPT-4o在复杂任务上高19个百分点。

Comments Preprint Copy

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08260 2026-04-10 cs.CL cs.AI 62%

Behavior-Aware Item Modeling via Dynamic Procedural Solution Representations for Knowledge Tracing

基于动态程序性解决方案表示的行为感知项目建模

Jun Seo, Sangwon Ryu, Heejin Do, Hyounghun Kim, Gary Geunbae Lee

机构 * GSAI, POSTECH(浦项科技大学人工智能研究生院) CSE, POSTECH(浦项科技大学计算机科学与工程系) ETH Zurich, ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BAIM框架,通过整合动态程序性解决方案信息增强项目表示,利用推理语言模型分解问题解决阶段,提升知识追踪的预测性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06699 2026-04-09 cs.CL cs.LG 62%

Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs

自适应提示结构分解:一种自我发现和优化组合提示程序的框架

Haoyue Liu, Zhichao Wang, Yongxin Guo, Haoran Shou, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Taobao and Tmall Group(淘宝天猫集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出aPSF框架,通过语义因素发现和单因素更新优化提示程序,提升大语言模型的推理可靠性,实验显示在多个基准上准确率提升2.16个百分点,优化成本降低45-87%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06650 2026-04-09 cs.CL cs.AI 62%

A Parameter-Efficient Transfer Learning Approach through Multitask Prompt Distillation and Decomposition for Clinical NLP

一种通过多任务提示蒸馏与分解的参数高效迁移学习方法用于临床NLP

Cheng Peng, Mengxian Lyu, Ziyi Chen, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系) Cancer Informatics Shared Resource, University of Florida Health Cancer Center(佛罗里达大学健康癌症中心癌症信息学共享资源)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多任务提示蒸馏与分解框架,通过学习共享元提示在临床NLP任务中实现高效迁移,参数更少且性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05201 2026-04-08 cs.AI cs.CL cs.CV 62%

MedGemma Technical Report

MedGemma 技术报告

Andrew Sellergren, Sahar Kazemzadeh, Tiam Jaroensri, Atilla Kiraly, Madeleine Traverse, Timo Kohlberger, Shawn Xu, Fayaz Jamil, Cían Hughes, Charles Lau, Justin Chen, Fereshteh Mahvar, Liron Yatziv, Tiffany Chen, Bram Sterling, Stefanie Anna Baby, Susanna Maria Baby, Jeremy Lai, Samuel Schmidgall, Lu Yang, Kejia Chen, Per Bjornsson, Shashir Reddy, Ryan Brush, Kenneth Philbrick, Mercy Asiedu, Ines Mezerreg, Howard Hu, Howard Yang, Richa Tiwari, Sunny Jansen, Preeti Singh, Yun Liu, Shekoofeh Azizi, Aishwarya Kamath, Johan Ferret, Shreya Pathak, Nino Vieillard, Ramona Merhej, Sarah Perrin, Tatiana Matejovicova, Alexandre Ramé, Morgane Riviere, Louis Rouillard, Thomas Mesnard, Geoffrey Cideron, Jean-bastien Grill, Sabela Ramos, Edouard Yvinec, Michelle Casbon, Elena Buchatskaya, Jean-Baptiste Alayrac, Dmitry Lepikhin, Vlad Feinberg, Sebastian Borgeaud, Alek Andreev, Cassidy Hardin, Robert Dadashi, Léonard Hussenot, Armand Joulin, Olivier Bachem, Yossi Matias, Katherine Chou, Avinatan Hassidim, Kavi Goel, Clement Farabet, Joelle Barral, Tris Warkentin, Jonathon Shlens, David Fleet, Victor Cotruta, Omar Sanseviero, Gus Martins, Phoebe Kirk, Anand Rao, Shravya Shetty, David F. Steiner, Can Kirmizibayrak, Rory Pilgrim, Daniel Golden, Lin Yang

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedGemma 是基于 Gemma 3 的医学视觉-语言基础模型,具备强大的医学理解和推理能力,在医疗多模态问答、胸部X光分类等任务中表现优异,同时保持通用能力,为医疗AI发展提供基础。

Comments Fix references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03912 2026-04-07 cs.CR cs.AI cs.DC cs.LG 62%

Automating Cloud Security and Forensics Through a Secure-by-Design Generative AI Framework

通过安全设计的生成AI框架实现云安全与取证自动化

Dalal Alharthi, Ivan Roberto Kawaminami Garcia

机构 * University of Arizona(亚利桑那大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个安全设计的生成AI框架,结合PromptShield和CIAF,提升云环境中的安全性和取证准确性,通过实验证明在攻击条件下分类性能和勒索软件检测精度显著提升。

Comments arXiv admin note: substantial text overlap with arXiv:2510.00452

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14536 2026-04-07 cs.CL cs.AI 62%

Explainable Token-level Noise Filtering for LLM Fine-tuning Datasets

可解释的token级噪声过滤用于LLM微调数据集

Yuchen Yang, Wenze Lin, Enhao Huang, Zhixuan Chu, Hongbin Zhou, Lan Tao, Yiming Li, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出XTF框架,通过分解token级数据对微调过程的贡献,提升LLM微调性能,实验表明在数学、代码和医学任务中性能提升达13.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00077 2026-04-07 cs.CL cs.LG stat.ML 62%

Gaussian mixture models as a proxy for interacting language models

高斯混合模型作为交互语言模型的代理

Edward L. Wang, Mohammad Sharifi Kiasari, Tianyu Wang, Hayden Helm, Avanti Athreya, Carey Priebe, Vince Lyzinski

机构 * Helivan Research

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出交互高斯混合模型作为交互语言模型的代理,通过构建具有类RAG更新机制的模型,展示其在低计算成本下模拟交互语言模型的反馈过程,并提供理论分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02617 2026-04-06 cs.AI cs.CR cs.IR cs.LG cs.SI 62%

AutoVerifier: An Agentic Automated Verification Framework Using Large Language Models

AutoVerifier:基于大语言模型的代理自动化验证框架

Yuntao Du, Minh Dinh, Kaiyuan Zhang, Ninghui Li

机构 * Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoVerifier框架,利用大语言模型自动化验证技术性声明,通过构建知识图谱实现六层递进验证,展示其在量子计算领域的应用效果。

Comments Winner of 2025-2026 Radiance Technologies Innovation Bowl

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27176 2026-04-06 cs.AI cs.CL cs.DC 62%

Glia: A Human-Inspired AI for Automated Systems Design and Optimization

Glia:一种受人类启发的AI,用于自动化系统设计与优化

Pouya Hamadanian, Pantea Karimi, Arash Nasr-Esfahany, Kimia Noorbakhsh, Joseph Chandler, Ali ParandehGheibi, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Glia通过人类启发的多智能体工作流利用大语言模型,生成可解释的系统设计,展示了AI在复杂系统问题中创造性和可理解性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏