arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2512.23304 2026-04-20 cs.CV cs.AI 57%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15233 2026-04-17 cs.AI cs.DB 57%

Blue Data Intelligence Layer: Streaming Data and Agents for Multi-source Multi-modal Data-Centric Applications

蓝色数据智能层:面向多源多模态数据导向应用的流数据与智能体

Moin Aminnaseri, Farima Fatahi Bayat, Nikita Bhutani, Jean-Flavien Bussotti, Kevin Chan, Rafael Li Chen, Yanlin Feng, Jackson Hassell, Estevam Hruschka, Eser Kandogan, Hannah Kim, James Levine, Seiji Maekawa, Jalal Mahmud, Kushan Mitra, Naoki Otani, Pouya Pezeshkpour, Nima Shahbazi, Chen Shen, Dan Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Blue数据智能层,通过整合异构数据源、多模态信息及上下文数据,解决多源多模态数据导向应用中的复杂查询需求,结合智能体与数据处理实现自然语言到SQL的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14779 2026-04-17 cs.CV cs.CL 57%

AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

AIM:面向视觉问答持续学习的非对称信息掩码

Peifeng Zhang, Zice Qiu, Donghua Yu, Shilei Cao, Juepeng Zheng, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对视觉问答持续学习中因模型结构不对称导致的灾难性遗忘问题,提出AIM方法,通过模态特定敏感性指导的针对性掩码平衡稳定性与可塑性,提升在VQA v2和GQA任务中的平均性能和平均遗忘度。

Comments 18 pages, 9 figures. Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14477 2026-04-17 cs.AI 57%

Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers

通过电路看见:面向视觉变换器的忠实机制可解释性

Nina Żukowska, Wolfgang Stammer, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过计算图在视觉变换器中识别有用机制电路的可能性,提出自动视觉电路发现方法,发现分类特定电路、CLIP中的文字攻击电路以及可引导纠正有害行为的电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14437 2026-04-17 cs.SE cs.AI 57%

LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB

大语言模型在测试生成中的捷径行为:SAP HANA与LevelDB的实证研究

Vekil Bekmyradov, Noah C. Pütz, Thomas Bartz-Beielstein

机构 * THK-AI Research Cluster(THK人工智能研究集群) TH Köln(TH科伦大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究大语言模型在软件自动化测试生成中的行为,通过对比开源系统LevelDB与商用数据库SAP HANA的测试表现,揭示LLMs在熟悉领域表现优异但面对新复杂领域时依赖编译性而非语义有效性,强调需建立惩罚捷径、奖励泛化的能力评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14419 2026-04-17 cs.AI 57%

Equifinality in Mixture of Experts: Routing Topology Does Not Determine Language Modeling Quality

专家混合中的等效性:路由拓扑不决定语言建模质量

Ivan Ternovtsii, Yurii Bilak

机构 * Department of Software Systems, Uzhhorod National University(软件系统系,乌日霍罗德国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究路由拓扑对语言建模质量的影响,通过62次实验发现不同路由方法在渐近困惑度上无显著差异,且通过简化路由机制提升了效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03307 2026-04-17 cs.CV cs.AI 57%

V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators

V-Reflection:将多模态大语言模型从被动观察者转变为主动提问者

Jiazhou Zhou, Yucheng Chen, Hongyang Li, Qing Jiang, Hu Zhou, Ying-Cong Chen, Lei Zhang

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向) International Digital Economy Academy(国际数字经济学院) MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University, and Centre of AI in Medicine(医学视觉人工智能实验室,南洋理工大学Lee Kong Chian医学院,以及人工智能在医学中的中心) South China University of Technology(华南理工大学) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出V-Reflection框架,通过'思考后再观察'的视觉反思机制,使多模态大语言模型能主动提问视觉特征空间,提升细粒度任务的感知能力。

Comments Main paper 14 pages with supplementary 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17512 2026-04-17 cs.CL 57%

Language on Demand, Knowledge at Core: Composing LLMs with Encoder-Decoder Translation Models for Extensible Multilinguality

按需语言,知识为核心:通过编码器-解码器翻译模型组成LLM以实现可扩展的多语言性

Mengyu Bu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出XBridge架构,利用预训练翻译模型实现多语言理解和生成,同时保留LLM作为英语核心处理通用知识,通过轻量级跨模型映射层和最优传输对齐目标,提升多语言生成性能。

Comments ACL 2026 Main Conference. Code: https://github.com/ictnlp/XBridge | Models: https://huggingface.co/collections/ICTNLP/xbridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10159 2026-04-17 cs.CY cs.AI cs.HC 57%

Enhancing Large Language Model-Based Systems for End-to-End Circuit Analysis Problem Solving

增强基于大语言模型的系统以实现端到端电路分析问题求解

Liangliang Chen, Weiyu Sun, Huiru Xie, Yongnuo Cai, Ying Zhang

机构 * School of Electrical Computer Engineering, Georgia Institute of Technology, Atlanta, GA 30332 USA

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种改进的端到端电路问题求解框架,通过整合YOLO检测器和OpenCV处理提升电路识别精度,并引入ngspice验证循环以减少推理错误,实验结果表明准确率显著提升。

Comments Liangliang Chen and Weiyu Sun contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01016 2026-04-17 cs.CL 57%

Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning

Prompt-R1: 通过端到端强化学习实现的协作自动提示框架

Wenjin Liu, Haoran Luo, Xueyuan Lin, Haoming Liu, Tiesunlong Shen, Jiapu Wang, Rui Mao, Erik Cambria

机构 * Hainan University(海南大学) Nanyang Technological University(南洋理工大学) Hithink Research(慧思研究) HKUST (Guangzhou)(香港科技大学(广州)) IDEA Research(IDEA研究院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Prompt-R1框架,通过小规模LLM与大规模LLM协作,利用强化学习提升复杂问题解决能力,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13417 2026-04-16 cs.SE cs.AI cs.MA 57%

Bridging Protocol and Production: Design Patterns for Deploying AI Agents with Model Context Protocol

Vasundra Srinivasan

机构 * Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程(O’Reilly))

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

Comments 23 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20352 2026-04-16 cs.AI 57%

AMA: Adaptive Memory via Multi-Agent Collaboration

AMA:通过多智能体协作实现自适应记忆

Weiquan Huang, Zixuan Wang, Hehai Lin, Sudong Wang, Bo Xu, Qian Li, Beier Zhu, Linyi Yang, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shandong University(山东大学) Nanyang Technological University(南洋理工大学) Southern University of Science and Technology(南方科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AMA框架,通过多智能体协作实现自适应记忆管理,解决传统方法在记忆粒度和一致性维护上的不足,实验表明其在长上下文任务中表现优异,减少约80%的token消耗。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14133 2026-04-16 cs.AI cs.CR cs.MA 57%

Formalizing the Safety, Security, and Functional Properties of Agentic AI Systems

形式化代理AI系统的安全、安全性和功能性属性

Edoardo Allegrini, Ananth Shreekumar, Z. Berkay Celik

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一个统一的语义框架,用于分析、设计和部署正确、可靠且稳健的代理AI系统,通过形式化验证确保系统行为的安全性和功能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13313 2026-04-16 cs.LG 57%

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

具体丛林:迈向由具体性铺就的对比负样本挖掘以实现组合理解

Eun Woo Im, Dhruv Madhwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ConcretePlant,通过增强具体性术语的修改来提升对比学习信号,解决负样本生成中的梯度失衡问题,提出Cement损失函数以动态校准惩罚,实现更有效的组合理解。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19088 2026-04-16 cs.CL cs.CV 57%

Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions

破解 juxtaposition 的密码:AI 模型能否理解幽默的矛盾

Zhe Hu, Tuo Liang, Jing Li, Yiren Lu, Yunlai Zhou, Yiran Qiao, Jing Ma, Yu Yin

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了AI在理解基于矛盾叙事的幽默中的挑战,通过引入YesBut基准测试,评估大型语言模型在识别和解释漫画中的表现,发现即使是最先进的模型仍无法匹敌人类水平。

Comments NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12717 2026-04-15 cs.AI 57%

Transferable Expertise for Autonomous Agents via Real-World Case-Based Learning

通过现实世界案例学习实现自主代理的可迁移专业技能

Zhenyu Ma, Yuyang Song, Chunyi Yang, Jingyi Zhu, Letian Yang, Xukai Jiang

机构 * National Glycoengineering Research Center, Shandong University(山东大学糖工程研究中心) State Key Laboratory of Microbial Technology, Shandong University(山东省微生物技术重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于案例学习的框架,通过将过往任务经验转化为可重用的知识资产,使自主代理能迁移先前经验以执行更结构化的分析,在六个复杂任务类别基准测试中表现优异,尤其在复杂任务上优势显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12506 2026-04-15 cs.CL cs.SD 57%

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

超越转录:面向感知意识的统一音频架构

Linhao Zhang, Yuhan Song, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

机构 * Basic Model Technology Center, WeChat AI, Tencent Inc.(腾讯基本模型技术中心、微信AI、腾讯公司) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室、计算机学院、北京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出统一音频架构(UAS),通过将音频信息划分为转录、语调和非语言事件三个组件,提升音频细粒度感知性能,同时保持推理能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12461 2026-04-15 cs.AI 57%

CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems

CIA:从基于大语言模型的多智能体系统推断通信拓扑

Yongxuan Wu, Xixun Lin, He Zhang, Nan Sun, Kun Wang, Chuan Zhou, Shirui Pan, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了基于大语言模型的多智能体系统通信拓扑在黑盒环境下被推断的隐私风险,提出CIA攻击方法,通过构建对抗性查询和全局偏差解耦技术,验证了攻击的有效性。

Comments ACL 2026, Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12421 2026-04-15 cs.CL 57%

Agentic Insight Generation in VSM Simulations

代理洞察生成在价值流图模拟中的应用

Micha Selak, Dirk Krechel, Adrian Ulges, Sven Spieckermann, Niklas Stoehr, Andreas Loehr

机构 * RheinMain University of Applied Sciences(莱茵美因应用科学大学) SimPlan AG(SimPlan公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种分步代理架构,通过分离协调与数据分析,利用领域专家知识进行渐进数据发现,提升复杂价值流图模拟中提取可操作洞察的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 57%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27494 2026-04-14 cs.CV cs.AI 57%

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10721 2026-04-14 cs.CV cs.AI 57%

Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization

将生成器转化为检索器:解锁多模态大语言模型用于自然语言引导的地理定位

Yuqi Chen, Xiaohan Zhang, Ahmad Arrabi, Waqas Sultani, Chen Chen, Safwan Wshah

机构 * Vermont Artificial Intelligence Lab, Department of Computer Science, University of Vermont(佛蒙特大学计算机科学系佛蒙特人工智能实验室) Intelligent Machines Lab, Department of Artificial Intelligence, Information Technology University(信息技术大学人工智能系智能机器实验室) Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种简单有效的框架,通过参数高效微调将多模态大语言模型应用于自然语言引导的地理定位,实现强大的跨模态对齐,取得GeoText-1652的SOTA结果,并在CVG-Text的5个子任务中表现优异。

Comments CVPRF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10527 2026-04-14 cs.CV cs.AI 57%

STORM: End-to-End Referring Multi-Object Tracking in Videos

STORM:视频中的端到端提及多目标跟踪

Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

机构 * Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17755 2026-04-14 cs.CL 57%

HyperGraphPro: Progress-Aware Reinforcement Learning for Structure-Guided Hypergraph RAG

HyperGraphPro: 为结构引导的超图RAG设计的进度感知强化学习

Jinyoung Park, Sanghyeok Lee, Omar Zia Khan, Hyunwoo J. Kim, Joo-Kyung Kim

机构 * KAIST(韩国科学技术院) Microsoft(微软) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 HyperGraphPro通过结合语义相关性和图连接性,改进超图检索机制,采用基于进度的逐步策略优化,提升多步推理的准确性和生成质量。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10158 2026-04-14 cs.LG 57%

Tracing the Thought of a Grandmaster-level Chess-Playing Transformer

追溯国际象棋顶级棋手级变压器的思维过程

Rui Lin, Zhenyu Jin, Guancheng Zhou, Xuyang Ge, Wentao Shu, Jiaxing Wu, Junxuan Wang, Zhengfu He, Junping Zhang, Xipeng Qiu

机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机科学技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文通过稀疏分解框架解析Leela Chess Zero的内部计算,揭示其战术考量,并引入三个量化指标证明其并行推理行为,首次在MLP和注意力模块上实现可解释性分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09911 2026-04-14 q-bio.NC cs.AI 57%

The Rise and Fall of $G$ in AGI

$G$在AGI中的兴衰

David C. Krakauer

机构 * Santa Fe Institute(圣塔菲研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过主成分分析探讨AGI性能在时间结构基准上的正曼陀网,发现$G$因子随时间变化,专业化模型的出现导致$G$因子下降,揭示了AI模型在通用智能与专业智能间的演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09634 2026-04-14 cs.CY cs.AI 57%

From Understanding to Creation: A Prerequisite-Free AI Literacy Course with Technical Depth Across Majors

从理解到创造:一个无先修要求的AI素养课程,跨专业技术深度

Amarda Shehu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文介绍了一门无先修要求的AI素养课程,通过五个机制提升学生对AI系统的理解、使用、评估和构建能力,课程设计兼顾技术深度与跨专业适用性。

Comments 37 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09633 2026-04-14 cs.CY cs.AI 57%

Agentic AI in Engineering and Manufacturing: Industry Perspectives on Utility, Adoption, Challenges, and Opportunities

工程与制造中的代理AI:行业对效用、采用、挑战和机遇的看法

Kristen M. Edwards, Maxwell Bauer, Claire Jacquillat, A. John Hart, Faez Ahmed

机构 * MIT Initiative for New Manufacturing(麻省理工学院新制造倡议)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过30多次访谈探讨AI在工程和制造中的应用,发现代理系统在结构化和重复性工作中的价值,以及多步骤工作流协同的潜力,指出数据碎片化、安全要求和工具链限制是主要障碍,强调可靠性、验证和审计性对AI采用的重要性。

Comments Funding and support from the MIT Initiative for New Manufacturing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23045 2026-04-13 cs.AI 57%

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

AI的混乱:模型智能与任务复杂性如何影响对齐问题

Alexander Hägele, Aryo Pradipta Gema, Henry Sleight, Ethan Perez, Jascha Sohl-Dickstein

机构 * Anthropic Fellows Program(Anthropic 研究员计划) EPFL(瑞士联邦理工学院洛桑) University of Edinburgh(爱丁堡大学) Constellation Anthropic

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了高智能AI模型在复杂任务中失败的机制,发现模型规模越大,失败行为越不一致,强调对齐研究在防止奖励黑客和目标误指定中的重要性。

Comments ICLR 2026. 10 pages main text, 40 total, 27 figures. v2: typos, improved writing, references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08355 2026-04-13 cs.AI 57%

ASPECT:Analogical Semantic Policy Execution via Language Conditioned Transfer

ASPECT:通过语言条件转移实现类比语义策略执行

Ajsal Shereef Palattuparambil, Thommen George Karimpanal, Santu Rana

机构 * Applied Artificial Intelligence Initiative, Deakin University, Waurn Ponds, Geelong(迪肯大学应用人工智能计划) School of IT, Deakin University, Waurn Ponds, Geelong(迪肯大学信息技术学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ASPECT通过语言条件化的变分自编码器和大语言模型实现零样本迁移,解决传统方法在新任务适应性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏