arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11120 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2605.29678 2026-05-29 cs.CL 57%

Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?

虚假提示:无关提示能否引导大型语言模型?

Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

机构 * Heinrich Heine University Düsseldorf(海因里希·海因斯大学多特蒙德分校) Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究语义无关的提示(虚假提示)对大型语言模型行为的影响,提出黑盒搜索方法发现此类提示,并证明其在多个基准和模型上能显著影响模型输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02849 2026-05-29 cs.AI 57%

AutoSizer: Automatic Sizing of Analog and Mixed-Signal Circuits via Large Language Model (LLM) Agents

AutoSizer: 通过大语言模型代理自动调整模拟和混合信号电路的尺寸

Xi Yu, Dmitrii Torbunov, Soumyajit Mandal, Yihui Ren

机构 * Artificial Intelligence Department, Brookhaven National Laboratory, Upton, NY(布鲁赫斯国家实验室人工智能部) Instrumentation Department, Brookhaven National Laboratory, Upton, NY 11973(布鲁赫斯国家实验室仪器部)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AutoSizer,一种反射式LLM驱动的元优化框架,通过双循环结构统一电路理解、自适应搜索空间构建和优化编排,在模拟和混合信号电路尺寸调整中实现更优解质量、更快收敛和更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01869 2026-05-29 cs.AI 57%

Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents

Skill-Pro: 通过非参数PPO从经验中学习可复用技能以用于LLM智能体

Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang

机构 * Key Laboratory of Interdisciplinary Research of Computation and Economics(交叉计算与经济学交叉研究实验室) Shanghai University of Finance and Economics(上海财经大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Chinese Academy of Sciences(中国科学院人工智能研究所) University of Bristol(布里斯托大学) Peking University(北京大学) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Skill-Pro框架,通过非参数PPO从交互经验中自动学习可复用的程序性技能,无需参数更新,实现高效经验重用和长期自主性。

Comments Accepted at ICML 2026 (spotlight); 22 Pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29578 2026-05-29 cs.AI 57%

GPS-Enhanced Tourist Mobility Modeling with Seasonal Spatial Priors and LLM-Based Activity Chain Generation

基于季节性空间先验和LLM活动链生成的GPS增强游客移动性建模

Yifan Liu, Yanling Sang, Xishun Liao, Morgan Sun, Bo Yang, Zhiyuan Zhang, Chris Stanford, Haoxuan Ma, Jiaqi Ma

机构 * UCLA Mobility Lab, Department of Civil and Environmental Engineering, University of California, Los Angeles(加州大学洛杉矶分校移动实验室,土木与环境工程系,加州大学洛杉矶分校) Novateur Research Solutions(Novateur研究解决方案) University of Central Florida(中央佛罗里达大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出一种四阶段仿真框架,结合GPS和调查数据推导的月份条件空间先验、游客人口统计信息、距离可行区域序列分配以及基于LLM的活动链生成,以解决游客移动性建模中非例行、吸引驱动且对旅行目的、季节和成员组成高度敏感的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29534 2026-05-29 cs.AI 57%

UI-KOBE: Knowledge-Oriented Behavior Exploration for Lightweight Graph-Guided GUI Agents

UI-KOBE:面向轻量级图引导GUI代理的知识导向行为探索

Yuxiang Chai, Han Xiao, Xinyu Fu, Jinpeng Chen, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Huawei Research(华为研究) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出UI-KOBE框架,通过自动构建应用知识图谱并引导轻量级GUI代理进行运行时决策,以提升其移动端GUI任务执行效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29041 2026-05-29 cs.AI 57%

Practitioner Beliefs and Behaviors in AI-Enhanced Education: DOT Framework Survey Evidence

AI增强教育中的从业者信念与行为:DOT框架调查证据

David Gibson, M. Elizabeth Azukas, Gerald Knezek

机构 * Curtin University(Curtin 大学) Georgia Tech Research Institute(佐治亚理工研究学院) Georgia Institute of Technology(佐治亚理工学院) University of North Texas(北卡罗来纳州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 基于DOT框架,通过横截面调查(n=72)探究高等教育从业者对AI整合的信念、行为及制度条件,发现从业者支持AI教学辅助但强调人类监督,且设计导向实践与理论存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28994 2026-05-29 cs.AI 57%

BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation

BEAMS:用于建模与仿真的AI基准测试与评估

Sara Metcalf, William Schoenberg

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出BEAMS倡议,通过建立以人为本的基准测试框架,评估AI工具在建模与仿真中的表现,发现其在因果推理和定量修正方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26428 2026-05-29 cs.CL cs.HC 57%

Slide Deck Q&A Quality Assurance App: A Multi-Stage Pipeline for Pedagogical Question Generation

Slide Deck Q&A 质量保证应用:面向教学问题生成的多阶段流水线

Jim Salsman

机构 * TalkNicer, Inc.(TalkNicer公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 提出一个基于Flask的多阶段大语言模型流水线,从PDF幻灯片中提取文本和图像,生成结构化的教学问题集,并通过窗口规划、幻灯片合成、标注和协调四个阶段提高问题质量。

Comments 15 pages, 3 research questions, 1 figure, 1 table, 6 references, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24399 2026-05-29 cs.AI 57%

ConceptM$^3$oE: Concept-Guided Multimodal Mixture of Experts for Interpretable Computational Pathology

ConceptM$^3$oE:面向可解释计算病理学的概念引导多模态专家混合模型

Xuan Wang, Zhongling Xu, Gopi Kannedhara, Joakim Nguyen, Jian Yu, Jinrui Fang, Abdurrahmaan Baghdadi, Tianlong Chen, Awais Naeem, Chandra Krishnan, Edward Castillo, Andrew H. Song, Ankita Shukla, Ying Ding, Nicholas Konz, Hairong Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Dell Children’s Medical Center(德尔儿童医疗中心) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) University of Nevada, Reno(内华达大学里诺分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ConceptM$^3$oE框架,通过概念引导的多模态专家混合路径嵌入概念形成,并利用残差路径保持性能与可解释性,在脑肿瘤分类中优于基线并提升小样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08013 2026-05-29 cs.AI 57%

Small Agent Group is the Future of Digital Health

小型智能体群是数字健康的未来

Yuqiao Meng, Luoxi Tang, Dazheng Zhang, Rafael Brens, Elvys J. Romero, Nancy Guo, Safa Elkefi, Zhaohan Xi

机构 * State University of New York at Binghamton(纽约州立大学布inghamton分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出小型智能体群(SAG)通过协作推理替代单一大型模型,在数字健康中实现更优的有效性、可靠性和部署效率。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10398 2026-05-29 cs.CE cs.AI 57%

Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Humans

大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化

Yu Lei, Hao Liu, Chengxing Xie, Songjia Liu, Zhiyu Yin, Canyu Chen, Guohao Li, Philip Torr, Zhen Wu

机构 * Tsinghua University(清华大学) Department of Psychological and Cognitive Sciences(心理与认知科学系) College AI(人工智能学院) School of Management(管理学院) Fudan University(复旦大学) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学) University of Oxford(牛津大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28807 2026-05-28 cs.AI 57%

Calibrating Conservatism for Scalable Oversight

校准保守主义以实现可扩展监督

William Overman, Mohsen Bayati

机构 * Stanford Graduate School of Business(斯坦福商学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出校准集体监督(CCO)方法,通过在线校准保守主义,在无分布假设下确保不良结果低于用户指定阈值,并在SWE-bench和MACHIAVELLI实验中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28617 2026-05-28 cs.AI cs.PL 57%

LACUNA: Safe Agents as Recursive Program Holes

LACUNA: 作为递归程序空洞的安全智能体

Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

机构 * EPFL(苏黎世联邦理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出LACUNA编程模型,通过类型化调用和编译时检查,让LLM智能体以递归程序空洞的方式安全地编写代码,实现表达性与安全性的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28534 2026-05-28 cs.CL 57%

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

GUI-CIDER:通过因果内化和密度感知示例重选进行GUI代理的中期训练

Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 提出GUI-CIDER中期训练方法,通过因果内化和密度感知示例重选显式内化GUI世界知识,提升代理对GUI操作的理解和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28354 2026-05-28 cs.AI 57%

Plan Before Search: Search Agents Need Plan

搜索前先规划:搜索智能体需要规划

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Jiayi Ji, Chenyi Lei, Wenwu Ou, Xiaoshuai Sun, Qibin Hou

机构 * Kuaishou Technology(快手科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) VCIP, CS, Nankai University(南开大学VCIP实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Plan方法,通过将问题分解为有序子问题再进行检索,并引入自举训练范式,无需外部强模型蒸馏即可在多跳QA中激活规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28188 2026-05-28 cs.CL 57%

Framing Matters: Addressing Framing Sensitivity in Decision-Making through Behaviorally-Grounded Value Alignment

框架至关重要:通过基于行为的价值对齐解决决策中的框架敏感性

Seojin Hwang, Minju Kim, Junhyuk Choi, JeongHyun Park, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Fragile基准测试框架,系统评估大语言模型在事实等价但不同框架输入下的决策稳定性,并设计Valign方法通过表示级干预有效降低框架引起的决策翻转。

Comments 29 pages, 7 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28109 2026-05-28 cs.LG 57%

Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization

平衡万岁:信息瓶颈驱动的基于树的策略优化

Hao Jiang, Shurui Li, Tianpeng Bu, Bowen Xu, Xin Liu, Qihua Chen, Hongtao Duan, Lulu Hu, Bin Yang, Minying Zhang

机构 * Alibaba Cloud Computing, Alibaba Group(阿里云计算,阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对在线强化学习中探索-利用不平衡问题,提出基于信息瓶颈理论的IB-Score指标和IB-TPO框架,通过树采样策略提升优化稳定性和性能。

Comments Accepted to ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27700 2026-05-28 cs.DL cs.AI 57%

CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text

CiteCheck: 基于检索的科学文本中LLM引用幻觉检测

Khashayar Khajavi, Shaghayegh Sadeghi, Rise Adhikari, Alexander Tessier

机构 * School of Computing Science, Simon Fraser University(西蒙·弗雷泽大学计算科学学院)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 提出CiteCheck框架,通过从外部学术来源检索候选出版物、使用结构化LLM验证器比较引用与候选信息,并将验证器得分映射为精确、次要和主要三个标签,以检测LLM生成的引用幻觉,在物理基准上达到88.7 macro-F1和88.9%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27610 2026-05-28 cs.IR cs.AI cs.HC 57%

Eliot: Interactively $\underline{E}$xploring Fast-Changing Scientific $\underline{Li}$terature Trends with $\underline{O}$nline Da$\underline{t}$a and Learning

Eliot: 通过在线数据和学习交互式探索快速变化的科学文献趋势

Bernardo A. Denkvitts, Nitin Gupta, Biplav Srivastava

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出Eliot系统,通过查询时聚类和时间可视化,帮助研究人员可追溯地探索快速变化的科学文献趋势。

Comments Under-review at CIKM Applied Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27429 2026-05-28 cs.IR cs.AI 57%

Ocean4Rec: Offline LLM-Derived OCEAN Profiles for Request-Time VOD Reranking

Ocean4Rec:离线LLM生成的OCEAN画像用于请求时VOD重排序

Wonkyun Kim, Sehyun Bae, Kwanki Ahn, Mungyu Bae, Saeun Choi, Soyeon You, Chandra Prabhakar, Sehyun Kim

机构 * Samsung Electronics Republic of Korea(韩国三星电子公司) Samsung Electronics India(印度三星电子公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出Ocean4Rec重排序层,利用LLM离线生成物品OCEAN画像,在请求时无需LLM调用,通过数值计算提升VOD推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16293 2026-05-28 cs.CY cs.AI 57%

From Prediction to Intervention: The Evolution of AI in Biomedicine

从预测到干预:人工智能在生物医学中的演进

Andrew Feinberg, Aleksandr Sarachakov, Viktor Svekolkin, Alexander Bagaev, Ferran Prat, Michael Feinberg

机构 * BostonGene Corporation(波士顿基因公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出生物医学AI正从基于历史数据的预测范式转向能够模拟干预效果的干预智能,通过定义疾病级模型实现从推理到仿真的转变,以支持新型疗法和未观测干预下的决策。

Comments 10 pages, 3 figures, 1 table. Figures were replaced with a better versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26182 2026-05-28 cs.CL 57%

ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory

ClinicalAgents:具有双记忆的临床决策多智能体编排

Zhuohan Ge, Haoyang Li, Yubo Wang, Nicole Hu, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出ClinicalAgents多智能体框架,通过蒙特卡洛树搜索动态编排和双记忆架构模拟临床推理,显著提升诊断准确性和可解释性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27141 2026-05-27 cs.AI 57%

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

VitaBench 2.0:评估长期用户交互中的个性化与主动型代理

Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有代理基准忽视用户偏好推断与利用的问题,提出VitaBench 2.0基准,通过时间序列任务和可扩展记忆接口评估代理在长期交互中的个性化与主动性,实验表明最先进模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27030 2026-05-27 cs.CL 57%

Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling

分享更多,搜索更少:面向高效测试时间扩展的协作并行思考

Xinglin Wang, Hao Lin, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机学院) Xiaohongshu Inc(小红书公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出一种无需训练的协作并行思考框架,通过在并行分支间共享搜索信息来减少冗余探索,从而在测试时间扩展中实现更优的准确率-延迟帕累托边界。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26835 2026-05-27 cs.AI 57%

Helicase: Uncertainty-Guided Supply Chain Knowledge Graph Construction with Autonomous Multi-Agent LLMs

Helicase: 不确定性引导的供应链知识图谱构建与自主多智能体大语言模型

Yunbo Long, Haolang Zhao, Ge Zheng, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Helicase,一种基于多智能体大语言模型的自主系统,通过不确定性引导的迭代验证和知识图谱构建,解决供应链中需要多跳推理的结构化推断问题,并引入SCQA基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17774 2026-05-27 cs.CL 57%

Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning

通过QLoRA微调将工具知识内化到小型语言模型中

Yuval Shemla, Ayal Yakobe, Tanmay Agarwal, Dhaval Patel, Kaoutar El Maghraoui

机构 * Columbia School of General Studies, Columbia University, NY, USA(哥伦比亚大学泛研学院) Columbia Engineering, Columbia University, NY, USA(哥伦比亚大学工程学院) IBM Research, NY, USA(IBM研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文研究通过QLoRA参数高效微调将工具知识内化到小型语言模型中,在AssetOpsBench基准上,微调后的Gemma 4 E4B和Qwen3-4B模型在无描述推理下优于有完整工具描述的未微调基线,输入长度减少82.6%,规划分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16000 2026-05-27 cs.SI cs.AI cs.DL 57%

CitePrism: Human-in-the-Loop AI for Citation Auditing and Editorial Integrity

CitePrism:面向引文审计与编辑完整性的人机协同AI

Gowrika Mahesh, Budanur Madappa Darshan Gowda, Kavana Gopladevarahalli Papegowda, Prajwal Basavaraj, Binh Vu, Swati Chandna, Mehrdad Jalali

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出CitePrism框架,结合LLM推理、嵌入相似度、元数据验证和人工审核,实现稿件级引文审计,初步验证显示可辅助编辑筛选不相关引文。

Comments 30 pages, 5 main figures, 3 tables, appendices with interface screenshots and implementation details; pilot-stage framework and single-manuscript validation study

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13018 2026-05-27 cs.CL 57%

Toward Autonomous Long-Horizon Engineering for ML Research

面向机器学习研究的自主长周期工程

Guoxin Chen, Jie Chen, Lei Chen, Jiale Zhao, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Cheng Chen, Ji-Rong Wen, Kai Jia

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出AiScientist多智能体系统,通过轻量级层级研究团队和File-as-Bus工作空间解决长周期ML研究工程中的累积进度维持问题,在PaperBench和MLE-Bench Lite上取得显著提升。

Comments Repo: https://github.com/AweAI-Team/AiScientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09157 2026-05-27 physics.med-ph cs.LG 57%

A Fast and Generic Energy-Shifting Transformer for Hybrid Monte Carlo Radiotherapy Calculation

一种用于混合蒙特卡罗放疗计算的快速通用能量转移变换器

Chi-Hieu Pham, Didier Benoit, Vincent Bourbonne, Ulrike Schick, Dimitris Visvikis, Julien Bert

机构 * LaTIM, INSERM-UMR1101, University of Brest(拉蒂姆研究所、INSERM-UMR1101、布列塔尼大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出一种名为能量转移的深度学习框架,通过从简单单能输入合成多能剂量分布,实现加速蒙特卡罗剂量计算,并设计TransUNetSE3D架构结合Transformer和残差挤压激励模块,在保持实时速度的同时达到98%以上的伽马通过率。

Comments 13 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19450 2026-05-27 cs.CR cs.AI 57%

Red-Teaming Claude Opus and ChatGPT-based Security Advisors for Trusted Execution Environments

对基于Claude Opus和ChatGPT的TEE安全顾问进行红队测试

Kunal Mukherjee, Spandan Mukherjee

机构 * Virginia Tech(弗吉尼亚理工大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对TEE安全顾问角色下的LLM助手(ChatGPT-5.2和Claude Opus-4.6),提出TEE-RedBench评估方法,发现提示诱导的失败可跨模型迁移(最高12.02%),并通过LLM-in-the-loop流水线减少80.62%的失败。

Comments Accepted for publication in ACM CAIS '26 Workshop on AI Discovery in the Wild (AID-Wild)

详情

展开后加载摘要…

URL PDF HTML 收藏