arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2940 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2606.10466 2026-06-23 cs.LG cs.AI 新提交 81%

UPLOTS: A Unified Pretrained Language Model for Constrained Time-series Generation

UPLOTS: 一种用于约束时间序列生成的统一预训练语言模型

Du Yin, Hao Xue, Jinliang Deng, Yang Yang, Shuang Ao, Arian Prabowo, Flora Salim

机构 * University of New South Wales(新南威尔士大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出UPLOTS,一种基于统一预训练语言模型和提示引导的框架,通过动态多数据集损失重加权和提示到模式映射,实现跨领域约束时间序列生成,在四个基准上验证了其泛化性和数据增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19460 2026-06-19 cs.CV cs.AI cs.LG 新提交 81%

Scaling Generative Foundation Models for Chest Radiography with Rectified Flow Transformers

使用整流流变换器扩展胸部X光片的生成式基础模型

Fabio De Sousa Ribeiro, Emma A. M. Stanley, Charles Jones, Tian Xia, Dominic C. Marshall, Laurent Renard Triché, Christopher V. Cosgriff, Panagiotis Dimitrakopoulos, Sotirios A. Tsaftaris, Ben Glocker

机构 * Imperial College London(帝国理工学院) Causality in Healthcare AI Hub(医疗AI因果关系中心) University of Edinburgh(爱丁堡大学) Cleveland Clinic London(克利夫兰诊所伦敦) Department of Perioperative Medicine, CHU Clermont-Ferrand(克莱蒙费朗大学医院围手术期医学科) Department of Medicine, Massachusetts General Hospital(麻省总医院医学部) Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出首个十亿参数级胸部X光片生成基础模型,通过整流流变换器实现高保真可控合成,显著提升合成图像与真实图像的不可区分性。

Comments Project page: https://RadiT-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 81%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15420 2026-06-16 cs.LG cs.AI 新提交 81%

Constitutional Value Potentials: reading and steering internal priority margins in language models

宪法价值潜力:读取和引导语言模型中的内部优先级边际

Tong Che, Rui Wu

机构 * NVIDIA Research(英伟达研究院) Rutgers University(罗格斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出宪法价值潜力(CVP)方法,通过从隐藏状态学习标量势来读取模型内部的价值优先级边际,以预测和干预价值冲突,AUROC高达0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11599 2026-06-11 cs.CL cs.LG 新提交 81%

When is Your LLM Steerable?

你的大模型何时可操控?

Chenrui Fan, Yize Cheng, Ming Li, Soheil Feizi, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出通过模型生成初期的内部状态预测激活操控是否成功,并利用该预测器优化操控强度搜索,降低解码成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11105 2026-06-10 cs.CL cs.AI 新提交 81%

PhantomBench: Benchmarking the Non-existential Threat of Language Models

PhantomBench: 对语言模型非存在性威胁的基准测试

Haeji Jung, Hila Gonen

机构 * University of British Columbia(不列颠哥伦比亚大学) Canada CIFAR AI Chair, Amii(加拿大CIFAR人工智能主席,阿米研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出PhantomBench,首个大规模非存在概念基准,包含6万多个虚构实体,评估21个模型,发现平均幻觉率高达86.7%,前沿模型也难以避免。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09894 2026-06-10 cs.LG cs.CL 新提交 81%

A Navigable Manifold of Hypothesized Consciousness-Spectrum States in Language Model Representations

语言模型表示中假设的意识谱状态的可导航流形

Sophie Zhao

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型嵌入空间中与意识谱相关的几何结构,发现嵌入形成可导航流形,高低层区域稳定,中间为过渡走廊,导航性为内在属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08630 2026-06-09 cs.LG cs.AI 新提交 81%

Tyan-WP: A Wind Power Foundation Model for Ultra-Short-Term Probabilistic Forecasting

Tyan-WP:用于超短期概率预测的风电基础模型

Jiahui Huang, Ao Luo, Lei Liu, Hongwei Zhao, Tengyuan Liu, Ruibo Guo, Bo Wang, Zhao Wang, Bin Li

机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) China Electric Power Research Institute(中国电力科学研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出首个风电基础模型Tyan-WP,通过静态站点嵌入和功率感知气象融合模块,在零样本场景下实现超短期概率预测,显著优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08408 2026-06-09 cs.CL cs.AI 新提交 81%

TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering

TimpaTeks: 通过扩散语言模型引导实现自动原地文本序列修改

Ryandito Diandaru, Ikhlasul Akmal Hanif, Fadli Aulawi Al Ghiffari, Ahmed Elshabrawy, Alham Fikri Aji

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出TimpaTeks方法,将激活引导扩展到扩散语言模型,实现原地文本修改以改变概念,在情感和概念引导任务上降低困惑度并保持句子结构。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交 81%

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06898 2026-08-10 cs.RO cs.CL cs.HC 新提交 80%

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

我该如何为我的机器人选择基础模型?支持社会机器人的社区评估框架

Eric Nichols, Alva Markelius, Hatice Gunes

机构 * Honda Research Institute Japan(本田研究所日本分部) University of Cambridge(剑桥大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 针对社会机器人选择基础模型的难题,本文提出三层评估漏斗范式,梳理五个评估维度的适用评估方法,呼吁社区共建评估框架。

Comments 5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10197 2026-07-14 cs.AI 新提交 80%

GRATE: Temporal Extensions for Inductive KG Foundation Models via Gated Rotary Attention

GRATE:基于门控旋转注意力的归纳式知识图谱基础模型的时间扩展

Jiaxin Pan, Osama Mohammed, Daniel Hernández, Steffen Staab

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究如何将知识图谱基础模型的归纳迁移能力扩展到时间知识图谱,提出GRATE方法,通过门控旋转注意力编码时间,集成到NBFNet模型中,构建新基准套件测试,单个联合预训练的GRATE检查点在多数设置下优于静态基础模型。

Comments Accepted at the ICML 2026 Workshop on Graph Foundation Models: A New Era for Graph Machine Learning. 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07457 2026-06-08 cs.LG eess.SP stat.ML 新提交 80%

Time series Foundation Models based on Physics-Informed Synthetic Histories for Cold-Start Photovoltaic Forecasting

基于物理信息合成历史的时间序列基础模型用于冷启动光伏预测

Lorenzo Longarini, Alessandro Rongoni, Simone Silenzi, Emanuele Frontoni, Riccardo Rosati

机构 * European Commission(欧洲委员会)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 针对光伏电站冷启动预测问题,提出利用物理信息合成历史数据,结合时间序列基础模型进行零样本预测,在440个站点上实现1.7-2倍性能提升。

Comments To be published in the 2nd ICML Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23503 2026-08-25 cs.CV 新提交 80%

Action-Aligned Retrieval with Pairwise Multimodal Reranking for Text-Based Person Anomaly Search

用于基于文本的人员异常搜索的动作对齐检索与成对多模态重排序

Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市国家大学科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对基于文本的人员异常搜索中现有方法的局限,提出ActPair三阶段由粗到细框架,结合动作对齐检索与成对多模态重排序,在PAB测试集取得最优结果且可有效迁移至新数据集。

Comments Accepted to the AI City workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22812 2026-08-25 cs.NI 新提交 80%

The Surprising Effectiveness of LLMs in BGP Security: Mining An Unprecedented Amount of Incidents and Boosting Anomaly Detection

大语言模型在BGP安全中的惊人有效性:挖掘前所未有的事件量并提升异常检测

Libin Liu, Wenzhou Yang, Li Chen, Dan Li, Xiuting Xu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究针对BGP安全领域公开路由异常数据集稀缺的问题,开发LLM辅助提取流水线构建了11.89倍于现有规模的基准,设计ROUTELLM检测器并实现远超基线的检测性能,相关资源已开源。

Comments Accepted by IEEE ICNP 2026, 10 pages in main body, 20 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22202 2026-08-25 cs.CR cs.ET 新提交 80%

Lessons from the Hardware Hacking Competitions: Verification Techniques, Findings, and Insights

硬件黑客竞赛的启示:验证技术、发现与见解

Sudipta Paria, Aritra Dasgupta, Raghul Saravanan, Jayanth Thangellamudi, Sai Manoj P D, Swarup Bhunia

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文基于硬件黑客竞赛开展SoC安全验证系统研究,提出多策略漏洞分析方法,结合多种技术分析漏洞,推导验证启示,探讨竞赛基准对硬件安全技术评估及EDA研究的支持作用。

Comments 11 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 80%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17769 2026-08-19 eess.SP 新提交 80%

Electromagnetic World Model for 6G: A Unified Framework for Joint Environment Reconstruction and Channel Prediction

面向6G的电磁世界模型:环境重建与信道预测的统一框架

Yizhu Zhao, Li Yu, Jianhua Zhang, Yuxiang Zhang, Zhen Zhang, Guangyi Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对6G智能终端需同时实现环境感知与通信的需求,提出EMWM统一框架,融合多模态信息完成信道预测与环境重建,性能优于基线方法,具备鲁棒性与零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 80%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16067 2026-08-18 cs.HC 新提交 80%

SiMUSation: An Interactive Visitor Experience Simulation Framework to Support Museum Exhibition Design

SiMUSation:一种支持博物馆展览设计的交互式参观者体验模拟框架

Huanchen Wang, Qiuming Chen, Zhonghao Ji, Ruqi Sun, Zhichao Lu, Yuxin Ma

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出SiMUSation交互式框架,通过LLM驱动的角色模拟,支持博物馆展览早期设计,经12人用户研究验证其可辅助设计反思优化。

Comments 15 pages, 7 figures, 3 tables, Accepted by ACM UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15814 2026-08-18 cs.CR 新提交 80%

Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains

基于发布者属性评估生成式搜索引擎的攻击面:政治领域的案例研究

Riku Mochizuki, Shusuke Komatsu, Souta Noguchi, Kazuto Ataka

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究针对政治领域,提出评估框架与“内容注入屏障”指标,发现不同GSE攻击面有别、执政党攻击面更广、用户画像影响小,揭示了GSE的攻击面特征。

Comments Our full paper will be presented at ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13956 2026-08-17 cs.IR 新提交 80%

How retriever redundancy and diversity impact RAG effectiveness

检索器冗余性与多样性如何影响检索增强生成(RAG)的有效性

Jonathan J Ross, Bevan Koopman, Anton van der Vegt, Guido Zuccon

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究探究RAG中检索文档的冗余性与多样性对答案正确性的影响,发现重复冗余与LLM转述无显著增益,而多样文档可将正确性提升17%-47%,并揭示其提升源于体裁多样性,为RAG检索方法优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13930 2026-08-17 cs.CR 新提交 80%

Extracting and Verifying Illicit Bitcoin Addresses from Underground Forum Discussions

从地下论坛讨论中提取和验证非法比特币地址

Abdoul Nasser Hassane Amadou, Arnaud Legout, Imane Fouad, Konstantin Avrachenkov, Anas Motii

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究提出结合LLM辅助筛选、专家审核与链上验证的可复现流程,从地下论坛HackForums构建含2438个经人工验证非法比特币地址的数据集,为相关研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 80%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13240 2026-08-14 cs.SE 新提交 80%

Can Formal Specifications Be Synthesized from Tests Alone?

仅从测试能否合成形式化规格说明?

Tianhai Liu, Maximilian Müller, Tobias Hey, Vitus Lüntzel, Muhammad Minhas, Anne Koziolek, Bernhard Beckert

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出仅用测试代码和动态执行轨迹,结合LLM与有界模型检查合成形式化规格说明的方法,在SpecGenBench基准上取得初步效果,同时指出需解决检查器兼容性等关键挑战。

Journal ref ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 80%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 80%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06960 2026-08-10 cs.SE cs.CR 新提交 80%

Statistical Analysis of Executability and Program Equivalence in Decompilation for IoT Vulnerability Detection

面向物联网漏洞检测的反编译可执行性与程序等价性统计分析

Minami Yoda, Jialong Li, Yasuyuki Tahara, Yuichi Sei, Yutaka Matsuno

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对物联网固件漏洞检测的反编译问题,提出九维质量评估指标,通过统计分析证明其可有效评估反编译质量,为物联网设备缺陷及黑盒生成模型质量评估提供基础。

Comments Author's English translation of the paper accepted for publication (in Japanese) in Toukei Suri (Proceedings of the Institute of Statistical Mathematics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06790 2026-08-10 cs.SE 新提交 80%

AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

AgentChaos:通过可编程故障注入实现智能体系统的混沌工程

Gou Tan, Zhensu Sun, Jieke Shi, Ting Zhang, Zilong He, Qingfu Wu, Shuai Liang, Weifeng Sun, Junda He, Pengfei Chen, Chuanfu Zhang, Lwin Khin Shar, David Lo

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出AgentChaos框架,在不修改源代码的情况下于LLM API共享层注入故障,评估显示智能体系统鲁棒性取决于自身实现,现有故障诊断方法仍有提升空间。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06200 2026-08-07 physics.ed-ph 新提交 80%

Using LLMs to Detect Growth in Computational Thinking in Introductory Physics

使用大型语言模型(LLMs)检测入门物理课程中计算思维的发展

Sean Savage, Anand Shanker, Grace Michlitsch, N. Sanjay Rebello

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究用LLMs分析学生计算物理问题书面解释,发现其可复刻人工评估结果并规模化检测计算思维发展趋势,为大招生规模物理课程的CT评估提供可行方法。

Comments 1 figure, 2 tables. Submitted to Physics Education Research Conference (PERC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏