arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-27 至 2026-08-27 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2608.25251 2026-08-27 cs.CV cs.AI 新提交 79%

What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift

医学视觉-语言模型在放射学中学到了什么?分布偏移下的迁移、对齐与源代理泄露

Ayoub Louaye Bouaziz, Lokmane Chebouba, Yassine Himeur

机构 * University of Constantine(康斯坦丁大学) University of Dubai(迪拜大学) University of Western Brittany(西布列塔尼大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本研究针对医学视觉-语言模型在分布偏移下的失效问题,探究其跨数据集迁移、多模态对齐及源代理泄露特性,发现表观能力掩盖相关失效模式,推动对该类模型的压力测试评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25487 2026-08-27 cs.CL cs.IR 新提交 70%

ReliableRAG: Combating Misinformation in Retrieval-Augmented Generation via Reliability-Guided Reasoning Chains

ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息

Jinpu Jiang, Xuan Wu, Wenhao Song, Bo Yang, You Zhou, Hongwei Ge, Heow Pueh Lee, Yanchun Liang, Chunguo Wu

机构 * College of Software, Jilin University(吉林大学软件学院) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) National University of Singapore(新加坡国立大学) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交 50%

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16558 2026-08-27 cs.CV cs.MM 版本更新 50%

Segmentation-Based Attention Entropy: Detecting and Mitigating Object Hallucinations in Large Vision-Language Models

基于分割的注意力熵:在大视觉-语言模型中检测和缓解对象幻觉

Jiale Song, Jiaxin Luo, Xue-song Tang, Kuangrong Hao, Mingbo Zhao

机构 * School of Information and Intelligent Science, Donghua University, Shanghai, 201620, China(信息与智能科学学院,东华大学,上海,201620,中国)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出基于分割的注意力熵(SAE),通过语义分割量化视觉注意力不确定性,设计可靠性评分和注意力调整方法,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 隐私与版权 1 篇

2608.25727 2026-08-27 cs.LG cs.CR 新提交 57%

Are LLM-Enhanced GNNs Privacy-Safe?

增强型大型语言模型的图神经网络是否具备隐私安全性?

Longzhu He, Zelang Wen, Chaozhuo Li, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过5阶段统一框架评估LLM增强型GNNs的隐私风险,发现其隐私脆弱性高于浅层文本基线,差分隐私可部分缓解风险但会导致效用下降,凸显了该领域的隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 安全评测 30 篇

2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 85%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 安全评测 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25460 2026-08-27 cs.AI cs.LG 新提交 81%

Training Alignment Auditors via Reinforcement Learning

通过强化学习训练对齐审计员

Paul Rosu, Rowan Wang

机构 * Anthropic

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究用强化学习训练LLM审计员,通过成对奖励等优化提升审计质量与真实性,误报率低于1%,且审计能力可跨框架泛化。

Comments 82 pages, 15 figures. Code, prompts, and evaluation data are available at this https URL (https://github.com/paulrosu11/training-auditing-agents-public)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25429 2026-08-27 cs.AI cs.LG 新提交 81%

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness

距离并不足够:遗忘-保留对齐间隙可预测大语言模型的再学习鲁棒性

Yi Chen, Hanna Hsieh, Shuhong Liu, Chuanbo Hua, Zihan Ma, Kun Wang, Joo-Young Kim

机构 * The University of Tokyo(东京大学) KAIST(韩国科学技术院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出FRAG预测器,基于权重选择性而非距离,结合FRP方法提升LLM再学习鲁棒性,揭示权重选择性对鲁棒性的解释力优于单独距离。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25667 2026-08-27 cs.CR cs.AI 新提交 79%

AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation

漏洞评估中的AI垃圾内容与幻觉:关于推理失败及可信缓解措施的综述

Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本综述针对LLMs用于漏洞评估时产生的AI垃圾内容与幻觉问题,分析其源于专家演绎推理与LLMs自回归生成的差距,提出神经符号验证等缓解方案及CVE-Bench等评估工具,为AI驱动的安全分诊系统提供路线图。

Comments Accepted to SiMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 78%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 安全评测 :safety(title,abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24937 2026-08-27 cs.LG cs.AI 新提交 73%

Multi-Modal Anomaly Detection: A Survey

多模态异常检测:一项综述

Xudong Mou, Zexin Wu, Chuan Luo, Shiru Chen, Xudong Liu, Chunming Hu, Renyu Yang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Shandong Inspur Intelligent Production Technology Co., Ltd(山东浪潮智能生产技术有限公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 该综述从假设驱动视角梳理多模态异常检测(MMAD),划分两种互补方法范式,探讨基础模型对MMAD的重塑,汇总基准与评估协议并指出未来方向。

Comments Accepted for publication in IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15161 2026-08-27 cs.CL cs.AI 版本更新 73%

Retrieval-Augmented Agentic Rubric Generation for Reliable Medical Response Evaluation

用于医疗对话系统可靠评估的自动化评分标准

Yinzhu Chen, Abdine Maiga, Hossein A. Rahmani, Emine Yilmaz

机构 * AI Center, University College London(伦敦大学学院人工智能中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强的多智能体框架,用于自动生成实例特定的评估评分标准,通过权威医学证据生成可验证的细粒度评估标准,并在HealthBench和LLMEval-Med数据集上取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24913 2026-08-27 cs.HC cs.SE 新提交 71%

From Blind Edits to Verified Repair: Building Trustworthy User-Side LLM Agents for Web Accessibility

从盲编辑到经验证的修复:构建可信的用户端大语言模型智能体以实现网页可访问性

Lily Bundgaard Wanscher, Markus Heidemann Lorensen, Mohammed Ammad Shafiq, Mahyar Tourchi Moghaddam, Mina Alipour

专题命中 安全评测 :trustworthy(title)

AI总结 本研究构建了用户端LLM智能体的三个核心模块,通过双条件协议诊断盲编辑的缺陷,再结合验证修复工具实现了网页可访问性的可信修复,相关资源已公开。

Comments Accepted to be presented at ICME 2026 (5-9 October, Napoli, Italy) and to be published in ICMI companion proceedings by ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22829 2026-08-27 cs.CV 版本更新 67%

Lost in Motion: Vision Language Models Fail the Dynamic Gauges Test

迷失在振动中:视觉语言模型在动态刻度测试中失败

Tairan Fu, Francisco Javier Santos-Martín, Javier Conde, Elena Merino-Gómez, Pedro Reviriego

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11635 2026-08-27 cs.CY cs.AI cs.CL 版本更新 67%

EduAgentQG: Multi-Agent Personalized Mathematics Question Generation with Explicit Diversity and Objective-Aware Evaluation

EduAgentQG:具有显式多样性和目标感知评估的多智能体个性化数学问题生成

Rui Jia, Min Zhang, Fengrui Liu, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Shanghai Institute of Al for Education(上海人工智能教育研究院) The Chinese University of Hong Kong, Shenzhen School of Data Science(香港中文大学(深圳)数据科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文针对现有数学问题生成方法难以兼顾目标对齐与可控多样性的问题,提出多智能体框架EduAgentQG,构建专属基准并验证其在多项指标上优于COT等基线方法。

Comments Accepted to IPM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2026-08-27 cs.LG cs.AI cs.CL 版本更新 67%

Emergent Abilities in Large Language Models: A Survey

大语言模型中的涌现能力:一项综述

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型(LLMs)及大推理模型(LRMs)的涌现能力,分析其定义、出现条件,同时指出其潜在有害行为,强调需完善评估框架与监管监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24931 2026-08-27 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Modality Contribution Score - A Per-Patient Framework for Quantifying the Relative Diagnostic Contribution of Structural MRI and Amyloid PET in Alzheimer's Disease

模态贡献分数——一种用于量化阿尔茨海默病中结构MRI与淀粉样PET相对诊断贡献的患者专属框架

Dawa Chyophel Lepcha, Aaliya Ali, Sophie A. Martin, Deepika Koundal, Pierrick Coupe, Shabbir Syed-Abdul

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出患者专属框架MCNet与MCS,量化AD中结构MRI与淀粉样PET的相对诊断贡献,在ADNI-3与OASIS-3队列中验证了其分期性能、单调梯度及跨队列泛化性,为痴呆护理可信AI奠定基础。

Comments 15 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交 62%

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25569 2026-08-27 cs.CL cs.AI 新提交 62%

Controllable Affective Generation via Latent Vector Steering

基于潜在向量调控的可控情感生成

Xixian Yong, Siyuan Chang, Yingying Zhang, Xian Wu, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐后情感响应平淡的问题,提出轻量框架EmoVec,通过调控潜在向量实现可控情感生成,实验验证其能提升情感显著性且保留语义等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-27 cs.CL cs.LG 版本更新 62%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at this https URL (https://github.com/cimeister/tokenizer-intrinsic-evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-27 cs.LG cs.AI cs.HC 版本更新 62%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21054 2026-08-27 cs.AI cs.CL 版本更新 62%

Reasoning or Rambling? Exploring the Effect of Thinking on Agent Persuasion

推理还是漫谈?探究思考过程对智能体说服能力的影响

Haodong Zhao, Jidong Li, Zhaomin Wu, Tianjie Ju, Zhuosheng Zhang, Bingsheng He, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) National University of Singapore(新加坡国立大学) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文对比通用LLM与LRM,发现推理对智能体说服能力存在二元性影响,还揭示其依赖表面线索的漏洞,提出提示级对抗性论点检测方法以提升鲁棒性。

Comments Accepted as EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02855 2026-08-27 cs.CL cs.CY 版本更新 62%

IDEAlign: Comparing Ideas of Large Language Models to Domain Expert

IDEAlign:将大语言模型的想法与领域专家进行比较

Hyunji Nam, Lucia Langlois, James Malamut, Mei Tan, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究提出IDEAlign方法,通过“挑出异类”任务评估LLM标注与专家标注的想法层面相似性,发现LLM作为评判者表现最佳但仍不及专家,为开放式LLM标注评估提供了可复用的基准测试协议。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26000 2026-08-27 eess.SP cs.LG q-bio.QM 新提交 57%

CardioFusion-AI: Robust ECG--PPG Fusion for Multimodal Physiological Monitoring Under Signal Degradation

CardioFusion-AI:信号退化下用于多模态生理监测的鲁棒心电图-光电容积脉搏波融合方法

Navaneetha Krishnan Kamalakannan, Janakiraman Kamalakannan

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本研究提出 CardioFusion-AI 框架,通过信号处理前端与自适应融合策略,在多模态生理信号退化场景下实现鲁棒监测,验证了其在不同退化条件下的性能表现。

Comments 7 pages, 4 figures. Under review at IEEE Journal of Biomedical and Health Informatics. Code: this https URL (https://github.com/ka-cyber/CardioFusion-AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25561 2026-08-27 cs.CL 新提交 57%

EgoArgus: Benchmarking VLMs as Situational Assistants for Modality-Grounded User Supports

EgoArgus:将视觉语言模型(VLM)作为模态接地用户支持情境助手的基准测试

Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究针对当前VLMs作为日常助手的模态仲裁难题,构建人工标注数据集EgoArgus,发现现有VLMs仍难胜任该任务,且现有偏差缓解方法效果有限,为部署提供了参考。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25217 2026-08-27 cs.AI eess.SY 新提交 57%

LLM-Driven, Datasheet-Aware Automated Hardware Compatibility Verification for Early-Stage, Pre-Schematic Embedded System Design

面向早期原理图前嵌入式系统设计的、由大语言模型(LLM)驱动且支持数据手册感知的自动化硬件兼容性验证

Haotian Qiao, Robert P. Dick

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该研究提出一种LLM驱动的支持数据手册感知的自动化硬件兼容性验证框架,在早期嵌入式系统设计中实现97.5%的验证准确率,较“上传并查询”工作流减少8.6倍输入上下文大小,验证了模块化任务分解等方法的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 57%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26093 2026-08-27 cs.LG cs.IT eess.SY 新提交 57%

Agentic Autoresearch for Cell-Edge Power Control: Radically Redefining the Researcher's Role

面向小区边缘功率控制的智能体自动研究:从根本上重新定义研究者的角色

Ahmad Khan, Akram Bin Sediq, Sara Azadegi Naeini, Raviraj S. Adve

机构 * Ericsson R&D(爱立信研发部门) University of Toronto(多伦多大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 该研究提出智能体自动研究协议,将无线资源管理的机器学习算法设计交由AI编码智能体完成,在小区边缘功率控制任务中实现高性能与低推理成本,还恢复了可证明的最优结构。

Comments Submitted to IEEE Globecom Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25181 2026-08-27 cs.LG math.DS 新提交 57%

Simultaneous inference of environmental and interaction forces in collective dynamics

群体动力学中环境力与相互作用力的同时推断

Nipuni de Silva, Ming Zhong, James M. Greene

机构 * Clarkson University(克拉克森大学) University of Houston(休斯顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究提出一种框架,可同时非参数推断群体动力学的相互作用核并学习环境力,通过引入的模型选择程序能从轨迹数据区分群体动力学框架并恢复相互作用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19299 2026-08-27 cs.AI 版本更新 57%

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏