PEARL: Solver-in-the-Loop Interactive Optimization Modeling from Natural Language
PEARL:基于自然语言的循环求解器交互式优化建模
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 研究旨在解决优化建模问题,提出PEARL系统,通过在循环中使用Python执行和数学编程求解器,学习优化策略,在多轮工具集成设置下提升求解率,在优化建模任务中表现优于强大基线。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
PEARL:基于自然语言的循环求解器交互式优化建模
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 研究旨在解决优化建模问题,提出PEARL系统,通过在循环中使用Python执行和数学编程求解器,学习优化策略,在多轮工具集成设置下提升求解率,在优化建模任务中表现优于强大基线。
删除并非手术刀:拒绝移除对不同模型家族决策倾向的非目标效应
机构 * huihui-ai(慧慧人工智能)
专题命中 工作流自动化 :agent(abstract);分类 cs.CL、cs.LG
AI总结 研究“无审查”开放权重模型中删除模型拒绝方向的操作影响,以21600个不确定性决策为探针,对比两个专家混合模型家族的基础与删除模型,发现有多种效应,还发现污染渠道,表明部署此类模型得到的是不同决策者。
Comments 11 pages, 5 figures, 4 tables. Preregistered. Data and code: https://github.com/oleczek/paper-abliteration-not-a-scalpel ; dataset DOI: 10.5281/zenodo.21314839
RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标
机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) ; Cisco Systems(思科系统公司) ; Zaitra s.r.o.(扎伊特拉有限公司) ; NaiveNeuron(天真神经元)
专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。
Comments SemEval-2026 Task 1
大语言模型在欺诈检测和信任与安全工作流程中的操作证据差距
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 研究LLMs用于欺诈检测等信任与安全工作流程时的操作证据差距。通过对相关操作源编码调查发现证据失衡,欺诈任务部分大但缺乏关键证据。贡献了FORTE框架和部署证据清单,确定支持LLMs部署所需研究。
Comments 22 pages, 3 figures, 6 tables. Ancillary files include the evidence matrix, search note, and numeric claim check
评估跨响应条件的非均匀可靠性:自动作文评分中的条件可推广性框架
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究针对自动作文评分中跨响应条件非均匀可靠性评估问题,引入含三个部分的条件可推广性框架,通过比较分析与经验扫描、依熵分层等,以限时L2写作自动评分验证,提供了评估非均匀可靠性的可移植工作流程。
BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架
机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)
专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.LG
AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。
Comments 7 pages
PRecG:基于图神经网络和修辞角色分割的法律先例检索
机构 * University of Delhi(德里大学) ; IBM Research(IBM 研究院)
专题命中 工作流自动化 :planning(abstract);分类 cs.AI、cs.CL
AI总结 研究法律先例检索问题,提出PRecG管道,通过基于句子修辞角色分解文档、构建知识图、学习聚合实体上下文表示等步骤,分层学习法律判决对的表示来计算相似度,经实验验证其有效性。
Comments 23 Pages
一种基于MiniLM嵌入的多簇边界学习方法用于检测超出范围的意图
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 针对意图检测中超出范围意图检测的挑战,提出基于MiniLM嵌入的多簇边界学习方法,在单类分类工作流程中检测超出范围意图,实验表明该方法性能最优,所用MiniLM能更好适应相关要求。
Comments To submit
MetaConfigurator:从JSON数据实现AI辅助的RDF创作
机构 * Institute for Parallel and Distributed Systems, University of Stuttgart(并行与分布式系统研究所,斯图加特大学) ; Institute of Polymer Chemistry, University of Stuttgart(聚合化学研究所,斯图加特大学) ; Institute of Biochemistry, University of Stuttgart(生物化学研究所,斯图加特大学)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 提出一个集成AI辅助的RML映射、SPARQL查询和知识图谱可视化的Web界面,将JSON等结构化数据转换为RDF,并以MOF合成实验数据验证其有效性。
Comments Submitted as post-proceedings for the deRSE26 conference
超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。
大语言模型安全工具编排的决定因素与限制:基于HexStrike-AI的研究
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research(苏州研究院)
专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.SE
AI总结 以HexStrikeAI为测试平台,通过评估系统、诊断故障并改进,运行多类挑战,发现驱动客户端是固定模型的首要因素,整体解决率提升,剩余故障受推理或环境限制,还讨论了编排器评估及局限性。
医学启发式学习:一个用于可解释和可审计临床决策规则的LLM驱动框架
机构 * Centre for Artificial Intelligence Driven Drug Discovery, Macao Polytechnic University(人工智能驱动药物发现中心,澳门理工学院) ; Key Laboratory of Short-Range Radio Equipment Testing and Evaluation, Ministry of Industry and Information Technology Terahertz Science Application Center (TSAC), Beijing Institute of Technology(工业和信息化部短距离无线电设备测试与评估重点实验室,太赫兹科学应用中心(TSAC),北京理工大学) ; Department of Critical Care Medicine, Yantai Yuhuangding Hospital, Qingdao University(重症医学科,烟台友谊医院,青岛大学) ; Faculty of Education, The University of Hong Kong(教育学院,香港大学) ; College of Information Engineering, Dalian University(信息工程学院,大连大学)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出医学启发式学习(MHL),利用LLM驱动的工作流优化确定性可执行决策系统,生成可解释、可审计的Python决策规则,在医学数据集上达到与最先进方法相当的性能,并支持小样本和高度不平衡场景。
从想法到原型只需一个下午:脚手架式、AI辅助的快速可视化分析原型设计
机构 * Fraunhofer Institute IAIS(弗劳恩霍夫智能分析与信息系统研究所)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 本文通过案例展示,结合工作流语言和AI助手,将可视化分析原型的开发时间从数月缩短至一个下午,并总结了脚手架设计、知识注入和使用方式的三点经验。
对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线
机构 * Aston University(阿斯顿大学) ; Domestic & General
专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。
Comments 10 pages, 8 figures, 2 tables
从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架
机构 * Independent Researcher(独立研究者) ; Columbia University(哥伦比亚大学) ; Chalmers University of Technology(查尔姆斯理工大学)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。
Comments Accepted to Interspeech 2026
人工智能对企业软件用户角色的影响
机构 * SAP SE(SAP股份有限公司) ; Fresenius Hochschule Heidelberg(海德堡弗里森纽斯大学)
专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.SE
AI总结 本研究通过专家访谈和参与式研讨会,探讨AI如何改变SAP BTP平台上的用户角色,发现日常任务自动化、人机协作增强及对代理型AI系统的依赖增加,并指出现有角色框架需适应这些变化。
Comments 18 pages, 1 figure, 4 tables
当Top-1失败时:为掩蔽扩散LM校准LoRA监控器
机构 * Independent Researcher(独立研究员) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG
AI总结 针对离散扩散语言模型微调中top-1 argmax作为崩溃预警的零精度问题,提出使用最大LoRA梯度范数作为参数侧信号,在LLaDA族上实现0.68精度和0.79 F1分数,并建议每族DLM校准阈值。
Comments 14 pages, 3 figures. Code and result artifacts: https://github.com/lucky-verma/top1-fails-dlm-lora-monitors
协同物理约束MCMC与化学信息高斯过程进行反应网络发现
机构 * State Key Laboratory of Fine Chemicals, Frontier Science Center for Smart Materials, Dalian University of Technology, Dalian, 116024, China(精细化学品国家重点实验室,智能材料前沿科学中心,大连理工大学,大连,116024,中国) ; Dalian Key Laboratory of Intelligent Chemistry, CR Belt and Road Joint Laboratory on Intelligent Chemistry and Advanced Materials of Liaoning Province, School of Chemistry, Dalian University of Technology, Dalian, 116024, China(大连智能化学重点实验室,辽宁省“一带一路”智能化学与先进材料联合实验室,化学学院,大连理工大学,大连,116024,中国) ; Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology, Clear Water Bay, Kowloon, Hong Kong(交叉学科研究院,香港理工大学,清水湾,九龙,香港)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出PC-MCMC-CIGP灰箱工作流,结合尖峰-板拓扑采样、硬守恒与热力学筛选及化学信息高斯过程残差模型,用于反应网络发现与实验设计,在H2+Br2基准和苯乙烯环氧化反应上验证了其区分机理和优化产量的能力。
通过半监督学习检测射频数据中的卫星
机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) ; MIT Lincoln Laboratory(麻省理工学院林肯实验室)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出结合非负矩阵分解与自动模型确定(NMFk)、专家引导聚类解释和分类器预测的半监督工作流,用于卫星监测中的射频检测与分类,减少对大量标注数据的依赖。
教育中的LLM作为评判者:基于课程标准的评分流水线
机构 * NSW Department of Education(新南威尔士州教育部) ; South Australian Department for Education(南澳大利亚州教育部) ; OC Selective exam preparation platform(OC精英考试备考平台) ; Studitory: HSC preparation platform(Studitory: HSC备考平台)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 提出一种基于课程标准的可配置LLM评判流水线,用于高利害考试评分,通过整合授权课程工件和评分指南,提高评分一致性、透明度和与官方实践的契合度。
PersonaDrive: 面向闭环驾驶模拟的人类风格检索增强VLA智能体
机构 * University of California, Irvine(加利福尼亚大学尔湾分校)
专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出PersonaDrive流水线,通过检索风格指令下的人类驾驶演示来调节视觉-语言-动作(VLA)驾驶智能体,实现闭环模拟中多样化的非自车智能体行为,无需针对每种风格重新训练。
数据驱动系统何时展现出推理能力?
机构 * Fraunhofer Institute for Intelligent Analysis and Information Systems (IAIS)(弗劳恩霍夫智能分析与信息系统研究所) ; University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 针对欧盟AI法案中推理能力定义模糊的问题,基于统计学习理论提出分级框架,通过信用评分案例展示如何判断系统是否具备推理能力。
++nnU-Net: 基于前缀数据增强的nnU-Net扩展
机构 * Center Algoritmi / LASI, University of Minho, Braga, Portugal(阿尔戈里米中心/拉斯伊大学,明霍大学,布拉加,葡萄牙) ; Institute for Artificial Intelligence in Medicine, University Medicine Essen, Essen, Germany(医学人工智能研究所,埃森医学院,埃森,德国) ; Institute of Medical Informatics / Dept. of Oral and Maxillofacial Surgery, University Hospital RWTH Aachen, Germany(医学信息学研究所/口腔和颅面外科部,亚琛大学医院,德国) ; Faculty of Computer Science, University of Duisburg-Essen, Essen, Germany(计算机科学学院,杜伊斯堡-埃森大学,埃森,德国)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出++nnU-Net,通过图像配准进行数据增强,在预处理和训练前生成变形图像,在5个2D数据集上提升Dice系数最高约22%。
Comments 7 pages, 1 figure, 2 tables
学习何处模拟:在线PDE代理训练的生成式主动采样
机构 * Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) ; Inria(法国国家科学研究中心) ; CNRS(法国国家科学研究中心) ; Grenoble INP(格勒诺布尔研究所) ; LIG(实验室)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出在线生成式主动采样(OGAS),通过扩散模型学习配置参数与代理性能的关系,主动采样高难度区域,显著降低尾部分布误差,提升代理最坏情况可靠性。
当归因补丁说谎时:诊断与二阶修正
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 研究归因补丁(梯度一阶近似)在机制可解释性中的不可靠性,发现主要误差源于下游网络的非线性,并提出可靠性评分、误差界和HVP二阶修正方法。
Comments 30 pages, 12 figures
CANVAS: 用叙事视觉音频AI系统为艺术配文
机构 * BASIS Phoenix High School(BASIS凤凰高中)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 提出一种自动化工作流,利用大语言模型和文本转语音服务生成多感官艺术描述和同步音频解说,在20秒内以低于0.05美元的成本生成文本加音频输出,显著提高词汇多样性和叙事细节。
Comments 22 pages, 16 figures, 3 tables, 21 references
Ishigaki-IDS:一种面向建筑信息模型中信息交付规范起草的开放权重验证器感知模型
机构 * ONESTRUCTION Inc.(ONESTRUCTION公司) ; AWS GenAI Innovation Center(AWS生成式AI创新中心)
专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.SE
AI总结 针对BIM项目中IDS编写瓶颈,提出开放权重LLM Ishigaki-IDS,结合持续预训练、监督微调和基于验证器奖励的强化学习,生成可通过外部验证器检查的IDS草案,在基准上显著优于基线,并减少54.7%工作时间。
Comments 8 pages, 2 figures, 5 tables. Preprint
RiskNet:一个来自新闻的大规模AI风险事件数据集,包含对齐和多维标注
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(多模态数据智能感知与治理北京市重点实验室)
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出RiskNet,一个从多语言新闻构建的大规模AI风险事件数据集,通过结构化流水线进行事件识别、对齐和多维分类,支持AI安全、治理和风险分析研究。
Comments The manuscript has been submitted to Scientific Data
恢复潜变量的非线性函数:合理值神经网络框架
专题命中 工作流自动化 :workflow(abstract);分类 cs.LG
AI总结 该研究提出PV-ANN框架,通过埃尔米特多项式展开推导边界,在非线性低信度条件下可大幅缩小潜变量非线性函数的恢复差距,且预测准确率未提升,符合理论预期。
Comments 51 pages, 4 figures, 24 tables. Data, materials, and code: https://doi.org/10.7910/DVN/KD61HA
规范增量驱动的数据治理:以“规范增量(spec-delta)”作为湖仓数据平台变更单元的实证研究
专题命中 工作流自动化 :workflow(abstract);分类 cs.AI
AI总结 本研究通过对照实验,验证以spec-delta为变更单元的数据治理工作流,可减少缺陷、降低评审认知负荷,提供避免过度规范的指南,而非开发工具。