Finch: Toxicity Dose Response Curve Prediction of Chemical Compounds and Mixtures
Finch:化学化合物及混合物的毒性剂量反应曲线预测
专题命中 工作流自动化 :workflow(abstract)
AI总结 Finch整合多任务定量构效关系模型,解决传统混合物模型的局限,实现化学化合物及混合物的毒性剂量反应曲线预测,助力监管安全评估。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Finch:化学化合物及混合物的毒性剂量反应曲线预测
专题命中 工作流自动化 :workflow(abstract)
AI总结 Finch整合多任务定量构效关系模型,解决传统混合物模型的局限,实现化学化合物及混合物的毒性剂量反应曲线预测,助力监管安全评估。
用于水下海底海带林分割的深度学习架构比较评估(基于Kelp-o-Tron)
专题命中 工作流自动化 :workflow(abstract)
AI总结 该研究评估三种深度学习分割框架对水下海带林的分割性能,发现ResNet50-DeepLabV3(即Kelp-O-Tron)在准确率、鲁棒性和泛化性上表现最优,相关资源可用于水下生境制图与生态监测。
ColorA11Y:利用即时色彩无障碍建议优化创意设计工作流
专题命中 工作流自动化 :workflow(abstract)
AI总结 ColorA11Y系统在设计创作全程提供即时色彩无障碍建议,经用户研究验证可优化工作流,推进将无障碍考量融入创意过程的原生设计方法。
Comments To appear in ASSETS '26: The 28th International ACM SIGACCESS Conference on Computers and Accessibility (October 25-28, 2026, Vila Nova de Gaia, Portugal)
面向开放学术基础设施的计算架构定义
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出分层框架定义开放学术基础设施(OSI)计算单元架构,结合开放引文实际案例,为OSI计算模块设计提供实用参考与方法论基础。
大规模哈密顿学习
专题命中 工作流自动化 :workflow(abstract)
AI总结 本研究利用张量网络技术规模化含噪声的哈密顿学习,给出误差解析界并模拟验证其稳定性,实现N=300自旋链的混合场伊辛模型哈密顿量学习,为相关实验提供经验。
Comments 7 pages, 3 figures, comments welcome
GravDyn:用于非规则天体引力建模的Python框架,采用多面体、质量集中块(mascon)及级数展开方法
专题命中 工作流自动化 :workflow(abstract)
AI总结 该研究提出开源Python框架GravDyn,整合三种引力建模方法,可高效计算非规则天体的引力势与加速度,适用于小天体相关的航天任务设计与轨道研究。
一种用于实际量子硬件上信用估值调整的噪声感知量子算法
专题命中 工作流自动化 :workflow(abstract)
AI总结 研究针对信用估值调整问题,开发端到端噪声感知量子工作流程,引入对比感知贝叶斯迭代量子幅度估计,经硬件校准实验验证其有效性,能更有效利用设备放大能力,降低经典后处理运行时间,并分解CVA误差。
Comments 56 pages, 14 figures, 18 tables. Includes supplementary appendices with implementation details, extended results, calibration data, and quantum-resource analysis
贝叶斯决策理论在不确定性下的野生动物管理中的应用:从推断到行动
专题命中 工作流自动化 :workflow(abstract)
AI总结 本文提出基于贝叶斯决策理论的实用工作流程,通过两个案例展示如何在不确定性下平衡生态、经济和社会目标,提升管理决策的透明度和可重复性。
Comments 3 figures
超越可执行模型:用于物理系统建模的Pufibara智能体框架与Modelica智能体工作流基准
专题命中 软件智能体 :agent(title,abstract);workflow(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 该研究针对物理系统建模中智能体的状态管理与证据关联问题,提出Pufibara智能体框架,并构建含232个任务的基准,实验显示其在任务成功率与资源效率上优于Claude Code。
PACT:面向FPGA时序收敛的后路由代理检查点调优
专题命中 软件智能体 :agentic(title,abstract);agent(abstract,abstract_cn)
AI总结 本文提出PACT框架,用于Vivado设计检查点的后路由调优,在35个UltraScale+检查点上将F_max几何平均提升22.30%,速度较DATuner快6.4倍,令牌成本仅0.16美元/ DCP。
Comments Accepted to the 2026 International Conference on Field-Programmable Technology (FPT 2026)
Pomona:通过小型自动化变更实现彭博社的持续代码质量改进
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE
AI总结 提出Pomona轻量级代理工具,通过扫描和修复技能自动发现并修复代码问题,生成约10行差异的小型PR,经一个月团队部署和10名高级工程师问卷评估,17个PR中15个成功合并,中位关闭时间低于2小时,8/10工程师愿意采用。
Comments 6 pages, 2 figures, 1 table, camera-ready version accepted for the Industry Track at ISSRE'26
打破以用户为中心的代理:一个三方框架用于基于代理的推荐
专题命中 软件智能体 :agent(title,abstract);agentic(abstract)
AI总结 本文提出一个三方框架TriRec,用于基于代理的推荐系统,旨在协调用户效用、物品曝光和平台层面的公平性,从而提高推荐系统的准确性和公平性。
DeepRepoQA:基于深度智能体探索的代码仓库问答系统
专题命中 软件智能体 :agent(title);agentic(abstract);分类 cs.CL、cs.SE
AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。
O3N: 全向开放词汇占用预测
机构 * Hunan University(湖南大学) ; Zhejiang University(浙江大学)
专题命中 软件智能体 :autonomous agent(title,abstract)
AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。
Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N
ReproAgent:基于合约引导的论文到代码复现
机构 * Beihang University(北京航空航天大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Minzu University of China(中央民族大学) ; Zhongguancun Academy(中关村科学院)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 ReproAgent是基于合约引导的四阶段论文到代码复现流水线,在PaperBench Code-Dev基准上,其在两种骨干模型的同架构支架中取得最高平均得分,相关产物已公开。
Comments Accepted to Findings of EMNLP 2026
Paritok-4B:面向编码智能体的意图条件上下文压缩模型
机构 * Paritok
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对编码智能体上下文占比过高的问题,提出意图条件抽取式压缩模型 Paritok-4B,在 SWE-bench Lite 上实现高压缩率的同时,未显著降低求解率,且成本更低、可自托管。
Comments 20 pages, 1 figure, 10 tables
Quasar:一种专门用于LLM代码操作的编程语言
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。
Journal ref Third Conference on Language Modeling (COLM 2026)
SkillForge:为强化学习智能体演化可验证技能
机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 SkillForge是实现技能验证与优化的持续技能演化框架,通过明确技能使用优化RL决策,在ALFWorld等数据集上优于SkillRL,可训练更强的LLM智能体。
交接代价:在大语言模型智能体中延续非原生轨迹
机构 * AWS, Agentic AI(亚马逊云科技智能体人工智能部门)
专题命中 软件智能体 :tool use(abstract);分类 cs.AI
AI总结 该研究聚焦大语言模型智能体的交接代价,通过对比Claude和GPT系列模型的不同交接设置,发现完整轨迹升级质量提升有限且成本高,降级更具优势,且交接接口偏好随方向反转。
增强TianoCore UEFI固件开发社区中的漏洞报告模板
专题命中 软件智能体 :planning(abstract);分类 cs.SE
AI总结 本研究针对TianoCore核心项目EDK II,通过分析漏洞数据发现关键信息缺失问题,拟在GitHub Issues的漏洞报告模板中新增字段,计划经开发者反馈调整及A/B测试验证,以优化UEFI固件漏洞分类与解决流程。
Comments ACM International Workshop on Firmware Testing and Analysis (FTA) 2026, Co-located with ISSTA 2026
预取器为何失效?让智能体来解答
专题命中 软件智能体 :agent(abstract)
AI总结 该研究提出智能体驱动的自动研究流程构建预取器混合模型MoP,在SPEC CPU2006/2017上实现61.1%几何平均IPC加速,超越多款人工设计预取器,为硬件预取器设计提供新路径。
Comments Fixed a minor typo in Fig. 4
MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试
机构 * Alibaba(阿里巴巴)
专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);planning(abstract);agentic(abstract)
AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。
WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界
专题命中 GUI与网页智能体 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。
Comments 8 pages, 1 figure, AAAI2027
WiCi:无线GPU计算基础设施
专题命中 GUI与网页智能体 :agentic(abstract,abstract_cn)
AI总结 针对移动设备本地推理性能不足、云端推理成本高的问题,本文提出WiCi无线GPU计算基础设施,可让移动设备通过WiFi接入服务器级GPU,大幅提升推理性能并支持更大模型,性能接近服务器级GPU原生表现。
BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模
机构 * Zhejiang University(浙江大学) ; Tencent(腾讯)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。
直接语料库交互中的证据失明:基于AtlasNav的持久导航
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI
AI总结 针对直接语料库交互中存在的证据失明问题,提出AtlasNav框架,通过一次性构建语料库图谱实现自适应导航,在BrowseComp-Plus等数据集上提升了准确率并降低了推理成本。
Comments 27 pages, 7 figures. Code, data, and trajectories will be released
从自然语言需求到图形用户界面:基于预训练语言模型的自动原型设计与验证
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE
AI总结 本研究针对将自然语言需求转化为GUI原型及GUI应用需求验证的两大挑战,提出基于预训练语言模型的自动化方法,可显著减少相关手动工作量。
Android GUI智能体对运行时异常是否具备鲁棒性?AnTrap:在动态对抗环境中评估智能体
机构 * Zhejiang University(浙江大学) ; Yale University(耶鲁大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tongji University(同济大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本研究针对Android GUI智能体抗运行时异常鲁棒性不足的问题,提出AnTrap基准评估框架,发现16款领先GUI模型普遍受动态异常影响,且深度上下文陷阱暴露模型内在局限性。
AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。
Comments 7 pages, 3 figures, 4 tables, Code is available at: [https://github.com/XuPeng23/AeroDPO]
IMAC-AgriVLN:农业视觉与语言导航智能体能否意识到指令错误?
机构 * China Agricultural University(中国农业大学) ; China Agricultural University-Sichuan Advanced Agricultural & Industrial Institute(中国农业大学-四川先进农业与工业研究院)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 针对农业VLN中指令可能错误的问题,提出A2A-MI基准和IMAC模块,通过分析指令与前方图像判断并纠正错误,显著提升导航性能。