ArchEval: Measuring AI Agents as Computer Architects
ArchEval:将人工智能代理作为计算机架构师进行评估
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ArchEval:将人工智能代理作为计算机架构师进行评估
专题命中 长上下文与记忆 :LLM(abstract)
AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。
何时不写入内存:管理来自相关代理痕迹的错误推广
专题命中 长上下文与记忆 :language agent(abstract)
AI总结 研究语言代理从执行痕迹写入可复用内存时何时应拒绝写入的问题,引入GovMem策略,通过估计依赖感知支持等进行决策,在测试中能减少错误推广。
Comments accepted by mlise 2026
HyFL-CLIP: 用于鲁棒长上下文理解的CLIP双曲微调
机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) ; IPAI ; INMC & AIIS(智能计算与人工智能研究所) ; Seoul National University(首尔国立大学)
专题命中 长上下文与记忆 :pretraining(abstract)
AI总结 提出HyFL-CLIP,通过双曲空间微调CLIP,利用跨流形相似性蒸馏和爱因斯坦中点聚合建模层次蕴含关系,提升长上下文理解鲁棒性,在文本扰动下长文本跨模态检索提升高达19.5%。
Comments Accepted to ECCV 2026. Project page: https://janeyeon.github.io/hyflclip
视觉运动策略中的记忆检索用于长期机器人控制
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。
Comments 16 pages, 5 tables, 8 figures
VL-MemKnG:结合时空知识图谱的混合记忆用于长程自我中心导航轨迹问答
机构 * Mobile Robotics Laboratory, Artificial Intelligence Center(移动机器人实验室,人工智能中心) ; Skoltech(斯科尔科沃科学技术学院) ; Intelligent Multimodal Vision Analysis Group, Department of Engineering, Universitat Pompeu Fabra(智能多模态视觉分析组,工程系,庞培法布拉大学) ; Independent Researcher(独立研究员)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 提出VL-MemKnG混合记忆框架,结合时空知识图谱与片段级上下文记忆,通过混合检索推理模块提升长程自我中心视频导航问答的准确性和效率。
面向长时任务的视觉运动策略短期记忆扩展
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Toyota Research Institute(丰田研究院)
专题命中 长上下文与记忆 :pretraining(abstract)
AI总结 提出PRISM架构,通过门控注意力与层次化压缩扩展视觉运动策略的短期记忆至两分钟,在ReMemBench基准上超越现有方法5%-12%。
Comments 14 pages, 9 Figures, 8 Tables
AnyGoal: 视觉-语言引导的多智能体探索实现免训练终身导航
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 长上下文与记忆 :language model(abstract)
AI总结 提出AnyGoal,一种免训练多机器人架构,利用视觉-语言模型(VLM)驱动前沿探索,通过共享2D高斯贝叶斯价值图(BVM)协调智能体,实现终身证据积累,在GOAT-Bench上达到52.4%子任务成功率,优于模块化方法27.7个百分点。
Comments 17 pages, 3 figures
小巧、免费且高效:编排开放权重的小型语言模型以在恶意软件分析中超越单个大语言模型
专题命中 推理与问题求解 :SLM(summary_cn,abstract);LLM(title,abstract);language model(title,abstract);small language model(title,abstract)
AI总结 研究恶意软件分析中,小型语言模型编排集成能否超越单个大语言模型。通过测试多种模型建立基线,设计评估四种编排架构,其中混合系统表现出色,总体准确率超专业和前沿基线,证明基于证据的编排可提升SLM性能。
Comments To appear in Proceedings of the 29th International Symposium on Research in Attacks, Intrusions, and Defenses (RAID)
我的机器人为什么刚改变了人格?面向基于大语言模型(LLM)的人机交互(HRI)的具身机器人人格提示设计指南
机构 * RPTU Kaiserslautern(凯泽斯劳滕工业大学) ; Linköping University(林雪平大学) ; University of Hertfordshire(赫特福德大学) ; Eindhoven University of Technology(埃因霍温理工大学) ; Australian National University(澳大利亚国立大学) ; University of Cambridge(剑桥大学) ; University of Naples Federico II(那不勒斯费德里科二世大学) ; Ben-Gurion University of the Negev(本-古里安大学内盖夫分校) ; The Azrieli National Center for Autism and Neurodevelopment Research(阿兹列利国家自闭症与神经发育研究中心)
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文针对基于LLM的HRI中机器人人格模糊等问题,提出含八个组件的提示设计框架及指南,为HRI研究提供结构化设计与报告辅助,强调提示设计需作为社会技术问题处理。
Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
比较BERT句子对分类与少样本LLM提示在检测德国气候新闻中的威胁和解决方案框架
机构 * University of Graz(格拉茨大学) ; Technical University of Graz(格拉茨技术大学)
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对德语气候新闻句子级框架检测,比较了微调BERT(句子对分类)与少样本LLM提示(Llama 4)方法,BERT在F1上达到0.83,优于LLM的0.78。
Comments 15 pages
LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试
机构 * Independent researcher, Switzerland(瑞士独立研究员)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。
Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit
LLM 能读频谱图:无编码器的语音语言建模
机构 * Microsoft, USA(微软公司,美国)
专题命中 推理与问题求解 :LLM(title,title_cn);language model(title,abstract);large language model(abstract)
AI总结 提出 Mel-LLM,一种无需专用语音编码器、直接将梅尔频谱图补丁通过线性投影输入 LLM 的架构,在 ASR 和 TTS 任务上验证了其可行性,ASR 性能与有编码器方案相当,TTS 初步可行。
使用概率程序训练大型语言模型的归纳推理
机构 * Princeton University(普林斯顿大学) ; Princeton AI Lab(普林斯顿人工智能实验室)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)
AI总结 提出基于程序的后验训练(PPT)方法,利用LLM生成概率程序场景,通过推理产生分布目标,微调模型以提升归纳推理准确性、与人类判断的一致性及校准能力。
Comments 20 pages, 5 figures
大语言模型作为预测规划器:时间序列基础模型的免训练文本条件设定
机构 * Deakin University(迪肯大学) ; Applied Artificial Intelligence Initiative(应用人工智能倡议)
专题命中 推理与问题求解 :LLM(title,summary_cn);foundation model(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究文本条件时间序列预测问题,核心方法是将预测设为TSFM生成轨迹上的规划问题,以冻结TSFM为模拟器、LLM为策略和价值函数,实例化\rc{}框架,主要贡献是通过实验证明该框架能带来持续改进。
面向长时域船舶轨迹与目的地预测的推理型大语言模型
机构 * Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所) ; The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室) ; Meituan Inc., Shenzhen, China(美团(深圳)) ; Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心) ; Nankai University(南开大学) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)
AI总结 提出基于可验证奖励强化学习(RLVR)的Maritime LLM后训练框架,将轨迹转化为语义文本,通过物理有效性约束和层次匹配提升长时域(30天)预测精度,4B模型表现最优。
Comments The IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026, Naples, Italy
评估人类与大型语言模型的心智化能力
机构 * University of Birmingham(伯明翰大学) ; Virginia Tech(弗吉尼亚理工大学) ; University of Oxford(牛津大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 本研究以两项经济博弈结合认知计算建模,对比测试DeepSeek等四款LLM智能体与人类参与者,发现不同LLM心智化能力有差异,GPT-5表现优于人类,证实认知计算建模可用于评估人机比较智能。
Comments 46 pages, 4 figures, 2 tables. Supplementary information available on request from the authors
用于结直肠癌治疗规划的智能体生成式大语言模型
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)
AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。
用于三维框架系统自动化结构分析的主体化大型语言模型
机构 * Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) ; School of Architecture, University of Miami(迈阿密大学建筑学院) ; HBC Engineering Company(HBC工程公司) ; Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)
AI总结 提出一种主体化LLM框架,通过投影表示和智能体流水线实现从自然语言输入到3D框架的自动化结构分析,平均准确率达90%。
LLM作为调查员:基于证据优先的鲁棒交互式问题诊断
机构 * University of Calabria(卡拉布里亚大学) ; University of Cambridge(剑桥大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。
迈向可靠稳健的LLM规划:符号反馈驱动的迭代自我精炼框架
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出符号反馈驱动的迭代自我精炼框架,通过自然语言提示、符号验证器和计划识别器增强LLM在长时域规划中的鲁棒性和可靠性。
LLM原生软件系统中生成流的图形概率建模
机构 * Departamento de Computación, FCEN, Universidad de Buenos Aires / ICC, UBA-CONICET(布宜诺斯艾利斯大学计算机系 / UBA-CONICET)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对LLM原生软件开发缺乏设计级推理的问题,提出基于图形概率模型的生成网络框架,用于文档化生成流并描述系统属性。
Comments Published at 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI (CAIN '26), April 12-13, 2026, Rio de Janeiro, Brazil
AI推荐的医生属于谁?大型语言模型辅助医生选择中声誉与人口统计信号的算法审计
机构 * Heidelberg University(海德堡大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究通过随机算法审计发现,LLM辅助医生选择时,声誉信号影响最大,人口统计信号存在倾斜但模型解释未体现,提出重复行为审计是合适的监测技术。
Comments 26 pages, 9 figures, 10 tables
FutureBridge:协作解码中超越局部偏好的令牌选择
专题命中 推理与问题求解 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 FutureBridge通过联合LLM-SLM令牌对SLM后续推理的支持度排序,在5个数学推理基准上使Qwen3-1.7B SLM的数学平均得分较贪心解码提升35.1%,超越了仅依赖LLM局部偏好的现有方法。
大型语言模型中思维链推理的平均场动力学
机构 * Tsinghua University(清华大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出框架,将LLM推理建模为线索图引导式发现过程,用平均场近似推导线索占比的常微分方程,实验验证所得统计规律可复现且能被该方程拟合。
推理的热力学特征:用于大型语言模型幻觉检测的自由能和谱形因子诊断
机构 * Talan Research & Innovation Center(Talan研究与创新中心)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出自由能签名(Fes)作为谱描述符,将注意力拉普拉斯视为哈密顿量并提取热力学势和随机矩阵理论谱形因子,用于检测LLM幻觉,无需训练即可实现高AUROC。
基于大语言模型的知识图谱推理中的幻觉检测
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 提出LUCID方法,结合LLM注意力分数、知识图谱语义和结构信息,利用图神经网络检测LLM在知识图谱推理中的幻觉,在九个数据集上达到最优性能。
Object Aligner: 一种可配置的图结构JSON模式相似度评分,应用于LLM提示优化
机构 * Artificial Intelligence Center, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院人工智能中心)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Object Aligner,一种基于递归树对齐和引用对齐的JSON相似度评分方法,通过Weisfeiler-Leman颜色细化近似图同构,用于LLM输出评估和提示优化。
Comments 28 pages, This is a submitted version of a manuscript under review at IEEE Access; it has not been peer reviewed
增强基于LLM的代码翻译:利用验证过的多语义表示
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出Multisage框架,通过提取和验证多语义表示(数据流图、类型约束等)来提升LLM代码翻译的准确性和可靠性,在HumanEval-X上翻译成功率提升至2.22倍。
QBugLM:基于LLM的量子软件调试的智能基准测试框架
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出QBugLM多智能体框架,自动化量子软件调试流程,通过案例研究评估LLM调试能力,发现迭代反馈显著提升修复成功率。
Comments This paper was accepted at IEEE QSW 2026
延迟验证破坏多智能体LLM信念:不稳定性阈值与最优校正器放置
机构 * Independent Researcher(独立研究者)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究多智能体LLM系统中延迟验证导致信念不稳定的问题,通过图论和谱分解推导出验证剂量的稳定性阈值,并提出贪心近似算法优化校正器放置。
Comments 20 pages, 5 figures, 1 table. Code and data: https://github.com/YehudaItkin/delayed-verification-llm