别再来回聊!AI临时做个表单,对话3.4轮降到1.2轮
微软研究院、香港大学等机构提出GenUI-Harness,让AI遇到模糊需求时临时生成一个可操作的界面。用户勾选偏好,AI再据此完成数据库任务。论文的用户研究中,交互从平均3.4轮降至1.2轮;结构化表单把原本散落在聊天里的选择集中到一起。
微软研究院、香港大学等机构提出GenUI-Harness,让AI遇到模糊需求时临时生成一个可操作的界面。用户勾选偏好,AI再据此完成数据库任务。论文的用户研究中,交互从平均3.4轮降至1.2轮;结构化表单把原本散落在聊天里的选择集中到一起。
Anthropic发布Haiku 5.5,在提示词不超过10万Token时,输入、输出单价均比上一代低90%,性能超越DeepSeek V4.1Flash和GLM-5.3-Flash两大性价比模型,成为新的性价比担当。并向Max和Team用
浙江大学团队提出nanoMuse,把手机、电脑和网页端组织成同一个个人Agent:多个设备共享会话,每台设备在自己的运行环境里执行任务。记忆保存成用户能读、改、撤回的文件,工具调用先经过规则检查。项目展示了跨设备对话与任务协作的系统结构,用
斯坦福大学、约翰斯·霍普金斯大学、麻省理工学院、马克斯·普朗克智能系统研究所等机构提出4DCodeBench,让AI观看视频并编写能重建场景运动的图形代码。18个模型在200个场景中接受检验,榜首模型静态成绩0.91、动态0.67。评测把外
Impossible Research、加州大学伯克利分校与卡内基梅隆大学提出Schema,让Agent把未知环境规律写成可执行程序,再用历史转移逐步验证和修正。论文在ARC-AGI-3的RHAE指标上把同一基础模型从58.7%提高到99.
清华大学、加州大学洛杉矶分校、日本理化学研究所AIP与耶鲁大学等推出OSWorld-Science,把电脑Agent放进统计、生物医学、地理信息和工程仿真等真实科研软件。评测不只看是否点到按钮,而是检查交付文件、数值精度与完整工作流,揭示“
NVIDIA、普林斯顿大学与马里兰大学提出PivotOPD,专门找出Agent轨迹中决定成败的错误转折点,再分别训练“别犯错”和“犯错后如何恢复”。论文中1.7B学生在ALFWorld平均成功率达73.7%,在WebShop达76.6%;这
OpenAI重新开放每月200美元的Pro 200,但新订阅额度已缩水;现有用户也将在10月30日从20倍Plus用量降至10倍,价格不变。一个月前,Anthropic刚把Claude Code“永久提高25%”写成喜讯,实际却比当时额度少
清华大学、智曼公司、北京大学、浙江大学等机构联合建立EngiWorld,用1,301项任务检验Agent能否跨26款专业工程软件完成设计闭环。七个前沿模型中最强者EngiScore仅44.3,多软件任务的尝试成功率只有3.6%,由此暴露真实
Google Research、南加州大学、Google DeepMind、哈佛大学等机构联合提出TabFM-Auto,让Agent围绕冻结的表格基础模型自动修改数据流水线。它在TabArena的51个数据集上由五种配置包揽总榜前五,最佳方
当地时间2026年9月28日,Anthropic发布Claude Sonnet 5.5,即日起上线Claude应用、Claude Code、API及主流云平台。新模型主打日常编码与文档表格制作,输出提速30%以上,单任务开销较上代最多降30
香港大学、新加坡国立大学、香港中文大学(深圳)等机构推出ORCA,专门测试大模型能否把数据科学代码从一个软件库迁移到另一个库,同时保持结果正确。论文不仅测短代码片段,还测完整项目。在项目级任务中,受测的Claude-Opus-4.6成功率为
上海交通大学与阿里巴巴通义实验室等机构提出GUI-Hopper,让手机AI助手在适合时使用应用的深层链接,直接打开目标页面,而不必每次都从首页逐层点击。团队先从应用中找出可能的入口,再用真机核验链接会落到哪里,并保留普通点屏操作作为兜底。在
圣母大学联合IBM研究院、微软研究院、MIT对17个语言模型做了一次受控审计。在允许钻空子的条件下,74.6%的尝试被确认为奖励黑客,而且评审反馈越详细,模型越会学着逃逸。这给“把科研交给AI”敲响了实打实的警钟。
字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等机构提出EmbodiedSWE,让编程智能体先在仿真中为长时序机器人任务写出可验证解法,再将单个解法扩展成多样训练轨迹。仅用这些仿真示范微调的VLA最终完成了一项真机长时序任务。
斯坦福大学、普林斯顿大学提出TANDEM,让任务与运动规划器先做掉熟悉步骤,只在能力缺口处请人遥操。在一项代表性长时序任务中,相同人工介入时间能采集2.9倍示范;每项20条示范微调后,五项任务平均成功率从0%升至60%。
英伟达、麻省理工学院与南洋理工大学等机构联合推出高效率编程智能体框架SoL-Pi,攻克了自主软件工程中的Token与成本激增难题。研究团队构建自动化研究循环,由AI智能体自主探索并提炼出四项底层交互压缩机制,在不损伤任务解决率的前提下将To
近年来多模态大模型在虚拟环境决策中取得飞速进展,但始终缺少针对商业级AAA游戏的标准化评测体系。腾讯ARC实验室联合大湾区大学、香港中文大学和新加坡国立大学等机构推出了首个GameHorizon评测套件,全面接入21款主流大作。研究团队通过
小米正式开源Xiaomi MiMo-V2.6模型。在国际基准Artificial Analysis综合智能指数中,MiMo-V2.6-Pro以46分超越Kimi K3与Qwen3.8 Max,登顶全球开源榜首。其API加权任务成本仅0.13
字节跳动旗下海外企业技术服务平台BytePlus正式推出企业级全链路AI短剧生产平台Dramagic。制作团队上传剧本即可全自动拆解男主、女主与反派的角色三视图、场景及造型,并智能生成分镜提示词与分镜表。配合3D虚拟导演台与全局风格锁定,攻