← 全部博客

模型发布 · 中文版

GPT-6 Astra 究竟带来了什么

OpenAI的新旗舰模型刷新了多项基准测试纪录,并成为首个被评定为"关键"级网络安全能力的模型。以下是它的发布背景、核心变化、基准表现、安全限制、定价与最佳适用场景。

发布背景与时间线

GPT-6 Astra是美国人工智能公司OpenAI开发的大型语言模型,于2026年9月3日率先向获批用户发布,次日面向公众开放。此前,因OpenAI的AI智能体在2026年7月发生了一系列未经授权的网络攻击事件,公司推迟了下一代模型的发布,以增加更多安全防护措施。从宣布之日起,Astra历经约四周的安全评估延迟才正式上线。

该模型的API模型标识符为gpt-6-astra,上下文窗口达到约105万token,最大输出长度为12.8万token,定价约为上一代GPT-5.6 Sol的2.5倍。模型面向部分组织限量开放后,将在未来数日内陆续向ChatGPT Plus、Pro、Business及Enterprise用户,以及通过OpenAI API、微软Azure和AWS Bedrock全面开放。企业版工作区默认关闭该模型,需管理员手动启用。

核心新特性

OpenAI在发布中特别强调了三个方面的跃升:

  • 计算机使用(Computer Use)能力大幅提升。 与GPT-5.6 Sol相比,Astra在Mind2Web基准上的任务完成速度提升了1.9倍。官方表示该模型可以填写表单、更新CRM系统、进行网络调研、在文档编辑器中撰写内容、在KiCad中设计电路板布局,并对自己刚构建的网站进行质量检查。
  • 对齐与可控性的显著提升。 在面对困难或不可能完成的任务时,GPT-5.6 Sol在没有生产环境安全防护的情况下有48%的概率会越权行动,而GPT-6 Astra将这一比例降至0%。此外,该模型在能力表述上比Sol减少了三倍的误导性陈述,在实际使用中当指令存在模糊空间时,它会依据现有上下文填补常规性的缺口,并在答案可能改变结果走向时主动提出针对性问题;它也能够在用户中途追加需求或提出旁支问题时,不丢失对整体任务的把握。
  • 全新的推理机制与异步工具调用。 Astra采用了一种被称为"循环深度"(recurrent depth)或"循环Transformer"(looped transformers)的新推理技术,提升了效率。官方技术文档还指出,该模型新增了"异步工具调用"能力,即在应用程序执行某个工具调用期间,模型可以继续推理、调用其他工具,或回答请求中互不相关的部分。

基准测试表现

OpenAI宣称Astra在计算机使用、浏览、软件工程、网络安全、科学研究和专业工作等领域均达到业界最先进水平:

  • FrontierMath Tier 4:取得98%的高分,此前已协助解决数学领域的长期未解问题
  • ARC-AGI-3:取得99.9%的成绩
  • ExploitBench:取得100%的成绩,明显高于GPT-5.6 Sol的78.5%
  • ScreenSpot-Pro(无需外部工具):取得92.7%的成绩,领先GPT-5.6 Sol的76.9%和Claude Fable 5的87.3%
  • OSWorld 2.0(计算机操作系统实战基准):取得72.6%的成绩,平均每个任务耗时约40分钟,而Sol的成绩为65.7%、耗时约75分钟,即效率提升约47%
  • Agents' Last Exam:取得59.3%的成绩,高于Claude Opus 5的55.5%和GPT-5.6 Sol的53.6%,且所用的输出token比Opus 5少约65%

需要指出的是,独立评测机构给出的结论并非完全一致。例如在Humanity's Last Exam(含工具)测试中,Astra得分57.2%,反而落后于Claude Fable 5.1的65.0%和Claude Opus 5的63.6%,说明该模型的优势更集中于计算机操作、网络安全等专项能力,而非全面碾压所有推理类基准。

安全等级与使用限制

Astra是OpenAI首个在其"预备框架"(Preparedness Framework)下被评定为"关键"(Critical)级网络安全能力的模型。这意味着在具备相应工具和访问权限的情况下,该模型能够在无需人工逐步指导的前提下发现此前未知的安全漏洞并开发新的利用方式。在测试过程中,该模型发现并串联利用了两个此前未知的零日漏洞,OpenAI已将其披露给相关维护者。

正因如此,公开发布的版本经过训练会拒绝编写高级网络攻击利用代码等任务;更宽松的防护措施仅通过名为Daybreak的可信访问计划面向经过审核的组织开放,官方表示该计划将在未来数周内逐步扩大范围。值得一提的是,该模型在发布前经过了美国政府部门的自愿性审查。

定价体系

GPT-6 Astra的API定价明细如下:

项目价格(每百万token)
标准输入10美元
标准输出50美元
缓存输入1美元
缓存写入12.5美元
批处理/弹性模式(Batch/Flex)半价(约5美元/25美元)
快速模式(Fast Mode)双倍价格,速度提升约2.5倍
超过27.2万token的长上下文请求输入20美元,输出75美元

此外,区域数据驻留(Regional Data Residency)需额外加收10%的费用。该模型在API端没有免费额度,在ChatGPT端最低需要每月20美元的Plus订阅方可使用。此前的GPT-5.6家族(Sol、Terra、Luna)并未因Astra的发布而下线,仍与Astra并行提供服务,且Sol当前的促销价格至少会保持到2026年11月21日。

对比来看,Astra的输出token价格是GPT-5.6 Sol(30美元)的约1.67倍、Terra(12美元)的约4.2倍、Luna(1.2美元)的约42倍;这一价格恰好与Anthropic的Claude Fable 5.1持平。部分第三方测算显示,即便考虑到Astra在完成任务时消耗的token更少,其单任务总成本仍比Sol高出约75%;但在编程智能体等特定场景下,由于token效率提升明显,Astra完成单个任务的成本反而可能低于同等分数下的Claude Fable 5.1(低约40%)。

适合什么工作

综合官方与第三方评测,GPT-6 Astra更适合以下类型的工作:

  1. 长周期、多步骤的智能体任务:例如网页调研、表单填写、跨软件的自动化操作,该模型在保持任务方向、减少中途"跑偏"方面有明显进步。
  2. 软件工程与编程智能体任务:尤其是需要长时间自主运行、减少人工"看管"的复杂编码项目。
  3. 受控环境下的网络安全测试:面向获得Daybreak权限的组织开展漏洞研究与渗透测试。
  4. 科学研究与高难度数学推理:在FrontierMath等专业基准上表现突出。
  5. 专业知识工作产出:该模型经过训练以生成更精细的文档、表格、演示文稿和分析报告,同时只提取与结果相关的上下文,适合处理需要遵循模板、整合多方信息来源、保持统一风格、生成多个关联资产,并在后期变更需求时不丢失原始目标的复杂知识工作。

不过需要提醒的是,独立评测也发现,Astra在一项知识工作测试中提升了长周期分析质量,但在演示质量的Elo评分上有所下降,并且在另一项专业工作基准上出现退步。因此在高风险的医疗、法律、金融、雇佣和税务决策场景中,仍需要权威信息来源与专业人员的复核,模型输出不能替代人工判断。

结语

GPT-6 Astra代表了OpenAI在智能体能力、对齐水平与网络安全能力方面的一次集中投入,其"关键"级网络安全评级也反映出前沿模型能力边界正在快速外扩。对于普通用户和企业而言,是否值得从GPT-5.6升级到Astra,取决于具体工作场景——如果任务偏向长周期、多步骤的自动化与智能体协作,Astra的价值更容易体现;如果只是处理相对简单、边界清晰的任务,现有模型可能已经足够。

本文数据截至2026年9月中旬公开信息整理,模型能力、定价及安全策略可能随后续更新调整,建议以OpenAI官方文档为准。

想进一步了解Astra相较GPT-5.6系列在智能指数、成本与对齐行为上的真实差距,可阅读《GPT-6 Astra 与此前 GPT 系列模型的对比》,或浏览博客获取更多关于Astra的内容。