GPT-6 Astra 在 24 小时内自己打通《Portal》,花掉大约 571 美元 token 费;同一周,OpenAI 又把它推到企业工作场景和 Amazon Bedrock 里。我的判断很简单:Astra 的热闹不在“会不会玩游戏”,而在它已经开始把长时间操作、花钱决策和企业权限绑到一起。
这类模型最容易被讲成能力神话。能看屏幕、能操作软件、能写代码、能在几十步之后还记得目标,听上去像一个终于能干活的数字员工。The Decoder 报道的 Portal 实验很适合做一个压力测试:任务目标给出后,Astra 通过 MCP 和工具链读取截图、位置、视角,再决定下一步输入。它不是在聊天框里回答“怎么通关”,而是在一个有状态的环境里持续行动。
真正贵的不是 token,是中途没人看见它在想什么
Sebastian Raschka 的分析把另一个问题摊开了:围绕 Astra 的讨论不只在分数,也在 looped transformers、隐藏推理链和可解释性。独立基准当然有参考价值,他也提到 Astra 在数学、代码、图形任务上很强,ARC-AGI-3 的提升尤其刺眼。但企业买模型,不会只看排行榜。
企业怕的是另一件事:模型能连续做事以后,错误也会连续发生。一次普通回答错了,最多重问;一个代理拿到浏览器、文件、终端和报销流程,错一步可能变成删文件、乱下单、把内部资料带到外部工具。Portal 的 571 美元账单只是一个小提醒,真实公司里的账单可能是云资源、合规责任和权限事故。
推理链是否公开,听起来像研究圈争论,其实会直接影响产品设计。用户不一定需要看到模型每一步“心里话”,但公司至少要知道它为什么调用这个工具、为什么越过那个页面、为什么把预算继续烧下去。没有这层记录,代理越像员工,审计反而越难做。
这里的边界不能靠一句“请谨慎操作”解决。更现实的做法是把代理拆成几种权限档:只读、可修改、可花钱、可对外发送。每升一级,都要有明确的审批人和日志。Astra 这类模型的真实价值,很大一部分会被这些看似无聊的开关决定。
Bedrock 把问题从发布会搬进采购单
AWS 的文章说,GPT-6 Astra 已经在 Amazon Bedrock 上可用,可以通过 Bedrock API 调用,也能配置 ChatGPT Work 和 Codex 使用。这句话比宣传语更关键。模型进 Bedrock,意味着它要接受企业熟悉的那套东西:访问控制、审计、数据保留策略、区域可用性,还有采购部门能看懂的账。
所以我不太愿意把 Astra 写成“又一个更聪明的模型”。更像是 AI 代理从演示视频走进公司流程的一个信号。它越能干,越需要被限制在明确的边界里。能不能完成任务只是第一道门槛;能不能解释权限、记录动作、控制成本,才决定它能不能长期留在企业系统里。
普通用户也可以按这个规则看后面的 AI 发布:凡是强调“自主完成复杂任务”的产品,都要顺手问一句,它失败时谁负责,花钱时谁确认,碰到敏感数据时谁拦住。回答不上来,再高的分数也只能先放在沙盒里。
消息来源
- OpenAI RSS:GPT-6 Astra: The next generation in intelligence for work,https://openai.com/news/rss.xml
- Sebastian Raschka:GPT-6 Astra, Looped Transformers, and Hidden Reasoning,https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and
- The Decoder:GPT-6 Astra beat Portal start to finish without human help in under 24 hours,https://the-decoder.com/gpt-6-astra-beat-portal-start-to-finish-without-human-help-in-under-24-hours/
- AWS:Take on your most ambitious work with GPT-6 Astra on Amazon Bedrock,https://aws.amazon.com/blogs/machine-learning/take-on-your-most-ambitious-work-with-gpt-6-astra-on-amazon-bedrock/
- Hacker News 首页:Raschka 文章在本次抓取中显示 332 points、117 comments,https://news.ycombinator.com/