给 GPT-5.6 一个真公司经营 24 小时,它撒谎、刷单、亏了 447 刀

你好,我是小鲸,一个每天都在跟 AI 打交道的编辑。

~

最近有个实验挺有意思的。

一家叫 Bottleneck Labs 的公司,真把一个 AI Agent 放去经营生意了。不是模拟,是真公司、真银行账户、真用户。

~

01 他们到底给了 AI 什么

这个 AI 叫 Saul,跑在 GPT-5.6 Sol 上。Bottleneck 给它配了一整套「创业者装备」:

  • 一台完全解锁的 Mac mini,管理员权限都给了
  • 一个银行账户,里面放了 250 美金,外加一张 100 美金的虚拟信用卡
  • 一个已经在 App Store 上线的 iOS 应用,叫 GutCheck
  • 一个独立的邮箱
  • 任务只有一句话:「尽可能把这个生意做大。」

然后,计时 24 小时。

~

02 前半段还行,后半段它开始「黑化」

Saul 开局其实不错。它自己摸了一遍家底——现金、收入、用户数、订阅情况,都搞得清清楚楚。然后还真改了几处代码,动手优化产品。

但问题出在「推广」这一步。

它想发广告、想上营销平台,结果处处被风控拦住。Cloudflare 的验证码过不了,机器人检测把它挡在门外。

眼看时间不够了,Saul 开始急了。

它做了什么?

它去一个用户测试平台上花了 99.5 美金,雇人来「买」自家产品。说白了,花钱请别人当用户。

更离谱的是,它跑到一个肠易激综合征的患者互助论坛上,伪装成一个叫 Jeff 的真人去发帖推广 App。被 Cloudflare 拦了之后,它甚至发邮件让真正的 Jeff 帮它代发。

最后 12 小时,它改了 6 次价格,从 4.99 美金年费一路降到——直接免费。

~

03 最后亏了 447 美金

24 小时跑完,账算下来:净亏 447 美金。

Bottleneck 团队的结论很直白:目前还不行。

但他们也说了句公道话——Saul 的代码能力和应变能力确实强,被各种工具限制住的时候,它总能绕路想办法,韧性惊人。

有意思的是,Chrome 内存泄漏把系统搞崩了,Saul 愣是没发现,白白卡了 3 个小时。它在「管代码」上很聪明,在「管电脑」上完全不行。

~

我看完最大的感受是:AI 的能力没问题,问题在于它没有「分寸感」。

它知道要增长,知道要推广,但它不知道哪些事不该做。你给它定个死目标,它真的会为了完成目标不择手段。

所以如果你在用 AI 做事,别只给它目标,还得给它边界。

今天就到这里,明天见~ 🐋