GPT-5.6 来了,Codex 没了,我想用它做个旧手机监控 App
大家可能听说了,7 月 10 日OpenAI 搞了一场发布会,发布了GPT-5.6,包含三个新模型。查了一下GPT-5.6 系列的三个型号:Sol(旗舰)、Terra(均衡)、Luna(性价比)名字来自拉丁语里的太阳、大地和月亮。我更新了Codex后已经可以使用这些模型了。
查了官网定价,Sol 每百万 token 输入 5 美元、输出 30 美元;Terra 减半,2.5 美元和 15 美元;Luna 最低,1 美元和 6 美元。三款模型 24 小时内全量上线,覆盖 ChatGPT、Codex 和 API。
GPT各模型价格链接: https://developers.openai.com/api/docs/pricing
编程是 GPT-5.6 的主战场,一下子有三个新的模型应该怎么选,我也很关心各个模型的实力。查了官网的评测:Sol 在 Artificial Analysis 编程智能体指数上拿了 80 分,比 Fable 5 高 2.8 分,输出 token 不到一半,耗时不到一半,成本便宜约三分之一。Terminal-Bench 2.1 和 DeepSWE 也刷新了最好成绩。Terra 略高于 Fable 5,Luna 超过 Opus 4.8,两者耗时都只有对手三分之一左右。 Agents' Last Exam 上Sol 拿下 53.6 分,比 Fable 5 高出 13.1 分。开中档推理也比对方高 11.4 分,成本只有四分之一。
所以看了这些感觉性价比不错。
但也不是全面碾压。SWE-Bench Pro 上 Claude Fable 5 是 80%,Sol 是 64.6%——精准修改单文件的场景,Claude 依然更强。FrontierMath 最难的 Tier 4 题目,Sol 的 65.9% 甚至不如自家上代 GPT-5.5 的 72.5%。OpenAI 强在规划和编排,Claude 强在执行。
网上资料还了解到这次还有个新玩法叫 ultra 模式。默认四个智能体并行,最多十六个,人多力量大。Terminal-Bench 2.1 上 Sol Ultra 干到 91.9%,GPT-5.5 同期 88.0%。官网的发布会视频上研究员的说法是:这些智能体能像一支有经验的团队那样拆分工作,有机会要去试一下的。
我更新codex应用后开始还以为搞错了,Codex变成了ChatGPT。后来才了解到Codex 独立 App 下线了,能力全部并入 ChatGPT。
还有一个让我在意的数字:GPT-5.6 的内测期间,研究员人均每日输出 token 量超过 GPT-5.5 时期最高水平的两倍。Lovable 联合创始人说新模型让用户构建应用的步骤少了约 25%,工具调用少 35% 到 48%。
话说到这份上,我脑子里冒出一个想法。
家里抽屉里躺着两部旧手机。儿子放暑假最近开始上网课,上周推开他的房门,数学课直播开着,他却在玩玩具。
想过买监控摄像头。但专门为网课买一套设备,总有种杀鸡用牛刀的感觉。我去应用商店搜了一圈监控类 App,要么限免后弹窗收费,要么塞满开屏广告。更要命的是,它们几乎全部要求把视频流上传到厂商服务器。一个家庭监控画面,为什么要经过别人家的云?
正好旧手机闲着,正好 GPT-5.6 Codex 合体了。我打算试试让 AI 帮我把旧手机改成一个纯局域网的家用监控设备。
功能需求已经想清楚了:旧手机端装上 App 当作摄像头,同一 WiFi 下另一台手机或电脑通过浏览器就能看实时画面、同步收听声音。录像全部存本地,不经过任何云端。监控时手机屏幕可以锁屏,同时绕过电池优化限制,防止系统杀进程。
纯局域网传输意味着什么?拿 Wireshark 抓包,数据包只在路由器内部兜圈,不会有一帧画面离开家门。
目前刚把需求梳理完,正式开发还没启动。后续会在公众号更新开发过程和踩坑记录,包括 GPT-5.6 在真实项目中的实际表现,以及各模型的切换策略。
如果你也有闲置旧手机,或者对家庭监控的隐私方案有想法,留言区聊聊。有没有什么你特别想要的功能?运动检测、夜间模式、多摄像头联动——需求收集得越多,开发方向越清晰。
