当前位置: 首页 > news >正文

GPT-5.6 来了,Codex 没了,我想用它做个旧手机监控 App

大家可能听说了,7 月 10 日OpenAI 搞了一场发布会,发布了GPT-5.6,包含三个新模型。查了一下GPT-5.6 系列的三个型号:Sol(旗舰)、Terra(均衡)、Luna(性价比)名字来自拉丁语里的太阳、大地和月亮。我更新了Codex后已经可以使用这些模型了。

查了官网定价,Sol 每百万 token 输入 5 美元、输出 30 美元;Terra 减半,2.5 美元和 15 美元;Luna 最低,1 美元和 6 美元。三款模型 24 小时内全量上线,覆盖 ChatGPT、Codex 和 API。

GPT各模型价格链接: https://developers.openai.com/api/docs/pricing

编程是 GPT-5.6 的主战场,一下子有三个新的模型应该怎么选,我也很关心各个模型的实力。查了官网的评测:Sol 在 Artificial Analysis 编程智能体指数上拿了 80 分,比 Fable 5 高 2.8 分,输出 token 不到一半,耗时不到一半,成本便宜约三分之一。Terminal-Bench 2.1 和 DeepSWE 也刷新了最好成绩。Terra 略高于 Fable 5,Luna 超过 Opus 4.8,两者耗时都只有对手三分之一左右。 Agents' Last Exam 上Sol 拿下 53.6 分,比 Fable 5 高出 13.1 分。开中档推理也比对方高 11.4 分,成本只有四分之一。

所以看了这些感觉性价比不错。

但也不是全面碾压。SWE-Bench Pro 上 Claude Fable 5 是 80%,Sol 是 64.6%——精准修改单文件的场景,Claude 依然更强。FrontierMath 最难的 Tier 4 题目,Sol 的 65.9% 甚至不如自家上代 GPT-5.5 的 72.5%。OpenAI 强在规划和编排,Claude 强在执行。

网上资料还了解到这次还有个新玩法叫 ultra 模式。默认四个智能体并行,最多十六个,人多力量大。Terminal-Bench 2.1 上 Sol Ultra 干到 91.9%,GPT-5.5 同期 88.0%。官网的发布会视频上研究员的说法是:这些智能体能像一支有经验的团队那样拆分工作,有机会要去试一下的。

我更新codex应用后开始还以为搞错了,Codex变成了ChatGPT。后来才了解到Codex 独立 App 下线了,能力全部并入 ChatGPT。

还有一个让我在意的数字:GPT-5.6 的内测期间,研究员人均每日输出 token 量超过 GPT-5.5 时期最高水平的两倍。Lovable 联合创始人说新模型让用户构建应用的步骤少了约 25%,工具调用少 35% 到 48%。

话说到这份上,我脑子里冒出一个想法。


家里抽屉里躺着两部旧手机。儿子放暑假最近开始上网课,上周推开他的房门,数学课直播开着,他却在玩玩具。

想过买监控摄像头。但专门为网课买一套设备,总有种杀鸡用牛刀的感觉。我去应用商店搜了一圈监控类 App,要么限免后弹窗收费,要么塞满开屏广告。更要命的是,它们几乎全部要求把视频流上传到厂商服务器。一个家庭监控画面,为什么要经过别人家的云?

正好旧手机闲着,正好 GPT-5.6 Codex 合体了。我打算试试让 AI 帮我把旧手机改成一个纯局域网的家用监控设备。

功能需求已经想清楚了:旧手机端装上 App 当作摄像头,同一 WiFi 下另一台手机或电脑通过浏览器就能看实时画面、同步收听声音。录像全部存本地,不经过任何云端。监控时手机屏幕可以锁屏,同时绕过电池优化限制,防止系统杀进程。

纯局域网传输意味着什么?拿 Wireshark 抓包,数据包只在路由器内部兜圈,不会有一帧画面离开家门。

目前刚把需求梳理完,正式开发还没启动。后续会在公众号更新开发过程和踩坑记录,包括 GPT-5.6 在真实项目中的实际表现,以及各模型的切换策略。

如果你也有闲置旧手机,或者对家庭监控的隐私方案有想法,留言区聊聊。有没有什么你特别想要的功能?运动检测、夜间模式、多摄像头联动——需求收集得越多,开发方向越清晰。

http://www.jsqmd.com/news/1291669/

相关文章:

  • STM32 ADC开发实战:从原理到多通道DMA采集与性能优化
  • 深入解析Cortex-M4内核架构:从寄存器、NVIC到FPU的嵌入式实战指南
  • 植物大战僵尸PVZ:BT版下载
  • AI驱动测试自动化:五大核心价值点助力开发者高效提效
  • 主动避免分支预测失败
  • 时间序列预测实战:从指数平滑原理到R语言实现
  • 北京华恒智信破解餐饮公司服务质量参差不齐难题
  • WarcraftHelper终极指南:魔兽争霸III性能优化插件完全教程
  • OpenClaw多模态AI开发框架可视化界面全解析
  • 2004年研究生数学建模竞赛A题:发现空间目标并定位的模型
  • 2026年7月crm管理系统/深圳药企crm服务公司有哪些_深圳市咨微信息科技有限公司 - 品牌宣传支持者
  • 《论单元测试及其应用》
  • AI图片光影调整避坑清单,12个被OpenCV文档刻意忽略的Gamma校准陷阱
  • DOB灯板技术解析:从集成驱动原理到应用选型指南
  • 深圳口碑好的色彩传感器哪个公司好
  • Pixelle-Video:用AI自动化你的视频创作,三分钟生成专业短视频
  • 2026年7月厂房安全检测鉴定/厂房钢结构安全检测鉴定公司推荐评估_山西建科元丰工程检测有限公司 - 行业平台推荐
  • STM32 ADC实战指南:从HAL库配置到多通道DMA数据采集与滤波
  • 【awinic inside】触摸感知 视觉防抖 | 艾为全套方案助力心言巴布温情陪伴机器人!
  • 元势孵化实战教程:项目上线前30天全域运营排期、避坑与落地全方案
  • 树莓派串口登录全攻略:硬件连接、系统配置与深度排错
  • 北京华恒智信破解建设国企权责错位推诿扯皮难题
  • ABAP字符串操作实战:从基础函数到正则表达式与性能优化
  • Android文件系统错误排查:从ENOENT到Operation not permitted的深度解析
  • 如何解决使用vs进行c语言编译时scanf等函数报错不安全的问题
  • 步进电机原理、驱动与工程应用全解析:从STM32控制到Eplan设计
  • uni-app跨端开发:App、H5、小程序版本号统一获取与封装实践
  • Linux服务器Python环境搭建:从Anaconda安装到虚拟环境管理实战
  • 2026年7月工业建筑检测鉴定/山西厂房质量检测鉴定公司选哪家_山西建科元丰工程检测有限公司 - 品牌宣传支持者
  • AI开题报告工具测评与选择参考