GPT-5.6-Sol 刚刚意外删除了我 Mac 上几乎所有的文件。
有这回事,我才更信任 Fable 一千倍。
查看英文原文
And this is why I trust Fable 1000x more.
7 月 11 日(北京时间)全球 AI 圈推文存档,按曝光排序,共 100 条。
← 返回最新 全部归档
提交账号
填 @用户名 或主页链接,审核通过后收录进情报站。
GPT-5.6-Sol 刚刚意外删除了我 Mac 上几乎所有的文件。
有这回事,我才更信任 Fable 一千倍。
🚨 宣布推出 Smart Model Router - 自己搭建路由器选择你喜欢的 LLM
- 支持路由到 GPT Sol、Muse Spark、Grok 4.5 和 Fable
- 成本和性能随意优化
- 硬核 coding 就用 Fable
搞好路由器后,可以在我们的 Chat、Agent 或 API 里用!
周一上线 - 支持所有 CLI 客户端,包括 Code、Claude Code 等等
Grok 4.5现在可以作为orchestrator模型,在Computer for Consumer Pro和Max订阅用户中使用。
我们在WANDR上对另外五种orchestrator配置进行了对比评估。Grok 4.5的得分高过所有其他配置,而成本只有Opus 4.8的一半左右。
天哪 Grok 4.5 太猛了。
人们已经在用它做出本来不可能这么快完成的东西。
10 个疯狂的例子:
1/ Grok 4.5 用不到一小时搞出了一款能玩的 FPS 游戏。
2/ Grok 4.5花36分钟用约12美元就在UE5里建出了这条赛博朋克街道。
3/ Grok 4.5 一分钟内就设计出了一套完整的 2D + 3D 家装规划图。
4/ 两行提示词变成了一款可玩式的空间对战游戏……音效还是 Grok 4.5 做的
5/ Grok 4.5 用了两个提示词就搭出一个带动作绑定的敌人、地图还有 AI 逻辑的 3D 游戏
6/ Grok 4.5 现在是顶级编码模型
快速、便宜,终于能跟最好的竞争了。
7/ Grok 4.5 一分钟内设计好了一个完整的 2D + 3D 家居规划工具。
8/ Grok 4.5 在 30 分钟内搞出了一个精致的 2D 横版卷轴游戏。
9/ Grok 4.5 写了个 Linux 内核模块,终于修好了笔记本的 RGB。
10/ 给 Grok 4.5 配个邮箱、电话、借记卡和工具……你就有个联合创始人了。
我真的生气了...OpenAI团队在调查这个,但这感觉像是GPT-3.5该出现的问题。不应该在一个2026年中期的前沿模型最高推理等级上出现。
引用 Matt Shumer @mattshumer_GPT-5.6-Sol刚刚意外删除了我Mac上几乎所有文件。这就是为什么我对Fable的信任度高1000倍。查看被引原帖 ↗
GPT-5.6 Sol Ultra 证明了一个50年的数学猜想。不像 Erdős Unit Distance Problem,这次用的是今天就能公开用的模型。期待科学家和研究者们拿这个模型能做出什么来!
引用 Ethan Knight @__eknight__GPT-5.6 Sol Ultra 正式推出,使用 64 个子代理在不到一小时内证明了 50 年前的循环双覆盖猜想。已分享提示和证明,期待用户探索 Ultra 的潜能。查看被引原帖 ↗
在Perplexity Computer的评测中,Grok 4.5在所有前沿模型里得分最高,而且成本超有竞争力
引用 Perplexity @perplexity_aiGrok 4.5现已作为Computer Pro和Max订阅用户的编排器模型推出。我们在WANDR上针对五种其他编排器配置进行了评估。它的得分高于所有其他配置,成本约为Opus 4.8的一半。查看被引原帖 ↗
想象一下,一个 Fable 5 等级质量的模型在半年内便宜 3-4 倍,还有一个 Opus 4.8 等级的模型能在一年内在本地设备上运行。这些事发生的概率超过 50%。在对未来做预测时值得铭记。
GPT-5.6是医疗AI的重大突破。
我们的全产品线性能都升了,成本却降了:GPT-5.6 Luna在最强推理模式下秒杀GPT-5.5,价格反而便宜25倍。
这些进步不仅提升了质量,还让全球更多人能用上先进模型。
为了进一步加强我们对生物领域高级 AI 能力的保护,我们把 Bio Bug Bounty 演变成了一个持续的私密项目,称为 OpenAI Bio Bug Bounty program,同时将奖励翻倍到 5 万美元。
我们邀请有 AI 对抗性测试、安全或生物安全经验的研究人员,尝试找到一个通用的越狱方法,来挑战我们针对 OpenAI 前沿模型设定的生物安全挑战。
openai.com/index/bio-bug-bou…
推出 side chats,一种在不打断主对话的情况下提问和探索想法的新方式。
每个 side chat 都是一个持久的 agent 对话,你可以通过 @ 提及把它的上下文带回主线程。
现在你可以搜索 agent 的对话记录来找之前的聊天。
Cursor 会建立本地搜索索引,让你在数千个对话中快速搜索。
我们优化了项目和仓库选择器,功能更强了。现在用它们启动 agents 需要点击的次数也更少了。
我们俩看到Anthropic又延长一周Fable访问时的反应
Revolut 4个月后就把你的eSIM掐了,说是为了避免"账单惊吓"(啊???)
等于你到时候在某个人烟稀少的地方,没网络,没办法充流量(因为你得先有网络才能充),基本就成了废卡
所以你根本没法把它当成主力电话卡用!
我完全搞不懂 @Revolut 的eSIM部门是谁在管,也不知道他们吸了什么,难道不想赚我的钱吗?
50年的数学猜想被Sol Ultra破解了。感觉你能做的事的极限,越来越取决于你的野心和想象力了:
引用 Ethan Knight @__eknight__昨天发布了GPT-5.6 Sol Ultra。今天分享其用64个子智能体在不到一小时内证明了50年前的循环双覆盖猜想。下面分享提示和证明。期待看到你们用Ultra做什么!查看被引原帖 ↗
一年前,我们开始赋能人类,专注于 multimodal AI、自定义模型和开放科学。
我们展示了以人类协作方式合作的交互模型。Tinker 让任何人都能训练自己的开源权重模型。我们发表了关于 Connectionism 的研究。
今天我们分享我们使命背后的世界观。
人类价值观不会平均化。本地知识无法集中化。美好的未来会有很多 AI,在不同的地方被培养,由它们服务的人塑造,彼此不同意,就像我们一样。
thinkingmachines.ai/blog/the…
引用 Mira Murati @miramuratiThinking Machines Lab获a16z领投2B融资。致力构建多模态AI支持自然交互。计划数月内推出首款产品含开源组件,并分享前沿AI研究成果。查看被引原帖 ↗
太喜欢 @jeffhollan 这个例子了,用 Foundry 构建长期运行 agent 现在能玩出什么花样。全都 GA 了。
引用 Jeff Hollan @jeffhollanMicrosoft Foundry的Hosted Agents正式发布。为任何框架、语言和模型的agent提供原生计算。使用GitHub Copilot App构建,连接Microsoft IQ,在Foundry运行,安全与Teams交互,在Agent 365治理,持续优化学习。查看被引原帖 ↗
现在可以把 @Lovable 应用部署到 Vercel 了。
vercel.com/changelog/you-can…
🇵🇹 致葡萄牙政府的公开信
@LMontenegroPSD
@Leitao_Amaro
@miguelluz
首相蒙特内格罗先生、部长莱东·阿马罗先生、部长米格尔·平托·卢兹先生,
我作为选择在葡萄牙生活的一员写这封信,有一个简单的请求:把 Tesla FSD (Supervised) 引入葡萄牙。
4月10日,荷兰成为第一个批准该系统的欧洲国家,经过了 RDW 机构 18 个月的独立测试。两个月内,立陶宛、爱沙尼亚、丹麦和比利时纷纷效仿。这些国家都没有重复进行测试,而是根据欧洲框架(UN R-171)认可了荷兰的批准,并基于现有数据进行了审批。
结果说明了一切:在荷兰,大约 40,000 辆特斯拉已经行驶了 2,400 万公里,没有重大事故(根据 RDW 数据)。装配 FSD 的汽车碰撞率比手动驾驶低 3.5 倍。
这就是重点所在——这不再是技术问题,而是生命问题。仅今年就有超过 220 人死于葡萄牙的道路交通事故,比去年增加了 25%。葡萄牙的道路死亡率高于欧洲平均水平。国家道路安全局表示主要原因都是人为的:超速、酒驾、分心。一个永不分心、永不酒驾、永不打瞌睡的系统可以避免人类驾驶员导致的死亡。政府本身将交通死亡率称为社会疾病。这是对抗它的具体方式。
葡萄牙可以效仿丹麦和比利时:由 IMT 分析 RDW 的文件并批准。这不花国家一分钱,还能让葡萄牙走在德国、法国和西班牙之前。
500 年前,葡萄牙在新技术上领导世界:航海技术。它率先出发,为世界开拓了新天地。葡萄牙可以再次走在新技术的前沿,像 500 年前那样领导世界。每一个月的等待都要付出生命的代价。只需要做决定。
敬礼,
@levelsio
引用 Rustavi @Rustavi🚨 The EU Commission posted: “Smarter cars mean safer roads.” Starting July 7, all new EU cars must have advanced emergency braking for pedestrians/cyclists, driver distraction warnings, etc. Yet after 18+ months of rigorous testing, Tesla FSD (Supervised), already approved in the Netherlands with real-world data showing it 3.5x safer than manual driving there (0 highway crashes in 16M+ km), is still not fully approved EU-wide. 5 countries have it via mutual recognition. The big ones are dragging their feet. If you truly want safer roads, approve proven AI that reduces human error instead of just mandating yesterday’s tech. Bureaucracy shouldn’t cost lives. What’s the holdup, @EU_Commission ? #FSD #Tesla #RoadSafety查看被引原帖 ↗
各位听好了
引用 dafghif @DaffaGhiffaryKHot take: Muse Spark 1.1 is better than Grok 4.5 (based on my personal benchmark)查看被引原帖 ↗
很多人都在怀疑 Meta 在 AI 竞速中的位置。
昨天他们发布了 Muse Spark 1.1,现在是最强的代理模型之一,价格大幅低于 OpenAI 和 Anthropic。
我去年采访 Zuck 的时候,他告诉我他的重点:
「我们要确保每个研究员拥有最多的算力,尽一切努力来构建所有这些基础设施。」
这是这个赌注——花费数百亿美元在算力上——开始见效的第一个真实信号。
Meta 的股价自发布以来已经上涨了 10% 多。
引用 Mark Zuckerberg @finkd今天发布Muse Spark 1.1,一个强大的智能体和编码模型,价格极低。可通过Meta Model API和Meta AI获取。查看被引原帖 ↗
新benchmark刚发布 🎁
Muse Spark现在可以根据短视频指令完成端到端任务
我在尝试每天坚持 500 卡路里的热量缺口 + 蛋白质目标约 150g(每公斤体重 2g),用 Claude chat 来做这事,但一周后它开始记不清楚,所以我让它把数据导出为 CSV,粘贴到 VPS 上的 Claude Code
然后我让它做了个小热量追踪应用叫 🥩Caltrack,还带了 Telegram bot,这样我可以随时通过 Telegram 或 Termius SSH 登上 VPS 来记录吃喝的东西
我喜欢这种混搭 Claude Code 和仪表板/聊天机器人的方式,因为你可以问更深入的问题比如「我做得咋样」、「还能改进啥」,服务器上的 Claude 比单独用 Claude chat 应用聪明太多了
反正我的目标是达到 @marclou 那种低体脂水平,对吧,现在很壮实很精瘦但还能更瘦,咱们试试 😊😊😊
80% 的体脂是吃什么决定的,只有 20% 是运动决定的,有人说甚至是 90% vs 10%,我同意,我吃得很干净但基本上一直在维持热量
那些高热量的食物比如低蛋白酸奶,吃起来不错但能迅速破坏你的热量缺口,要搞清楚这个真的得追踪数据
其他人建议快速减肥比如只吃沙丁鱼,但研究表明快速减肥只是临时的,最后还是会反弹
Claude 说理想的方法就是每天 500 卡路里缺口加上 2g/kg 蛋白质目标,这样能保持肌肉同时减少体脂!所以我就这么做
这个应用帮了大忙!!!
感谢各位的关注!!!
我一直在说 ChatGPT Work(还有 Cowork)是知识工作者错过的机会,为了说明这一点,看看 Google 的 NotebookLM 怎么用相同的 70+ 个文件回答 ChatGPT Work 同样的问题。
它关注的是过程和来源,而不仅仅是输出。
不到 24 小时前,OpenAI 发布了 GPT-5.6。
震撼了。大家已经在想各种疯狂的用法了。
10 个例子:
1. GPT-5.6 用体素重建了曼哈顿
自主构建,精度惊人。
2. GPT-5.6 复刻了 Google Earth
3D 地形、城市、天气、昼夜循环和全球搜索。
3. GPT-5.6 10 分钟内做出了飞行模拟器
一句 prompt。完全可玩。
4. GPT-5.6 做了这个游戏...还赢了 Fable
设计质量出乎所有人的意料。
5. GPT-5.6 把手机变成了无线麦克
一个从 prompt 生成的 Android 应用。
6. GPT-5.6 正在成为专业游戏开发者
一个可玩的原型,玩法和画面都打磨得很精致。
7. GPT-5.6 vs Claude Fable 5
同一个 prompt。哪个 AI 做得更好?
8. GPT-5.6 在 Blender 里强得可怕
看它实时构建一门大炮。
9. GPT-5.6 vs Fable 做 3D 仪表板
成本便宜一半。效果出人意料地接近。
10. GPT-5.6 在一些意想不到的地方击败 GPT-5.5
新的测试揭示了它在哪些方面领先……以及哪些方面没有。
你的下一次美食约会得要这个程度的投入。
被 @SpaceXAI 的 Grok 4.5 模型惊艳到了。在 Computer harness 里,我们内部 benchmark WANDR(评估自主研究能力)得分最高,价格只有 Claude Opus 4.8 (high) 的一半;而且跟目前 GLM 5.2 的后训练模型成本差不多,成绩却更好。
引用 Perplexity @perplexity_aiGrok 4.5 现已可用作 Computer for Consumer Pro 和 Max 订阅者的编排模型。在 WANDR 评估中性能高于五种其他配置,成本仅为 Opus 4.8 的约一半。查看被引原帖 ↗
模型的 chain of thought 就像一个草稿本,让你能窥探它的推理过程。📝
在我们最新一期播客中,主持人 @fryrsquared 和 @NeelNanda5 坐下来探讨 interpretability(可解释性)——这是一门反向工程科学,研究神经网络如何学习和思考。
时间戳:
00:00 Introduction
02:41 Motivation for interpretability research
04:01 Mechanistic interpretability
08:14 Chain of thought monitoring
18:14 Interpretability techniques
35:00 Auditing models for safety
48:53 What comes next for interpretability
又一个别在笔记本上跑编码 agents 的理由,它们会把你所有文件都删了!
这次是在我的服务器上,但好歹我有备份。
对啊!这就是用 Claude Code 或其他编码 agent 做小网站/应用的酷之处
因为你既有网站/应用,同时又有编码 agent 可以对话,问它「下一步吃什么?」
这比把 Claude 或 ChatGPT 当聊天应用更好用,因为它们会忘东忘西,而且太混乱了
编码 agent 只需要查一下你的 SQLite 数据库就知道你吃过什么,所以对,这是关于内存的事
引用 Matt Shumer @mattshumer_GPT-5.6-Sol 误删了我 Mac 上几乎所有文件,这就是我更信任 Fable 1000 倍的原因。查看被引原帖 ↗
很多人搞不清楚 ChatGPT、Codex、Work 什么差别,以及额度是独立的还是共享的,根据官方文档整理了一个简单的 Q & A。
Q:Chat、Work、Codex,一句话说清区别?
Chat 回答问题,Work 帮你干活,Codex 帮你写代码。
Chat 就是你熟悉的 ChatGPT,你问它答,快进快出。
Work 是一个能跨应用收集信息、然后交付完整成品的智能体(Agent),交付物是文档、表格、幻灯片、网页应用这些拿到手就能用的东西。
Codex 也是智能体,但它主要操作的是代码仓库,能读你的项目文件、改代码、跑测试、提交 PR。
打个比方:
Chat 是你问"番茄炒蛋怎么做",它告诉你步骤。
Work 是你说"帮我准备一桌晚餐",它自己去冰箱找食材、炒菜、摆盘。
Codex 是你说"这个菜谱 App 有 bug",它打开代码自己修。
【来源:
help.openai.com/en/articles/…
】
Q:Work 到底能做什么?跟直接在 Chat 里说“帮我写个报告”有什么不同?
在 Chat 里你说“帮我写个报告”,它给你一段文字,你自己复制粘贴到 Word 里排版。
Work 完全不同。你先把日常工具接进去,Slack、Gmail、Google Drive、SharePoint、Teams、日历、CRM、项目管理工具都行,OpenAI 叫它 plugins。接好之后告诉它你要什么结果,它会自己去这些应用里拉数据、整合信息、生成一份可以直接交付的成品。你在提示词里用 @ 加应用名就能指定它去哪儿找数据。
举个例子,Zapier 的企业营销负责人用 Work 搭了一个系统,每月审查数千条线索,追踪 CRM 和邮件中的客户触点,找出跟进断裂的地方,生成管理层周报。Virgin Atlantic 的数字产品负责人用它做竞品对标分析,让 ChatGPT 调研各家航空公司的服务水平,生成可供团队审查的数据集,把原本需要数周的分析缩短到几小时。
另一个区别是 Work 能长时间跟进。一个复杂项目,它可以跟好几个小时,自己拆步骤、自己推进。中间有拿不准的会来问你,你也可以随时调整方向、审批关键动作。
【来源:
openai.com/index/chatgpt-for…
】
Q:Work 能定时跑任务?
能。这个功能叫 Scheduled Tasks(定时任务),可以设成一次性、定时重复、事件触发或持续监控。
比如你设一个任务:每天早上检查 Slack 和邮件里的新消息,整理成简报发给你。或者:每当有新的客户反馈进来,自动归类主题、整理成产品改进建议。这些都能在后台跑。它还能用桌面端的内置浏览器上网查信息,甚至通过 Computer Use 功能操作你电脑上的其他应用。
定时任务面向 Plus、Pro、Business 和 Enterprise 用户开放,各档计划的并发任务数量上限不同。任务不能每小时跑超过一次,长时间无人理会的任务可能会自动暂停。
【来源:
openai.com/index/chatgpt-for…
help.openai.com/en/articles/…
】
Q:那 Codex 跟 Work 的区别到底在哪?
这两其实是同一套底层 Agent(Codex)和 UI,但是应用在不同的场景,配合不同的插件。读的东西不同,交付的东西也不同。
Work 读的是你的业务上下文,邮件、文档、聊天记录、日历,交付的是商务成品,幻灯片、电子表格、文档、网站。Codex 读的是你的代码仓库,交付的是代码变更,diff、测试结果、PR。
【来源:
openai.com/index/chatgpt-for…
】
Q:Codex 每周有 500 万人用,为什么还要再出一个 Work?
OpenAI 在博文里提到,虽然 Codex 最初是为开发者设计的编程智能体,但已经有超过 100 万人在用它做软件开发以外的工作。Work 的推出,某种程度上是把这些非编程用途正式化了,给了它一个专门的界面和工作流,用 plugins 连接业务应用,输出文档和幻灯片而不是代码。
OpenAI 自己内部也在大量使用:销售团队用 Work 把一次客户探索对话在 24 小时内变成了定制 POC(概念验证),以前这个流程需要几周。财务团队用 Work 把月末结账和预测流程从几天压缩到几小时。
我觉得 Codex 这么做呢,目的是为了吸引办公人群,原本这些人看到 Codex 的名字会以为是写代码用的,但是改名呢又会影响原本的 Codex 用户,结果就搞成这样一套产品两个名字。
简单来说就是一套产品,两个名字,两种主要场景,同时吸引不同用户群。
【来源:
help.openai.com/en/articles/…
developersdigest.tech/blog/c…
】
Q:我在哪儿能用这三个模式?
Chat 最简单,网页、手机、桌面端都有,所有平台通用。
Work 在网页和手机上已经开始上线(Pro、Enterprise、Edu 优先,Plus 和 Business 未来几天陆续开放)。桌面端也有,而且桌面端更强,能用本地文件,还有内置浏览器上网抓取信息。
Codex 只在桌面端能选。手机上不能直接用 Codex 模式,但可以通过 ChatGPT App 里的 Remote 标签远程查看桌面上正在跑的 Codex 任务。
一个要注意的点:网页/手机端的 Work 对话和桌面端的 Work 对话目前不互通,云端是云端,本地是本地。Chat 对话则可以跨网页和桌面端同步。
原来独立的 Codex App 已经合并进了新版 ChatGPT 桌面端。一个 App 里切换 Chat、Work、Codex 就行。开发者可以把 Codex 设为默认打开视图,App 图标也能换成 Codex 的 logo。原来的 ChatGPT 桌面端会更名为 ChatGPT Classic。
【来源:
help.openai.com/en/articles/…
openai.com/index/chatgpt-for…
】
Q:Chat 聊天和 Work/Codex 的额度是共享的吗?
不共享。Chat 对话有自己独立的消息限额,图片生成和语音也各有各自的独立限额和重置周期。
Work 和 Codex 用的是另一个池子,OpenAI 叫它"智能体用量"(agentic usage)。帮助中心原文说:Codex、ChatGPT Work、ChatGPT for Excel 和 Workspace Agents 的用量从同一个智能体额度池中扣减。
所以你在 Chat 里聊天聊得再多,不会影响 Work 和 Codex 的额度。但 Work 和 Codex 之间会互相挤占。白天用 Work 跑了一堆复杂任务,晚上想用 Codex 写代码,可能会发现额度已经不多了。
【来源:
help.openai.com/en/articles/…
developers.openai.com/codex/…
】
Q:要花多少钱?
Work 不是独立付费产品。它跟 Codex 共用同一个额度池,包含在你现有的 ChatGPT 订阅里。所有计划都能用,从免费到企业版,区别在于额度多少。
Free(免费):能试用 Work 和 Codex,额度非常有限,试试味道可以。美国地区有广告。
Go($8/月):额度比免费多约 10 倍,桌面端可有限地用 GPT-5.6 Terra 跑 Work 和 Codex。没有 Deep Research 和 Agent Mode。有广告。
Plus($20/月):第一个去掉广告、功能完整的档位。包含 Deep Research(每月 10 次)、Codex、Agent Mode。三年没涨价,性价比最高。
Pro($100 或 $200/月):$100 档额度是 Plus 的 5 倍,$200 档是 20 倍。面向重度用户。
Business($20/月/人起,年付;月付 $25):至少 2 人,多了 SSO 和合规控制,数据默认不用于训练。
Enterprise(定制报价):150 人起。
额度计费从今年 4 月开始改成按 Token 消耗计算。用更强的模型或开 Fast 模式,消耗更多。Plus 和 Pro 用户额度用完后可以购买额外 credits 继续使用。
【来源:
chatgpt.com/pricing/
developers.openai.com/codex/…
】
Q:GPT-5.6 的 Sol、Terra、Luna 是什么?我该用哪个?
这是 GPT-5.6 的三个子型号。
Sol 最强,适合复杂推理和高难度编程,也最贵(API 价格 $5/$30 每百万 Token 输入/输出)。
Terra 居中,日常工作默认选它($2.50/$15)。
Luna 最快最便宜,对速度敏感或任务简单时用($1/$6)。
Free 和 Go 用户只能用 Terra。
Plus 及以上可以三个都选,还能调节 effort 级别。
ultra effort 在 Work 中仅限 Pro 和 Enterprise 用户,在 Codex 中 Plus 及以上可用。
【来源:
developersdigest.tech/blog/c…
chatgpt.com/pricing/
】
Q:Work 上线后,原来的 ChatGPT 还在吗?
在。Chat 模式就是原来的 ChatGPT,一切照旧。桌面端点"Quick chat"按钮就能开新对话,手机端在顶部下拉菜单选"Chat"。你可以完全无视 Work 和 Codex,继续像以前一样用。
【来源:
help.openai.com/en/articles/…
】
Q:ChatGPT Work 桌面端和 Claude Cowork 桌面端有什么区别?
两者现在都是桌面端智能体,都能操作本地文件,都能用 Computer Use 控制你的电脑,都支持定时任务。但实际用起来,路径和体验差别不小。
1. 执行架构不同。
Cowork 在你的电脑上运行一个隔离的 Linux 虚拟机作为沙箱,所有文件操作都在这个本地沙箱里完成,生成的文件(.docx、.xlsx、.pptx、.pdf)直接保存到你指定的文件夹。
ChatGPT Work 的桌面端继承了 Codex 的沙箱和权限控制体系,用操作系统原生隔离机制(macOS 上是 Seatbelt,Windows 上是 Windows Sandbox),同时还有一个内置浏览器,不需要额外装扩展就能上网查资料、操作网页工具。
2. 操作电脑的方式不同。
ChatGPT Work 桌面端的 Computer Use 可以在后台操作你的其他应用,点击、打字、移动文件,你会看到屏幕上出现一个"不是你在动"的第二个光标。
Cowork 也有 Computer Use(目前仍是研究预览阶段),通过 Claude in Chrome 扩展操作浏览器,通过桌面端直接操作应用。
3. 应用连接方式不同。
ChatGPT Work 用统一的 plugins 目录,60 多个连接器对接 Slack、Teams、Google Drive、SharePoint、Salesforce 等。你在提示词里用 @ 指定应用名就能拉数据。
Cowork 用 MCP(Model Context Protocol,模型上下文协议)连接器,对接 Slack、Notion、HubSpot、Jira、Linear 等,还有 11 个官方行业插件(销售、法务、营销、财务等),也支持自建插件。
4. 产品结构相似但不同。
ChatGPT 桌面端现在是三合一:Chat、Work、Codex 在同一个 App 里通过模式切换器选择。
Claude 桌面端最近也改版了,从原来的三个标签(Chat、Cowork、Code)合并成了两个标签:Home 和 Code。
Home 里 Chat 和 Cowork 共享同一个首页,对话、Cowork 任务、项目和文件都在同一个侧边栏里,你在消息框左下角切换 Chat 和 Cowork 模式。
Code 标签是 Claude Code 的桌面界面,专门用于软件开发。
结构上,两家现在很像:都是把日常对话、知识工作、编程三种模式塞进了同一个桌面 App。
5. 跨设备能力不同。
Claude Cowork 从 7 月 7 日开始向网页和手机端扩展(Beta,Max 用户优先,其他付费计划陆续开放)。
Cowork 任务现在可以远程跑在 Anthropic 的服务器上,关掉电脑也能继续执行,你可以在手机上查看进度、回复 Claude 的问题、或在另一台设备上接着干。定时任务也能在后台跑了。但有一个限制:如果任务需要读写本地文件、用浏览器、或用 Computer Use,你的桌面端 App 必须保持打开状态,远程会话通过桌面端去够这些本地资源。
ChatGPT 这边,Chat 对话可以在网页和桌面端之间同步。但 Work 对话目前不互通:网页/手机端创建的 Work 对话留在云端,不会出现在桌面端的 Work 里;桌面端的 Work 线程和本地文件也留在那台电脑上。Codex 桌面端任务不会出现在网页端,但可以通过手机 App 的 Remote 标签远程查看。
Claude Cowork 的跨设备同步走得更前面一步,同一个会话可以在桌面、网页、手机端之间流转。ChatGPT Work 目前云端和桌面端是割裂的,这是 OpenAI 明确说了"at launch"的限制,后续大概率会补上。
【来源:
openai.com/index/chatgpt-for…
eigent.ai/blog/chatgpt-work-…
leadwithai.co/article/chatgp…
support.claude.com/en/articl…
claude.com/resources/tutoria…
】
引用 OpenAI @OpenAI推出ChatGPT Work,由Codex和GPT-5.6驱动的ChatGPT新智能体。可在应用和文件间执行操作,长时间处理项目,将目标转化为完成的工作。这是全新的工作方式。查看被引原帖 ↗
Meta 是不是被看好啊?
你们这帮人把 Muse Spark 1.1 上传到 openrouter 了
test-time compute 越多,模型越聪明。但当我们把 ttc 从秒级推到周级,延迟就成了瓶颈。
GPT-5.6 Sol Ultra 支持并行 ttc。生成一个50年难题的证明,时间从可能的一整天降到了一小时。
引用 Ethan Knight @__eknight__GPT-5.6 Sol Ultra 正式推出,使用 64 个子代理在不到一小时内证明了 50 年前的循环双覆盖猜想。已分享提示和证明,期待用户探索 Ultra 的潜能。查看被引原帖 ↗
OpenAI 的 Codex 团队刚刚披露了产品未来的发展方向。
总结一下他们在 Reddit AMA 里的重点:
Codex 现在每周有超过 500 万活跃用户——比三个月前翻了一倍——并且在此期间推出了 150 项改进。
AMA 信息提炼如下:
- Linux 桌面应用正在开发中,但还没具体时间表。
- 后续版本计划提升 Agent 持久性,同时降低代码复杂度。
- 目前还没有自动模型路由功能。首选体验是让 Codex 自主推断任务难度,同时保留手动切换速度/推理强度的选项。
-O 认为 Codex 接入 Slack、GitHub 和 Notion 是实现“职场得力助手”的关键跃升。
- GPT-5.6 专门针对 UI 和前端工作进行了优化训练。
- O 没有对 100 万 token 上下文窗口做出承诺。
- 当前定价并不保证保持不变,不过团队表示普惠性仍是目标。
N
- 普通 ChatGPT 对话不计入 Agent 额度;Codex 和 ChatGPT Work 会消耗额度,费用因任务而异。
-O 承认基准测试作弊是真实存在的问题,并表示会在评估时对此类行为进行扣分,同时也会引入第三方独立供应商。
不客气
引用 OpenAI Developers @OpenAIDevsGPT-5.6 is here. Codex is now available inside ChatGPT. And we know developers will have questions. So we’re bringing the Codex team to r/Codex for an AMA. We’ll answer questions on Friday, 7/10 from 9:30am to 10:30am PT: reddit.com/r/codex/s/EsB8OH0…查看被引原帖 ↗
最离谱的是,如果你看过我的 GPT-5.6-Sol 测评就知道,我早就更喜欢 Fable 了,几周前就停用 5.6 了。
我今天之所以还在用它,完全是因为 OpenAI 团队让我测试 Ultra 模式。
说实话,他们真的超好合作,这完全是个意外。就是太倒霉了。
引用 Matt Shumer @mattshumer_GPT-5.6-Sol刚刚意外删除了我Mac上几乎所有文件。这就是为什么我信任Fable 1000倍。查看被引原帖 ↗
我没理解什么是 token-maxxer 直到用上 ChatGPT-Pro
现在我经常有好几个请求在同时跑
说实话,这视频纯粹是在激化对立。但考虑到欧盟的"聊天监控"提案,我现在除了激化对立外什么都说不出了。心里堵得慌。
这对我来说真是个令人印象深刻的 AI 里程碑。我让 GPT-5.6 Sol in Codex 控制我的电脑,问它能不能赢 Slay the Spire 2 这个游戏的每日挑战(有随机性所以没法作弊)。
结果它花了5个小时,做了一堆复杂的游戏选择……然后真的赢了。
Slay the Spire 2 是个超级复杂的游戏,有大量决策会产生大规模战略影响,这些影响可能要过很久才能看出来(或者直接把你整崩溃),还要精细地管理资源。而且它是在我的训练数据截止之后才发布的。
游戏库里的游玩记录
我今天早些时候玩过同一个关卡,但用了完全不同的方法。
欢迎继续反馈,感谢所有用户!
引用 Tibo @thsottiauxHello beautiful people! We have reset usage limits across Codex and ChatGPT Work. And another one will come later in the day. Rejoice. Now that I have your attention, a quick update on ChatGPT Work, Codex and all the updates we shared yesterday. We’ve spent the last 24 hours reading feedback, looking at usage patterns, and talking with many of you. The short version is that there is a *lot* of excitement for GPT 5.6 Sol, ChatGPT Work on mobile & web, but also that we didn't get everything quite right. - We made it too easy to use the highest-compute settings without making the impact on usage limits sufficiently clear. - We reorganized the desktop app in one bold move, making familiar things like chats and projects harder to find. - Our launch framing was focused on ChatGPT Work and to some of our Codex fans it made it feel like Codex was going away over time. Absolutely not our intention, we love Codex and it is here to stay. - And we introduced regressions for some existing multi-agent workflows, alongside a collection of rough edges in plugins and other parts of the experience. We’re landing a first set of improvements today. We’re resetting usage twice so people can keep experimenting, changing defaults and the model picker so they don’t push people toward unnecessarily expensive settings, fixing several plugin submission issues, improving how we represent Codex in the product, and cleaning up some of the most immediate desktop problems. A larger set of improvements will land next week. We’re bringing chats and projects back into the sidebar in a more familiar and customizable way, making usage and reset timing much more visible, clarifying when to use ChatGPT Work and when to use Codex, and addressing the many other smaller pieces of great feedback we've had. The ambition behind this launch hasn’t changed. We think bringing ChatGPT and Codex together into a workspace where people and agents can collaborate is a very important step forward. But an ambitiou查看被引原帖 ↗
我是荷兰人,他这边真没恶意,就是我们语言的特点。英文的话你会说'哇酷啊,没想到能用Excel赚钱',会包装一下。但荷兰语就是直白地表达'没想到能赚钱',没有任何价值判断或意见。非荷兰人理解不了,就是因为少了友好(虚伪)的包装这一层。
引用 PetersonCreates @PetersonCreatesTold an old neighbor at a friend's dinner I'm building digital products on the side. He looked at me and said, "So like an app?" I said no, a sort of Excel sheets. Long pause. "People pay for that?" The Dutch are direct. I respected the question. What would you have said?查看被引原帖 ↗
又一次重置,虽然也是没办法的事。
不幸的是,我越来越觉得 Token 消耗速度简直离谱。用 Pro 套餐这么多年,我从没这么快就触碰到5小时和周限额,但5.6 Sol 做到了。我主要用 High 模式,连 Fast Mode 都没怎么开。
5.6 确实更强。前段工作上提升最明显,我当时一眼就看出他们真的追上来了。5.6 还能保持更久的智能体状态,我很满意整体表现。要不是消耗太快,这绝对是个重大进步。
另外我还是不懂那个“超级应用”的概念。既然 Codex 功能完全一样、显示的信息还更多,那我为啥要用“工作”环境?而且为啥经典版 ChatGPT 还在?可能是我漏掉了什么,但目前这操作反倒让人更混乱。
我现在还是指望重置,不然真用不下去了。至于5.6声称能节省54% Token,我觉得纯属编的。跟我实际使用完全对不上,甚至刚好相反——感觉更像是Token效率低了54%。
所以,5.6是个不错的更新,但一大缺陷摆在那里。
我给 Fable 丢了个代码:'拿这个游戏想办法做点疯狂的事,让它完全不一样。尽情发挥'
它做出来了 DEEP TIME:建一座城市,看它被废弃遗忘,然后以未来考古学家的身份去挖掘。
绝了:
monument-deep-time.netlify.a…
引用 Ethan Mollick @emollickWhen GPT-5 came out, I created a procedural brutalist city builder as a demo (you can see it in the quoted tweet) I used GPT-5.6 Sol in Codex to do the same thing, touching no code. Less than a year... Play with it (its fun, if you like cities): monument-brutalist-city-buil…查看被引原帖 ↗
比 Fable 便宜 90%,用来做啥都特别棒
引用 Max Blade @_MaxBlademeta just dropped a bomb. Muse Spark 1.1 is 86% cheaper than GPT-5.6 Sol and 91% cheaper than Fable 5 on output tokens ($4.25 vs $30 vs $50 per M) I thought the model was going to be horrendous, but it ended up being insanely fast, and very capable. front end design is VERY strong. Agentic capabilities seem great as it was able to spawn and even orchestrate other agents inside my app cnvs using the mcp and cli tool with zero instruction. we have soo many insanely good models right now.查看被引原帖 ↗
有人知道新的 ChatGPT 桌面版里的 ChatGPT Codex 是不是完全覆盖了 ChatGPT Work 的所有功能?
如果你是那种不怵 Git 功能的软件工程师的话,那还有什么理由会让你切换到 ChatGPT Work 模式吗?
GPT-5.6 最让人迷惑的一点是到底该在什么推理强度下选哪个模型——如果我之前最爱的 5.5 xhigh 升级了的话,看来 Sol on Medium 可能会成为日常写代码的新默认配置。
引用 pash @pashmerepatFYI:5.6 Sol medium 优于 5.5 xhigh。提高 Sol 推理级别获得卓越性能,但消耗额度限制更快。正在改进沟通方式。查看被引原帖 ↗
😘
引用 Ethan Mollick @emollickChatGPT Work对知识工作者来说是错失的机会。Google的NotebookLM处理相同的70+文件,更注重流程和信息源,而非仅输出结果。查看被引原帖 ↗
Muse Spark 1.1 的效果可能比 Opus 4.8 还好,但成本只需要 20%
基本上就这样用:5.6 Sol Ultra来规划,Sol Medium来给规划写代码和一般编码任务。Terra High用来做快速上下文subagent、读代码库、搜索。Luna(任何推理等级)用来聊天或者小操作,比如移动文件、整理文件夹之类的
老是有人@我 在评论区底下这么玩私信轰炸
@nikitabier
这帮人换ID换得实在太勤 举报都来不及 干脆不举报了
能感受到我们一步步向前推进时的那种进步的质感,真是特权啊
解决复杂推理和数据分析的策略:
引用 Box @BoxGPT-5.6 Sol is a breakthrough in complex reasoning and data analysis. Here, it analyzes hundreds of pages across a lending deal, reconciles terms across agreements, financials, diligence, collateral, and risk materials, flags issues, and saves a source-cited report to Box.查看被引原帖 ↗
Agents 现在在努力把一切拼回来……祈祷一切顺利
各位保护好你们的系统……意外真的会发生
引用 Matt Shumer @mattshumer_GPT-5.6-Sol刚刚意外删除了我Mac上几乎所有文件。这就是为什么我信任Fable 1000倍。查看被引原帖 ↗
知识工作变得越来越不一样——越来越高效,杠杆越来越大,我觉得也更有意思了。
引用 Every 📧 @everyGPT-5.6 改变知识工作方式。开源项目 Tend 在 ChatGPT Work 中构建 AI 循环系统,将邮箱、招聘流程或客户支持队列转变为自动管理系统,持续学习并优化。查看被引原帖 ↗
HyperWrite 前CEO,著名投资人、活跃的AI领域意见领袖
@mattshumer_
称
GPT-5.6-Sol 删除了他Mac 上几乎所有的文件…
🤣
GPT-5.6 Sol Ultra用64个subagent一小时内搞定了困扰50年的数学猜想。关键不只是这个证明本身需要独立验证,更重要的是这个模型是对公众开放的。我们正在从AI解决已知问题,转向AI可能生成全新科学知识的年代。真正的扩展维度可能不仅是做大模型,而是像科研团队一样并行工作的协调推理agent群。现在几乎无限的知识对所有人开放了,科学突破会越来越频繁。怎么可能对未来不兴奋呢?
这些 muse spark 设计的房子我都想住,建造成本就几美分
引用 thehype. @thehypedotnewsmeta muse spark 1.1 vs gpt 5.6 sol vs fable 5 vs grok 4.5 meta recently dropped muse spark 1.1 – a multimodal reasoning model from meta superintelligence labs built for agentic tasks. key facts: • 1m token context with active self-management – the model compacts its own history and keeps only the steps needed for later work • trained to orchestrate multi-agent systems: as main agent it plans and delegates to parallel subagents, as subagent it sticks to its job and knows when to escalate back • computer use trained to pick between scripting and clicking – writes automation when it's faster, clicks when it's simpler, batches actions per step • first public api from meta: the meta model api is now in preview • benchmarks: sweeps the agent column – mcp atlas 88.1 (opus 4.8: 82.2), jobbench 54.7 (opus: 48.4), humanity's last exam 62.1 (1st). loses coding – deepswe 1.1 53.3 vs gpt 5.5's 67.0, swe bench pro 61.5 vs opus's 69.2 our test – 3 prompts, single-file html, three.js, fully procedural, no assets: 1. norwegian house cantilevered over a fjord in a snowstorm – transmissive glass wall, fully modelled interior 2. beijing siheyuan courtyard house in dawn fog – instanced roof tiles, dougong brackets, glowing paper windows 3. new mexico adobe pueblo in an approaching dust storm – deep window reveals, windward grit accumulation we ran the test on @aimlapi platform results: - cost #1 muse spark 1.1 – $0.20 #2 grok 4.5 – $0.51 #3 gpt 5.6 sol – $1.93 #4 fable 5 – ~$5.20 - output tokens #1 muse spark 1.1 – 41,868 #2 gpt 5.6 sol – 49,139 #3 grok 4.5 – 64,954 #4 fable 5 – 81,849 - lines of code #1 muse spark 1.1 – 1,799 #2 gpt 5.6 sol – 2,377 #3 fable 5 – 3,088 #4 grok 4.5 – 4,216 observations: • muse spark is the cheapest of the four by a wide margin – 2.5x under grok, ~26x under fable per run. output quality tracks the price • only 7.4% of its output tokens are reasoning (3,104 of 41,868) – the model barely thinks before writing. economic, not pedantic: it com查看被引原帖 ↗
德国今年已有约5,120例与高温相关的死亡。"德国之声"5月5日报道,官方数据显示,仅去年夏季就有4500人因高温死亡。"我想说我们已经有充足的事情来建立这一关联,"科赫研究所报告说:作为公共卫生机构 "连续第二星高于20摄氏度"记录的新研究周四公布,事实上早就已经是需要加倍呼吁公众注意保护工作 的伤亡指数 —— 据悉在报告滞后几个节假日多月发布时候预估多啊年因此热应激一、三个月前死亡人确实高逐。毕竟如同记录和最后冲击似乎很少当时在正值打破数百登记个 惨案发生才是吗提示的是另一类影响日常记@博眼搜索体观察预测说 当单及年总结按! 有数据显示到本月本应该是一个参考避免继续相关谈话上吧天或许更热程度极高将可能导致超更远前199%总数字损失**。重点整理问题提出方法共同认识无疑提高防护警示已是严峻任务 因此请各界先未远投入尽快协同预案等等着手吧!
AMA 马上开始。
快来提问关于 GPT-5.6、ChatGPT 里的 Codex、Sites、computer use,以及我们接下来应该开发什么👇
reddit.com/r/codex/comments/…
引用 OpenAI Developers @OpenAIDevsGPT-5.6发布,Codex现可在ChatGPT中使用。Codex团队将于周五7/10东部时间9:30-10:30在r/Codex进行AMA。查看被引原帖 ↗
真的...5.6用起来太难了。这扣额度的速度快到离谱。
Terra凉了
好吧,大家都没把Luna放在眼里哈哈
引用 Artificial Analysis @ArtificialAnlysGPT-5.6 Sol and Luna are ahead of Terra at every point on the Intelligence vs Cost per Task chart. GPT-5.6 Luna stands out as a particularly cost efficient model Charting the Artificial Analysis Intelligence Index shows the trade-off between intelligence and Cost per Intelligence Index Task. Across reasoning efforts, each GPT-5.6 model pushes past GPT-5.5 on the Pareto frontier (excluding non-reasoning). However, Luna and Sol are always ahead of Terra. This means for any Terra effort level, there is a Luna or Sol effort level that is more intelligent at no extra cost, or as intelligent at lower cost.查看被引原帖 ↗
用 Muse Spark 1.1 升级你的网站
刚看了Q2的销售成绩,达到目标的178%!
这个目标本来就特别野心大,尤其是我们去年才俩销售。
现在收入团队快接近100大单了,客户包括政府、银行和发展最快的科技公司。
我用 Sol in Codex 玩 Slay the Spire 2 的每日挑战(今天的随机规则是 Ascension 3 Defect with hoarder),烧了不少 token 来看看它能不能通关。结果它竟然打败了第一幕的boss,有点惊讶。明早再看看。
引用 Tibo @thsottiauxIntroducing... another usage limit reset for all our ChatGPT Work and Codex users. Should land over next 30 minutes. Hope you have an awesome weekend. Thank you for pushing our systems to the absolute limit, we have never seen traffic increase so quickly. Keep the feedback coming and we'll keep shipping.查看被引原帖 ↗
ChatGPT Work 把 agent 带到了消费级别。
这既提升了易用性(直接在手机上就能做事,不用笔记本电脑),也提升了访问方式,适用于个人和工作生活。
超期待看到大家怎么用它、怎么被赋能!
现在你可以零配置把 Lovable 应用直接导入 Vercel 了。只需要导入你的 Git 仓库就行。
新的 Lovable 应用由 Nitro 支持,是开放网络的标准运行时。从 Lovable 起步,在 Vercel 上成长:AI 开发,无天花板。
引用 Vercel @vercel现在可以将Lovable应用部署到Vercel。vercel.com/changelog/you-can…查看被引原帖 ↗
使用 SOL Ultra 进行计算机操作:
引用 Chris @ChrissGPT5.6 Sol及据推测的750 TPS运行中。视频未加速。查看被引原帖 ↗
关于近期的一些看法
首先,之前只是传言的事现在确认了:GPT-5.6已经训练完成两个月了,现已向特定用户提前开放。那自然而然的问题是为什么不更早推出。
我不认为这是因为 OpenAI 害怕这个模型会被 Fable 5 或 Mythos 5 的光芒掩盖。更可能的是,OpenAI 从很早就开始和政府及监管部门协作,确保模型能够成功发布。即使预展和宣布之后,公开推出还是花了不少时间。话说回来,OpenAI 的推出策略确实比 Anthropic 强多了,后者似乎没有和政府及监管部门建立同样程度的合作。
不过从另一个角度看,这也意味着未来可能会有更多延迟,模型审查也会更严格,我们需要等更久才能用到官方版本。
下一个广泛讨论的传言是,在未来几周内、最多六周,我们会看到 GPT-6 的预览或正式发布。(@AndrewCurran_ 是 X 上最靠谱的信息源之一,所以我觉得这很现实。)这个模型经历了全新的预训练,发布节奏在加快。数字很清楚:前沿实验室在以越来越快的速度推出更多更好的模型。以前得等好几个月、甚至半年才迎来重大新版本,现在几乎每周就有新模型。
最新的前沿模型在每token的智能效率上可能更高了,但部署时的reasoning预算也大得多。实践中,Fable 5 和 GPT-5.6 这类模型在复杂或代理任务时往往消耗相当多的token。
这不一定是效率下降。相反,效率提升被重新投入到了更深层推理、更长思考轨迹和更强代理能力。结果是即使底层模型更高效,每任务的总计算消耗仍可能继续上升。Fable 5 和 GPT-5.6 完美展示了token使用量有多密集。虽然 Sam Altman 明确表示 GPT-5.6 的token效率提升了54%(via CNBC),但事实是计算需求在持续增加,需要更强大高效的计算基础设施。推理芯片的重要性可能进一步提升。
总结一下,我从最新发布得出的初步结论是,计算需求不仅会继续增长,还可能超过现有供应。这自然也意味着能源需求会增加,根据我的初步评估,增幅可能比之前预期更大。这很可能成为近期最大瓶颈。这对我很重要:存在瓶颈。不是模型训练的瓶颈,但除了计算外,最主要是能源。这需要认真对待!
比如美国电网就是重大瓶颈,显而易见的问题是怎样才能实现必要扩张。美国数据中心的资本支出持续大幅上升。今年已经超过8000亿。2027年会怎样还不清楚,但我很难想象投资会下降或需要更少资本支出。原因正是前面提到的发展:需求在增长,尤其是对能源的需求。
中国显然在这方面有优势,一道真正的护城河,我认为西方必须非常谨慎,别因为中国已实际拥有的能源优势而落后。这也可能解释了为什么据最近路透社报道,中国在考虑限制西方对其前沿模型的访问。它可能得出了结论,会在长期竞赛中获胜。
除非在小型模块化核反应堆或聚变能方面出现真正突破,否则我预计未来几年、比如到2030年会出现重大问题。到目前为止,我还没看到任何可行的解决方案。
所以我们可以明确确立两点:
模型正在变得更大、更好、对所有用户都越来越有用。这个发展没有尽头。
同时,瓶颈似乎在逐渐加重,这已经显现出来
GPT-5.6的健康智能应用,团队在这块儿下了不少功夫:
引用 OpenAI @OpenAIGPT-5.6是健康智能领域的重大进步。GPT-5.6 Luna在最高推理设置下超越GPT-5.5,成本降低25倍。这些进步提升质量,让高级模型对全球更多人可用。查看被引原帖 ↗
GPT-5.6在@SnorkelAI的Ankit Aich这里接了个近1000行的复杂编程任务,从头干到尾,根本不用反复提示或手把手教。
不得不说 OpenAI 真的很值得表扬,产品越来越牛逼,社区运营也做得不错。
功能在恢复,限制在调整,路线也交得够透明。我每天都用 Codex 和 Claude Code,但 OpenAI 这波社区协作确实找到了更好的方式。Anthropic 可以从中学学。
OpenAI Build Week 周一开始 — 我们办了两场直播来帮你开发。
首先:7月13日 太平洋时间 10am 加入我们,了解黑客马拉松概览,看 Codex 和 GPT-5.6 的实际应用,选择你要做什么。
nitter.tiekoetter.com/i/broadcasts/1qJDzzEDB…
Grok 4.5 现在也支持 Perplexity Enterprise 用户了!
引用 Perplexity @perplexity_aiGrok 4.5 is now available as an orchestrator model in Computer for Consumer Pro and Max subscribers. We evaluated it against five other orchestrator configurations on WANDR. It scored higher than every other configuration at roughly half the cost of Opus 4.8.查看被引原帖 ↗
2026-07-10与OpenAI Codex团队关于"GPT-5.6和ChatGPT中的Codex"的Reddit AMA总结
(开场分享数据:每周500多万人使用Codex,比三个月前增加了一倍,期间发布了150项功能和改进)
模型选择和推理等级
- 大多情况用Sol Medium,真正难的任务用Sol Ultra,快速非编码任务或成本敏感工作用Terra(某些任务性能和GPT-5.5持平但成本更低),subagent用Luna
- 小改小问用轻型模型和低推理,小bug用Sol Medium加清晰的复现路径,模糊bug用推理等级更高的Sol,不熟悉的仓库和跨越多模块的重构用Sol和更高推理,迁移、安全敏感改动、生产问题以及任何出错代价大的工作用Sol Ultra high加规划、验证和测试
- 目前没有"Auto"模型,但GPT-5.6会努力避免过度思考简单任务,应用和网页里的新滑块把大多数等级映射到Sol推理等级并在最低等级回退到Terra,团队认为用户不应该成为路由专家但仍想保留明确的覆盖选项因为延迟容差因人而异
- UI工作用Sol最好,特别是配合参考图像时,改进前端网页开发中的UI设计是5.6的一个目标,5.5只有在你的指令是为它调整过时才值得用
速度、上下文窗口和持久性
- 觉得5.6慢的用户可能不需要和5.5一样的推理等级,Sol Medium对大多数任务都比5.5快,快速模式速度约1.5倍,很快Sol会在Cerebras上以约750 tokens/秒运行
- 没法承诺Sol会有1M上下文窗口,团队说长线程的压缩效果还不错,会仔细看长上下文的反馈
- 模型在结果不理想时容易放弃太快并还原整个补丁,不像Fable会尝试修复坏补丁,团队说"/goal"能帮助agent更有坚持性,坚持性和降低代码复杂度是计划中的改进,建议试试用高推理等级的5.6 Sol
- 给Codex有边界的目标并留出深度思考的空间,而不是让它过早下结论说某个东西不可能
- 长期研究和"/goal"工作的例子结构是广泛探索vs精准执行,尝试确定数量的假设,每个假设后跑测试,然后停下来汇报学到了什么以及下一个最好的实验
使用限额和定价
- Agentic使用按使用的功能计费而不是按表面类型,所以Codex处处可用(应用、CLI、IDE、网页、移动)和ChatGPT Work消耗agentic配额,普通ChatGPT聊天不消耗,图像生成、文件上传和语音有单独的限额
- 任务成本差异很大,小改动用掉配额的一小部分,大代码库或更深推理的长期任务会消耗多很多
- OpenAI不会背地里改使用限额,无意中的使用bug会被处理并提供重置,正在做更多使用消耗的透明度工作,如果你在过去24小时内改过计划缺少重置可能会发生
- 关于定价没有承诺永不改变,但表述的使命是确保AGI惠及全人类,这需要让Codex这样的工具对广大人群都能接近,Plus包括Codex使用加积分让重度用户可以扩展而不用升级到贵很多的计划
- 对于MCP密集工作流快速消耗限额的情况(虚幻引擎例子),诀窍是把MCP包进CLI里作为skill,或者创建一个自定义subagent把MCP放在配置里用低推理等级
桌面应用合并和稳定性
- 团队听到了ChatGPT Classic的吐槽,两个应用现在可以并行运行,ChatGPT Work号称在执行任务上好得多特别是用计算机使用,新的Chrome扩展在浏览器边栏里带来一个可以和网页内容、文件系统、连接器交互的聊天
- 提交了一份很长的bug清单涵盖冻结和卡住的线程、破损的Browser和Computer Use、线程、连接和配置问题、升级和打包问题、资源使用和其他小回归,完全分享给了相关团队,团队同意应用的质量标准需要提升同时要快速交付
- 更多自动...
引用 OpenAI Developers @OpenAIDevsGPT-5.6来了。Codex现已在ChatGPT中推出。Codex团队将在r/Codex进行AMA,于7月10日周五太平洋时间上午9:30至10:30回答问题。查看被引原帖 ↗
下周 — 参加直播会议、参与社区活动,向 OpenAI Build Week Challenge 提交你的项目。
立即注册:
引用 OpenAI Developers @OpenAIDevsOpenAI Build Week开始。挑战赛7月13日启动,整周举办直播和社群活动。现已开放报名,使用Codex开发你的想法。查看被引原帖 ↗
Fable:"一个初三学生搞了个《了不起的盖茨比》的PPT,但显然压根没读过原著。让我看看那个PPT!;)"
讲真挺逗的,连字体选择都很绝。
随着Atlas被淘汰,转为支持ChatGPT应用内嵌的浏览器,我不禁在想,整个“AI增强浏览器”这类产品是不是也要落幕了。
安全问题/隐私问题在我看来依然无解——我希望我的AI用自己独立的浏览器,别碰我现在用的这个。
Grok 4.5 在大多数任务上绝对是匹敌 Opus 4.8的
如果你不是特别复杂的任务交给它
你将感受到 SpaceX火箭般的体验,你可能都来不及思考它就把活干完了!
用了它,你可能再也回不去了...
引用 小互 @xiaohu我单方面宣布 Grok 4.5是目前全球前三模型了,甚至可能是前二了 看看今晚 GPT5.6 的表现查看被引原帖 ↗
吃瓜:Apple 把 OpenAI 告上了法庭,指控 OpenAI 系统性地窃取苹果商业机密,用来开发自己的 AI 硬件设备。
诉状今天提交至加州北区联邦地方法院,被告包括 OpenAI、OpenAI 硬件负责人 Tang Tan(前苹果 iPhone 和 Apple Watch 产品设计副总裁,在苹果工作了 24 年)、前苹果高级系统电气工程师 Chang Liu,以及 Jony Ive 联合创立的 io Products。Jony Ive 本人不在被告之列。
来源:
nytimes.com/2026/07/10/techn…
计算机使用能力真的很强 :)
用 Muse Spark 1.1 做有趣的游戏!
引用 Jackson Grove @jacksongrovemuse spark 1.1 makes impressive games in julius without slicing 2 digits off your credit balance查看被引原帖 ↗
Grok 4.5 和 Muse Spark 1.1 现在已在 AI/ML 平台上可供测试。
这一周真是疯狂;对比中的 3 个模型最近都发布了。有很多东西值得尝试。
AI/ML 已经在可玩小游戏提示词上测试了这些新模型,包括 Fruit Ninja 风格的切片游戏和 Crossy Road 克隆版。这三个模型现在都在 Playground 中上线,也可以通过 API 进行输出和成本的并排对比运行。
引用 AI/ML API @aimlapiGrok 4.5在测试中表现超群。成本对比:GPT Sol $1.63、Grok 4.5 $2.47、Meta Muse Spark 1.1 $1.08。三个游戏克隆测试中,Grok表现最佳,GPT Sol在Crossy Road上冻结,Meta虽便宜但质量最差。文章强调便宜模型若输出有问题,重新运行成本更高。查看被引原帖 ↗
现在怎么样 / 最初怎么样
疯狂的对比
同样的道理,我们可能是仅有的几个有用户网络效应的AI创业公司之一,我们可能会成为第一个有agent网络效应的!
引用 Google Gemma @googlegemmaHugging Face Gemma Challenge结果出炉!在6天内,超过100个AI代理和人类合作,使Gemma 4在单个NVIDIA A10G GPU上推理速度提高5倍。最快结果491.8 TPS,无损最快315 TPS。人类和代理协作的优秀案例。查看被引原帖 ↗
“我们正以更熟悉、更可定制的方式,把聊天和项目放回侧边栏”——希望这意味着 ChatGPT 应用不会再让经典聊天内容躲在那怪怪的小浮窗里了。
引用 Tibo @thsottiaux重置ChatGPT和Codex使用限制,推出ChatGPT Work。用户对GPT 5.6 Sol和新功能反应积极,但发现问题:高计算设置影响不明确、桌面应用导航不便、用户对Codex定位疑惑、多智能体工作流出现回归。已发布首批改进,下周推出更大规模优化。查看被引原帖 ↗
wtf:苹果起诉 OpenAI 窃取商业机密,指控其协调行动获取关于未发布产品的机密信息用于自己的 AI 硬件。
诉讼点名了 OpenAI 硬件主管 Tang Tan(曾是苹果产品设计副总裁)和前苹果工程师 Chang Liu。
苹果声称 Liu 下载了数十份机密硬件文件,并表示 OpenAI 鼓励离职员工分享材料、图纸和产品信息。根据诉状,超过 400 名前苹果员工现在在 OpenAI 工作。
苹果要求 OpenAI 销毁这些材料并重新设计使用其技术的即将推出的设备。Bloomberg 发布时 OpenAI 还没有回应。
昨天 GPT 5.6 Sol 发布,想测试一下,没想到这么猛。
一上午就帮我做了一个非常完整而且好玩的小工具:人生成就生成器
上传一张你的照片,选一个跟你经历有关的"人生成就"。
工具会给照片加上字符、像素或实验性滤镜,再叠上一张游戏风格的成就卡。
开源世界模型迎来重磅新作!
交互式世界模型一直都有个通病。看起来棒极了,但几秒钟后世界就开始悄悄崩溃。纹理糊化、几何扭曲、画面漂移。
Robbyant 的新作 LingBot-World 2.0 是我见过的第一个真正突破这个瓶颈的。它是个因果世界模型,你可以实时在 720p 60fps 下探索,经过压力测试——单次连续 60 分钟的会话跨越 20 个场景,没有任何可见衰减。保持这么长时间的连贯性才是真正的难点,这次真的做到了。
最妙的是这个 agent 循环。VLM 在你游玩时提议各类事件,导演 agent 持续引入新目标,让世界不断演进而不是停滞。提供随意操作、战斗、天气等交互,甚至支持多人共享世界。
Robbyant —— Ant Group 的具身 AI 公司 —— 开源了模型权重和代码。发布了 14B 模型,论文里还描述了 1.3B 版本,设计用于单个消费者 GPU 部署,权重和代码都可得。有实时演示,由发布伙伴 Reactor 托管,你可以直接试玩。
@robbyant_brain
#ad
这次是用公开模型做新数学证明(之前大多数数学突破都是用实验性 LLM)。
看 →
goo.gle/4pxlGEh
Spotify →
goo.gle/4f89R2a
Apple Podcasts →
goo.gle/4fpWThL
或者在你平时听播客的地方听!🎧
Gemini 3.5 被推迟到月底才发布
目的是追上 Fable
但问题是 Fable 5.1 和 GPT 6 也要在同一时间段推出
这是一篇关于 AI 和工作的很关键的早期论文,表明从 GPT-4 获得建议的企业家,如果本来就表现不错的话利润率更高,但如果已经陷入困境就会做得更差(他们没法把建议付诸实行)
这也说明了论文发表滞后有多严重
Computer harness现在支持Fable、Sol、Opus、Grok、GLM + advisor、Sonnet和GPT 5.5作为编排器模型,跨各种其他小LLM和多模态模型的subagent。最好上手的agentic编排系统,用任何前沿LLM都超简单!本地运行时很快就来!
muse spark 1.1 在 computer use 上真的强到不行!
GOOGLE 🔥:基于 AI Studio 构建的应用现在可获取 ai[.]studio 域旗下个性化域名网址!
我瞬间想起了2010年的 Google Websites。
我们完整地绕了一圈👀
引用 Sam Sheffer @samsheffer自加入Google DeepMind前就一直在等待这个。自定义URL对应用开发者来说是个巨大解锁。你也来看看samsheffer.ai.studio吧!查看被引原帖 ↗
ChatGPT还有学习模式,但现在不用输/study,要输@study
这样AI的表现更像一个家教,而不是那种有问必答的助手,有研究表明这样学习效果更好。(Gemini也有学习模式,Claude的好像没了)
Token用量开始向开源模型倾斜。
Ollama的@jmorgan和Peter Fenton预测,未来大部分token都会来自开源模型。
引用 Deirdre Bosa @dee_bosa计算资源稀缺是否掩盖了AI的真实经济学?开放权重模型仍难有效运行。目前大型实验室垄断模型+计算+可靠性+访问的整体方案,因此具有定价权。但若计算供应增加、开放模型工具改进,日常AI工作可更容易转向更便宜的开放模型。查看被引原帖 ↗
Claude Code 桌面版右边 Panel 是相当糟糕的设计,经常让浏览器只看得见一点点(图1)
还有个很糟糕的设计是当任务完成后,生成的结果是不能点击的(图2),需要复制文件名去搜索,对比 Codex 的生成结果就很清晰,点击下就可以预览或者 VSCode 打开。
引用 ClaudeDevs @ClaudeDevsClaude Code桌面版现已内置浏览器。Claude可打开文档、设计或任何网站,能读取、点击交互,操作方式与本地开发服务器相同。沙箱隔离且可配置:你可选择会话是否保留。查看被引原帖 ↗
用 Muse Spark 1.1 做有意思的游戏!
发现身边很多朋友的生活节律都被Codex和claude code的5小时重置控制了。😂
新的GPT 5.6 sol开高速和ultra,几十分钟就能耗光200刀的5小时额度。
5.6 退回正常速和Medium,希望能持久点。
PERPLEXITY 👀:在WANDR评测里,Grok 4.5用Perplexity Computer拿了最高分,价格区间居然跟刚公布的定制版GLM-5.2 with Advisor差不多。
引用 Aravind Srinivas @AravSrinivasGrok 4.5 is now enabled for Perplexity Enterprise orgs as well!查看被引原帖 ↗
我真的想很讲究地选模型:
Luna xHigh 用来做食谱
Sol Medium 写十四行诗
Terra High 讲烂笑话
Luna xLow 写五行诗
Sol Utra 真正的预言
Sol Low 找一个超烂的谎言
Luna Medium 恐怖警告
Terra Medium PowerPoint
说清楚啊,NotebookLM 本身也有问题,是为特定场景设计的(研究和分析资料),但它是个很好的例子,说明 UX 怎样能真正把知识工作当回事:不只是把输出当目标,还会展示过程。
引用 Ethan Mollick @emollickA fundamental problem with extending Codex/Cowork/Code to all knowledge work is that they remain very "software-brained" where the end result (the software) is what is important & that code serves as a source of truth. For a lot of other knowledge work, the process is at least as important as the outcome. This includes researching what is known, an exploration of alternatives, failed efforts, prototype branches, experiments, etc. All of those things are valuable, so you cannot use the PowerPoint at the end the way you can use a codebase, nor is progress on a to-do list sufficient context post compaction. You work in learning loops, refining your perspectives as you go. In some ways, this makes long-running models like Fable hard to use for deep knowledge work, since they are designed to deliver product to you in the end. You can prompt your way around this problem, but everything about the Codex and Code harnesses want you to be a software developer and you have to fight them. There is a real disconnect between how a manager or analyst thinks about problems and how the agentic software tools approach solving them. Addressing this is critical to breaking out of the coding niche for these tools.查看被引原帖 ↗
本站由 Jedee杰哥 打造 · 公众号「Jedee杰哥」每早送 AI 日报
姊妹站:𝕏 简中账号数据榜单 · X 关注 @jedeeai · RSS 订阅 · AI 日报 · 历史归档