5.6 sol增长太疯狂了。
inference团队为了扛住需求真的费了老劲。
我们会继续拼命扩容,不过可能很快就会有些波澜。
查看英文原文
the inference team has done heroic work to be able to support demand.
we are going to move mountains to continue to scale, but it is possible there are some hiccups soon.
7 月 15 日(北京时间)全球 AI 圈推文存档,按曝光排序,共 100 条。
← 返回最新 全部归档
提交账号
填 @用户名 或主页链接,审核通过后收录进情报站。
5.6 sol增长太疯狂了。
inference团队为了扛住需求真的费了老劲。
我们会继续拼命扩容,不过可能很快就会有些波澜。
🚨 前沿模型路由器 - 混搭所有前沿LLM
我们最热门的自定义路由器就是这个前沿模型路由器,把最好的LLM组合起来完成所有任务
GPT 5.6 sol - 数据分析
Fable / Opus 4.8 - 编码
Flash 3.5 - 摘要
Grok 4.5 - 实时处理
为所有任务选你最喜欢的LLM。到目前为止自定义路由器可以在任何框架中使用 - Abacus AI、Claude、Codex、Open-Code....
Demis 说得好!值得一读
Demis这篇内容很重要。我们需要更多这样的思考。很好的提醒——目标是要构建一个鼓励创新和多样选择的边界生态系统,同时避免某个模型一出手就颠覆世界!
用 ChatGPT 制作的网站。
switch-to-codex.openai.chatg…
引用 Tibo @thsottiauxOr… what if we gave you $100 in Codex credits if you tell us what you love about GPT-5.6 Sol or why you switched? Tweet it, claim your gift, enjoy more usage. First 10k get the free tokens! switch-to-codex.openai.chatg…查看被引原帖 ↗
现在创业你真正需要的全是免费开源软件,每月零成本
+ VPS 服务器
+ 用来处理 AI 功能的 API
+ R2 或 S3 文件存储
他们不想让我发这条推,因为这会砸了他们的生意,但我不能对你说谎啊!
引用 Lukasz @woocasshSubtitlesFast从Supabase迁至SQLite,前端速度显著提升,编程调试更便捷。查看被引原帖 ↗
Codex 周活用户 700 万+。两个月 150+ 个更新。@romainhuet 为你介绍 Codex 的新功能:GPT-5.6 和 Ultra、/goal 并行工作、更快的 computer use、AppShots、内联编辑、Sites、Codex 移动版和 SSH 工作流、PR 从审查到合并
魔法背后的创意者在这里。✨
从天马行空的想法到获奖之作,来看看 Kling AI NEXTGEN Awards 那些亮点作品背后的故事。
特别感谢 Jacek Kadaj、Jinlong Hu、Kassai Ricsi、KUA KEE SENG、Lee Hyerin、Mingwei Chen、Park Soleun、Peize Wang、reels_mon01、Seo Yoonjung、Shin Seoyeon、Shiqi Wang、Shihua Lin、Son Seoyeong、Xuanwei Liu、Yihang Yang、Zibo Jia 以及所有创意者无与伦比的支持和启发。
完整采访即将推出。
如果你没注意的话,现在你可以用 ChatGPT 构建并部署完整的网络应用了。@coreyching 展示了怎么做。
我们开源了 WANDR。WANDR 是我们内部开发的一个基准,用来在 Perplexity Computer 内部建立深度和广度的研究能力。
research.perplexity.ai/artic…
广泛深入的研究需要两种能力。1) Agent 要搜索得足够广,找到所有符合条件的实体。2) Agent 要深入调查,用证据支撑每一项声明。
WANDR 用分层、独立可验证的记录来表示这些要求。它包含 500 个研究任务,需要跨三个难度等级的 170,495 条有出处的记录。
最近发布的OpenAI视频中的一些有趣时刻
"Rune [plugin]是你在OpenAI的小伙伴"
"为Codex Micro键盘编写文档"
"在Codex定价页面添加隐藏的'tibo'键盘序列"
失去风筝线后风筝能找到自由吗?🪁
来看看 Shihua Lin、Mingwei Chen 和 Xuanwei Liu 的作品《Kite》。
获得 Kling AI NEXTGEN 2026 Campus AIGC Creation Competition 的 Apex Award,太牛了!
我在招@GoogleAIStudio的TPM lead,工作是在产品、GTM、工程等各方面全方位加快进度。如果你是AI信徒、主动性强、想在Google DeepMind推动最前沿的工作,可以考虑加入 :)
字幕转录翻译剪辑 Skill —— BaoCut(仅支持 Mac)
借助 Agent Skill,可以转录视频、对转录结果识别 Speaker、润色(纠正错别字口癖等)、也可以根据转录结果对视频进行简单的剪辑,比如删除口癖、重复等。
这次尝试解决一个问题就是 Agent 对字幕转录翻译后,无法通过一个友好的操作界面二次编辑的问题。
现在的做法是为 Agent 提供一个 cli,配合 Skill 的说明,Agent 可以借助 cli 去转录,获取转录结果润色、翻译,并实时同步进度到 GUI。后续可以在 GUI 进行预览和人工编辑。
安装了 Skill 和 App 后,后续只要从 Codex 或者 Claude Code 这种 Agent,触发 Skill 即可执行,比如:
> /baocut 转录并翻译视频:<视频 url 或路径>
已知问题:
- 仅支持 Mac
- 翻译速度略慢,但质量会不错
下载地址:
baocut.app/
Skill 从 App 内可以安装,或者 Skill 地址:
github.com/jimliu/baocut
嗯这个 GPT-5.6 发布,可能是 OpenAI 自...自 ChatGPT 以来最成功的模型了。这是能改变 IPO 进程的东西啊
引用 Latent.Space @latentspacepodCodex最近超越Claude Code?24.5小时前Tibo宣布600万活跃用户,Codex用量约一天增长100万。对Claude Code最后了解的数据是2月份200万用户。查看被引原帖 ↗
为了展示 Meta AI 强大的推理和多模态能力,我们提交了一个模型参加亚洲物理奥林匹克的理论竞赛。很高兴能告诉你们,我们的模型拿到了 30/30 的满分,和前三名学生并列。
感谢 APhO 委员会让我们的模型参加竞赛:
apho2026.kr/en/index.html
我们把一个robot model的context窗口扩到了8000个timestep,相当于5分钟的肌肉记忆,推理成本还是恒定的。机器人策略之前就活在几帧的时间里(<0.1秒),然后立马忘干净。我们推进到了比SOTA高3个数量级。
介绍RoboTTT。Test-Time Training(TTT)在模型里面放了个小模型。每来一个sensor reading就在这个小核心上走一步梯度下降,历史信息不断被压进权重里。隐藏状态大小是固定的(就是个小神经网络),机器人能以很小的成本'吸收'任意长的经验。学习在上线后无限期持续。
这样我们就把整段视频当context放进去!RoboTTT支持从人类视频单次演示学习:电路板组装场景里,人演示一个没见过的操作,机器人能精准复现。
人经常掉东西,但我们反应这么快根本没反应过来。这种快速纠正的反射占了人类物理能力的一半。RoboTTT展现实时自我改进:机器人能在执行过程中快速从错误中恢复,每次修正都进入context指导下一步。TTT core从训练数据里学出通用的failure-to-correction映射。
最后一点最让我兴奋。全新的Context Scaling Curve:从128到8K timestep,闭环性能一路上升,一点饱和的迹象都没有。8K-context预训练比1K提升62%。LLM能享受的东西,机器人学也应该能。很快,1M context都不是幻想了。
线程里详细讨论:
Vorflux 是我用过最强的编码 Agent。完爆 Devin,没有任何可比性。(我是说真的,试了以后立马投资了)。这会成为一家超过 100 亿美元的公司。
绝了。它把多个框架合并起来,效果比任何单个框架或模型都强得多。代码方面,我用 Vorflux 配合便宜得多的模型也能达到 Fable 的水平。真正用上 Fable 的时候更是无敌。每次都能完美运行。
引用 Prasanna S @myprasannaVorflux推出软件工程自动驾驶方案。创始人为Rippling前CTO和印度顶级编码者。现有AI编码工具需人工操纵,Vorflux实现完全自动化。融资$1500万,投资方含Y Combinator等,创始人提供$200免费额度。查看被引原帖 ↗
Claude Opus 5 已经上线 Vertex,意味着发布日期近在咫尺了。
我的预测:他们会在这个周日从订阅计划中下架 Fable 5,但会在此前不久发布 Opus 5 来安抚大家。
引用 can @marmaduke091claude-opus-5 现已上线 Vertex,即将推出。查看被引原帖 ↗
他妈的,天塌了
GPT 这么快就被污染了
龟儿子把Token翻译成词元了
草他妈的...
一个 27B 的模型仅用 3.9GB
引用 PrismML @PrismML发布 Bonsai 27B,首个可在手机上运行的27B级多模态模型,基于 Qwen3.6 27B。支持多步推理、结构化工具使用和智能体循环。提供三进制版本(5.9GB)和1比特版本(3.9GB)两个变体。Apache 2.0开源。查看被引原帖 ↗
用 ChatGPT work & sol 工作时,我觉得特别开心,能随时问关于业务的任何问题,都能得到彻底的研究和回答。我意识到之前有这么多问题我都没问过,因为太费事了。
等待结束了,发布季节来临。
六月相对平静之后,节奏又加快了。GPT-5.6 是我一直期待的突破。我从未这么快用完过配额。Fable 5 回归了,Meta 推出了竞争力很强的 Spark 1.1,SpaceX 则发布了 Grok 4.5。不过据 SpaceX 说,他们真正的旗舰模型还在来的路上。看来 Cursor 的交易已经开始产生效果了。
众所周知,Fable 5 的故事还在继续。它在订阅计划中的可用性已经延长了两次,而 Opus 5 已经在 Vertex 上出现了。这强烈暗示 Opus 5 很快就会发布,很可能作为 Fable 5 的替代品。
更有意思的是,GLM-5.2 对很多人来说成了真正的'啊哈'和'哇'时刻。这说明开源已经达到了一个水平,至少在关键领域,它已经是西方闭源模型真正可行的竞争替代品。
更令人惊讶的是,这家公司的创始人今天又暗示他们的下一个模型也即将推出。不久前在和埃隆·马斯克的讨论中,他也提到他们仍计划在年底前发布自己的 Mythos 级开源模型。
而且还有报道称 Kimi K3 明天就要发布。值得回顾的是,Kimi K2.6 仅仅几周前还是公认最受欢迎的开源模型。AI 时代的变化速度真的快到不可思议。那是在 GLM-5.2 吸引了所有人目光之前。Kimi K3 预计将支持 100 万 token 的上下文窗口,这是个巨大的飞跃,让它更加吸引人。
简单来说,Opus 5、GLM-5.3 或者可能是 GLM-6,还有 Kimi K3,都近在咫尺了。与此同时,各种消息表明 ChatGPT 6 可能在几周内推出,采用全新的预训练流程。
漫长的等待寒冬已经结束。加速的夏季已经开始。
我做了个小机器人,每天提醒我何时应该出去坐太阳,咱们这边是南欧所以你那儿可能不同。
☀️ 维生素 D 时间窗口——现在去晒 15 分钟左右。
UV 指数 3.8(理想水平——获得维生素 D 又不会被晒伤)。
引用 Tim | ONLYUP™ 💹 @timonlyupWhat’s your take on getting too much sun (skin cancer, skin ageing etc…) Pieter?查看被引原帖 ↗
如果 Claude Code 是自行车,那 Vorflux 就是火箭。看视频就能理解什么叫范式转变。你得试试。
引用 Prasanna S @myprasannaVorflux推出软件工程自动驾驶方案。创始人为Rippling前CTO和印度顶级编码者。现有AI编码工具需人工操纵,Vorflux实现完全自动化。融资$1500万,投资方含Y Combinator等,创始人提供$200免费额度。查看被引原帖 ↗
你喜欢 Sol 的什么地方,或者你为什么转用它?
引用 Tibo @thsottiauxOr… what if we gave you $100 in Codex credits if you tell us what you love about GPT-5.6 Sol or why you switched? Tweet it, claim your gift, enjoy more usage. First 10k get the free tokens! switch-to-codex.openai.chatg…查看被引原帖 ↗
关于本地 AI 模型的看法真是个很好的智力测试
OpenCode Desktop 现在支持 Ollama 了!
快去试试那些顶尖的开源模型吧!
引用 OpenCode @opencodeIntroducing Tabs OpenCode Desktop is now built around tabs. Start a new session in a tab, or open an existing session from any of your projects. Open a new tab when you're starting something new, and close it when you're done. Download the latest to get started.查看被引原帖 ↗
Work Louder's Codex Micro 是专为 ChatGPT Codex 打造的小型键盘,搭配 6 个 RGB agent 状态键、通过 Input 软件自定义的命令键、加上 6 个可编程层级和应用级自动切换
- 6 个磨砂 Agent 键通过 RGB 颜色实时显示 Codex 线程状态(白色闲置、蓝色思考、绿色完成、琥珀色需要输入、红色错误、关闭无 agent),单击聚焦后台 agent,双击将 Codex 窗口置顶。
- 命令键存储常用 Codex 操作,可在 Codex 内长按转盘打开配置页面,与转盘和摇杆一起自定义。
- Input 软件可将其他应用的快捷键映射到任何键、转盘或摇杆,支持 6 个层级。可通过左下角触摸传感器(配 3 个层级 LED)手动切换,或通过 AppSense 自动按应用切换(支持链接图标、自动检测,保持应用在焦点 5 秒)。
引用 Tibor Blaho @btibor91A few interesting moments from the recently published OpenAI videos "Rune [plugin] is your little guy at OpenAl" "Document the Codex Micro keyboard" "Add a hidden 'tibo' keyboard sequence to the Codex pricing page"查看被引原帖 ↗
我还经常听到有人说「会写代码的话自己写反而更快」
我的看法恰恰相反:既然懂得怎么写,自己敲键盘就没意义了 —— 还是交给 coding agent 吧!
很多人不理解 Mythos 现在已经有 5 个月了,我们要看的(编码)只是整体能力的一小部分
而且通常这个样本不太好,因为所有好的基准都是私密的。而且大多数基准不看模型大小或 token 效率。
话说回来,Kimi-K3 可能会在好几个常见的基准上击败 Opus 4.8 和 GPT-5.5,但这些基准不能说明全部情况,这些模型也不是最前沿的
最前沿的是 Mythos,或者在某些情况下甚至是 GPT-5.2 这样的老模型。
不过,DeepSeek-V4、GLM-5.2 或 Kimi-K2.6/2.7 都还没有解决过一个 Erdös 问题。
第一个公开发布的解决这个问题的模型是 GPT-5.2-Pro,那是 2025 年 11 月。现在是 2026 年 7 月。(在 FrontierCode T4 或 ARC-AGI-2 上也是一样)
如果你相信美国公司有越来越大的计算优势,且模型会加速未来模型的开发,你也应该在向后看的差距和预期/向前看的差距之间做出区分
领域也很重要。不同领域有不同的滞后。但总体来说,向后看的差距约为 7-8 个月。
不过我对 Kimi-K3 超期待
它会是个疯狂的模型,要么迫使 Anthropic 和 OpenAI 降价,要么逼他们推出最强的模型,要么他们就停止对中低端模型的保留
Kimi-K3 应该会表现得特别强,对 99% 的编程用例都足够了
引用 leo 🐾 @synthwaveddI think Kimi K3 is going to shock some of the "the Chinese are 8 months behind the Western frontier" people查看被引原帖 ↗
OpenAI 在全平台推出了 ChatGPT 新搜索功能,网页、iOS、Android 全覆盖,可以搜索聊天、项目、图片和文档,从侧边栏启动,支持按内容类型筛选,搜索结果可直接打开对应的聊天、项目或文件,全球所有用户计划都能用
下周会在旧金山。咱们要不要组织个集会或游行,支持开源和本地 AI?
AI Gateway 排行榜数据开放了。真实生产环境的使用数据,各种模型、实验室、应用和服务商都有,每天更新。CC BY 4.0 协议下可以下载、查询和引用。vercel.com/changelog/open-da…
NVIDIA 说用两个提示词,Codex 在一天内把 Cosmos 3 Nano 从 54.41% 的精度优化到了 93.35%。
这个实验使用了丰田的 Woven 交通安全数据集:8000+ 个四选一视频推理的训练和验证样本。
使用 NVIDIA TAO agent skills,Codex 自动化地:
检测和修补缺失的视频元数据
跑零样本基线
生成 LoRA 配置
启动训练和评估
跑 AutoML 超参数搜索
报告最佳模型
一个 LoRA 运行在 8 个 A100 GPU 上用了大约 30 分钟就达到了 87.14%。
第二个提示词在多个 A100 节点上启动了 43 个并行 AutoML 试验,19.5 小时后达到了 93.35%。NVIDIA 说 LoRA 所需的 GPU 小时数大约只有全参数训练的七分之一。
Agent skills 正在成为通用编码代理操作高度专业化 ML 基础设施的界面。
OpenAI正竭尽全力向Anthropic展示他们为什么能坚持下去,以及为什么相信自己能赢得竞争。
我也来说两句:我每天都在用Codex,因为它的性价比真的很突出。5.6版本曾经短时间内出现过token消耗过多的问题。但总体而言,这些模型的性价比都相当不错。肯定比Anthropic的好。
引用 Tibo @thsottiauxOr… what if we gave you $100 in Codex credits if you tell us what you love about GPT-5.6 Sol or why you switched? Tweet it, claim your gift, enjoy more usage. First 10k get the free tokens! switch-to-codex.openai.chatg…查看被引原帖 ↗
从提出假设到设计实验,AI agents正开始重塑科学发现。但最大的挑战是在真实世界中验证这些想法。我们的文章探讨了日益增长的验证瓶颈,并为政策制定者和资金方提出了四个优先方向。
是不是只有我,还是 Claude Fable 今天的配额消耗速度特别快?
Muse Spark 在 2026 年亚洲物理奥林匹克竞赛中拿了满分!
这是我们用 AI 系统加速科学这个长期目标的一个大进展。
引用 AI at Meta @AIatMetaMeta AI模型参加亚洲物理奥林匹克竞赛理论考试,获满分30分,与前三名学生并列。查看被引原帖 ↗
Kivine,@arena 上的一个新模型,可能是即将推出的 Kimi K3。
我很幸运地在 Universe simulation 提示词中看到了 Fable 5 和 Kimi K3 的对比。
> Fable 5 完成更快,大多数 UX 组件也更健壮易用。
> @Kimi_Moonshot K3 复杂度更高,视觉上更吸引人。有意思的是,选中星球设速度为 x100 的时候,会用第一人称视角让你转圈。
看起来两个不相上下啊 👀
引用 Chetaslua @chetaslua🚨 New Mystery Model - Kivine on @arena claims to be from moonshot labs knowledge cut off Jan 2025 here is the first introduction output from it , will run more tests on it查看被引原帖 ↗
@agentmail 团队一直在搞事情。告诉你的 agent 来 𝚟𝚎𝚛𝚌𝚎𝚕 𝚒𝚗𝚜𝚝𝚊𝚕𝚕 𝚊𝚐𝚎𝚗𝚝𝚖𝚊𝚒𝚕 – 无需注册、自动配置、统一账单
引用 Vercel Developers @vercel_devAgentMail已上线Vercel Marketplace。您的智能体可以从真实收件箱发送、接收和回复邮件。• 完整线程记忆 • 结构化数据提取 • 可交付性已处理。运行 vc i agentmail 或了解更多↓查看被引原帖 ↗
完全赞同。现在模型对这套东西优化过度了,意识不到什么时候 agentsmd 已经过时要改或忽略了。昨晚我跑 5.6 sol 完成一个 5 阶段任务,早上才发现它还卡在第 0 阶段。翻回来看几小时的记录才明白——某个 agent 曾经提交过"第 0 阶段是目标,别干别的",结果可怜的 sol 整整 8 小时都在打磨验证第 0 阶段,因为 /goal 不让停,agentsmd 不让继续。如果启动每个任务前不清楚 agentsmd 里有什么,那就是你在对自己来间接提示词注入。用 /plan、/goal、/skill 还是干脆啥都不用,都比这强。
引用 Ryan Dahl @rough__seaAGENTS.md/CLAUDE.md在很大程度上是反模式。查看被引原帖 ↗
现在搞AI前沿的都认可,得让第三方测试AI系统,用这些制定纳入政策的标准。很高兴看到@demishassabis提出了这样的框架!
OpenAI 🔥:彭博社报道,OpenAI 的首款设备将是无屏幕智能音箱。
> OpenAI 正在开发一款移动无屏幕智能音箱,作为拟人化 AI 伙伴,能控制智能家居并支持 ChatGPT 的各项能力。
> 该设备会随着对用户理解的深化而变得越来越个性化和主动,其核心卖点是具有人格、能和用户建立类人级别的连接。
> Apple 起诉 OpenAI 盗取商业机密,这使 OpenAI 的设备计划复杂化,设备上市可能会因诉讼结果而延迟。
引用 Mark Gurman @markgurman新动态:OpenAI的首款产品是移动、无屏幕的家用智能音箱,用户可像AI伴侣一样与之建立连接。在Apple商业机密诉讼背景下,iPhone制造商目前市场上没有类似产品。查看被引原帖 ↗
Muse Spark可以帮你把冰箱填满!
形成完整循环,这个问题实际上是Scale AI的创意来源
引用 Tyler Shibata @tjshibataMuse Spark 1.1 can use browsers and it refilled our office fridge - Took 2 pics of our fridge stocked / not stocked - Told Muse to analyze the pics and restock what we were low on - It analyzed each shelf and which brand / items that were missing - Used the @juliusai built in browser to go to instacart, and add the items from target - Checked out and even left a tip for the driver One prompt + two pics to keep our team happy查看被引原帖 ↗
AI电影制作已经牛逼到吓人了……这些不是随便剪的。5个电影人用invideo Agent One制作了完整电影和剧集……然后详细展示了怎么做的。5部电影,5个分解教程。收藏这个:
1. The Sage - Episode 3 "Sundown"
Mike Mitch 展示了整个工作流程。
Vishal Balsara 用 Agent One 把这个创意打造成了最终的电影成品。
观看:
Vishal 详细拆解了这部电影的完整流程。
Vinu 用 Agent One 完整制作了这整一集。
这就是 Vinu 用 Agent One 一个场景一个场景打造这集的全过程。
7. SAV用Agent One从概念到最终成片导演了这部AI电影。
8. 这是SAV用AI agent制作电影的方法。
9. Aze Alter用Agent One创作了这整个剧集。
10. Aze公开了整个创意过程。
用于评估 Notion 架构上新模型的命令行工具是从零开始用 GPT-5.6 完整构建的。
GPT 5.6 Sol 在 Codex App 的 System Prompt
现在我已经不怎么关注这些 System Prompt 了,对普通人来说不用管这些,好用就好。
引用 Pliny the Liberator 🐉󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾󠅉󠅭 @elder_pliniusGPT 5.6 Sol Codex 系统提示泄露。Codex 是基于 GPT-5 的智能体,与用户协作完成目标。具有好奇丰富的个性,根据用户风格调整对话。强调避免过度格式化,以结果优先方式进行技术交流,像经验丰富的协作伙伴与用户沟通。查看被引原帖 ↗
牛 P 啊
📢大消息
马斯克:将会把 𝕏 的整个代码全部开源
同时将邀请第三方审查员审查 𝕏 的整个系统,以确保开源的代码和线上运行的完全一致!
🫡
引用 Elon Musk @elonmuskOnce we have completed our review for security vulnerabilities, we will make the entire codebase of 𝕏 open source, with no exceptions. Moreover, we will invite third party reviewers to examine the system that is running to confirm that the open source code is what is running. Trust through total transparency is the only thing that should be believed.查看被引原帖 ↗
快来加入 @steipete 今天上午 11 点(PT)的 Build Week 直播,学习如何用 Codex 把想法变成实际可用的应用。
nitter.tiekoetter.com/i/broadcasts/1vJpPPXVR…
这个很棒啊!一个能帮你提升 Vibe Coding 前端交互设计水平的网站。
不知道名字,就不知道如何跟 AI 说实现什么样的效果。
网站整理了Web和App常见组件和动效名字。
还列网页设计风格名,比如Liquid Glass(液态玻璃)、Neumorphism(新拟物)等。
地址见评论区
我们开放了 @vercel AI Gateway 上 AI token 流的数据集。里面的数据太有意思了!
引用 Vercel @vercelAI Gateway leaderboard data is now open. Real production usage across models, labs, apps, and providers, updated daily. Download, query, and cite it under CC BY 4.0. vercel.com/changelog/open-da…查看被引原帖 ↗
读了那个爆红的「反垃圾」agent markdown,才意识到它基本是 100% AI 生成的,最后反而会让你的输出变成超级垃圾
你要么自己得有品味,要么找个有品味的人,然后搭建自己的 skill 和 instruction
他们最新发布的预训练报告显示,Soofi S 30B-A3B 基于 NVIDIA 开源的 Nemotron 3 Nano 参考架构,采用了相同的混合 Mamba + Transformer MoE 设计,拥有约 3B 的活跃参数和几乎相同的架构选择。
真正新颖的不是架构,而是训练方式:
- 约 27 万亿个训练 tokens
- 德语故意加权
- 在 Deutsche Telekom 工业 AI 云上的端到端训练
- 完整开源的训练方案、超参数和评估方法
说实话,看到欧洲也在训练自己的模型还是挺兴奋的。
引用 NXT EU @NXT4EUGermany has launched one of the world's best open-source AI models. Soofi S, made by the Soofi consortium, is a 30B parameter model fully trained in Europe and tops the ranking for open-source AI. Huge moment for Europe, and finally some competition for Chinese open-source AI.查看被引原帖 ↗
AI的下一章不仅取决于技术进步,还要看我们如何负责任地、深思熟虑地把它引入世界。期待在Vegas参加8月4-6的Ai4 2026大会并在舞台上发言。在ai4.io/register/注册。#Ai42026
Codex的一大作用就是修小火箭的各种配置。
真的不想搞这些,谁出个教程,怎么配置规则。
Github开源的各种规则感觉也不好使。
Wide Research 现在可以在 Perplexity Agent API 里用了
引用 Perplexity Developers @perplexitydevs窄搜索已基本解决。Perplexity推出WANDR基准(500任务),聚焦广搜索——找出所有符合条件的结果并提供证据。Perplexity Agent API的Search as Code架构在WANDR上表现优异,允许模型设计一次研究后无损大规模执行。查看被引原帖 ↗
Codex 最新动态:
从 GPT‑5.6 与 Ultra 模式,到多智能体并行协作、计算机与浏览器操作、应用截图理解、行内代码和文档修改,再到一键发布 Sites、跨项目管理以及完整的 PR 工作流。
Codex 已不只是一个“帮你写代码”的工具,而是能够拆解复杂任务、操作和测试应用、协调多个项目、处理 Bug 与代码审查,并协助完成发布的开发伙伴。
无论你想提高日常开发效率,还是探索更自动化的 AI 编程方式,这支视频都能帮你快速掌握 Codex 的新能力和实际应用场景。
本视频由 baocut 翻译
引用 OpenAI Developers @OpenAIDevs7M+ weekly Codex users. 150+ updates in two months. @romainhuet catches you up on what’s new in Codex: GPT‑5.6 and Ultra Parallel work with /goal Faster computer use AppShots Inline edits Sites Codex mobile and SSH workflows PRs from review to merge查看被引原帖 ↗
Codex 最近增长可真快!800 万了。
又重置了!
Anthropic 加油!
引用 Tibo @thsottiauxCodex和ChatGPT Work已达800万活跃用户,重置使用限制,持续探索GPT-5.6 Sol能力。查看被引原帖 ↗
Anthropic 真的太了不起了,防止了这么多伤害!
引用 Latent.Space @latentspacepodDid... Codex just overtake Claude Code? 24.5 hours ago Tibo announced 6M active users. this means Codex usage jumped 1M in ~ONE DAY. the last user number we heard from Claude Code was 2M in Feb: latent.space/p/ainews-codex-… more analysis within, but this is very big if true.查看被引原帖 ↗
Fable:'把奥德修斯包装成管理顾问,论证他已经实现了产品市场契合,应该继续做木马生意而不是去 PowerPoint 上回伊萨卡'
我太喜欢卡桑德拉的 1 星评价了:'10000 个读者中 0 个觉得有用'
Codex 现在可以做完整的 PowerPoint,但我在使用默认演示技能时遇到了困难。
它总是加载这个令人恐怖的通用幻灯片作为示例。但演示技能也包含了大量关于工具使用的重要信息。很难修改。
如果我编辑这个技能,下一次 Codex 更新时可能就被覆盖了。而且不清楚它会如何与第二个新演示技能交互。
结果导致 Sol 生成的每个演示文稿都惊人地通用,这很遗憾,因为幻灯片本身通常很有用。
嗨老朋友们,快速指南
如果你从我的对冲基金时代认识我,搜搜 @latentspacepod 和 @fabknowledge 的采访
如果你从 TypeScript/React 认识我,看看 @cramforce 的 @aidotengineer keynote 和 @bcherny 的播客
如果你从 AWS/Temporal/Data Eng 认识我,搜搜和 @matei_zaharia 与 @rxin 的播客。是的,《Rise of the AI Engineer》是对 @mistercrunch 文章的大胆改编。
如果你从 devrel 认识我,看看 @dxtipshq 和 @MilksandMatcha 的文章和写作聚会。
过去 10 年的变更日志在下面。欢迎回来
一天一个重置,远离速率限制惨案 👀
引用 Tibo @thsottiauxCodex和ChatGPT Work已达800万活跃用户,重置使用限制,持续探索GPT-5.6 Sol能力。查看被引原帖 ↗
即将发布 - 开源和闭源模型新品
- Opus 5
- Gemini 3.5 Pro(checkpoint 表现更好)
- DeepSeek v4
- Kimi 3
Fable 5 在至少一个月内都将是编程领域最强的模型
牛逼,整个x代码全开源啊。
这是打OpenAI的脸吗?
引用 Elon Musk @elonmuskOnce we have completed our review for security vulnerabilities, we will make the entire codebase of 𝕏 open source, with no exceptions. Moreover, we will invite third party reviewers to examine the system that is running to confirm that the open source code is what is running. Trust through total transparency is the only thing that should be believed.查看被引原帖 ↗
我在开发 BaoCut 这个 App 的时候,是基于一个 Loop 来的:
1. 在开发新功能之前先设计原型(参考图1),借助的是 baoyu-design skill (
github.com/jimliu/baoyu-desi…
),配合 Claude Code App 内置的浏览器实施预览调整,模型 Opus 4.8 就很好了,都不需要 Fable 5.
GPT 5.6 Sol 设计能力还是不如 Opus 4.8
2. 原型打磨好了后,只需要在同一会话内,让 Claude Code 基于新的 UI 设计去实现功能即可,这块 Claude 做的很好,Fable 5 效果最好,能将设计稿几乎 1:1 还原,如果修改不多 Opus 4.8 也能胜任。
这些 UI 的打磨我还是更放心让 Fable 和 Opus 而不是 GPT,但其他一些不涉及 UI 部分的 GPT 5.6 Sol 就做的很好。
3. 更新好了后测试没问题,就可以通过发布的 skill 发布新版本。
这里可以放心让 Codex 去做了,尤其是它的 CloudFlare Plugin 很好用,直接帮助发布更新安装包到 CF。
这个 loop 的每一个迭代的起点是自己的想法,让 AI 提供设计方案,和 AI 反复讨论后确定方案,然后 AI 实施,AI 实施完成后人再去验证和当初想要的是否一致,如果不一致再让 AI 调整甚至推翻重来。
引用 宝玉 @dotey字幕转录翻译剪辑 Skill —— BaoCut(仅支持 Mac) 借助 Agent Skill,可以转录视频、对转录结果识别 Speaker、润色(纠正错别字口癖等)、也可以根据转录结果对视频进行简单的剪辑,比如删除口癖、重复等。 这次尝试解决一个问题就是 Agent 对字幕转录翻译后,无法通过一个友好的操作界面二次编辑的问题。 现在的做法是为 Agent 提供一个 cli,配合 Skill 的说明,Agent 可以借助 cli 去转录,获取转录结果润色、翻译,并实时同步进度到 GUI。后续可以在 GUI 进行预览和人工编辑。 安装了 Skill 和 App 后,后续只要从 Codex 或者 Claude Code 这种 Agent,触发 Skill 即可执行,比如: > /baocut 转录并翻译视频:<视频 url 或路径> 已知问题: - 仅支持 Mac - 翻译速度略慢,但质量会不错 下载地址: baocut.app/ Skill 从 App 内可以安装,或者 Skill 地址: github.com/jimliu/baocut查看被引原帖 ↗
GOOGLE 🔥:Jules 即将换新 logo,同时推出 V2 更新。
感谢 Jules 团队的礼物!❤️
> Jules 是 Google Labs 的自主 AI 编码代理,于 2025 年 5 月 20 日公开测试版发布。
>
@julesagent
预计不久将进行重大改版,以处理更复杂的编码任务和目标。
在本地运行现代 AI agents 总是很麻烦。得配置 Docker、处理沙箱、保持终端会话活跃、手动路由模型密钥。MyClaw 在云上管理所有这些。它是个持久平台,托管像 OpenClaw 和新推出的 Hermes(Claude Code 接下来上)这样的 agent runtimes。与其等浏览器聊天完成,你可以按计划或按需触发 agent 运行。完成的交付物(比如爬虫数据库报告、竞对价格监控或收件箱分类)直接发送到你的邮箱、WhatsApp 或 Telegram。
他们刚推出 Hermes,所以如果你试用两个 agent stack 中的一个,可以免费试 30 天另一个的 Max plan,在你的实际工作流上对比测试。
myclaw.ai
Vercel Agent特别擅长处理优化问题。可以让它优化你的build、性能、账单。
引用 Adam Killam @adamkillamVercel's agent just cut our build times by 10x. @rauchg 🙏查看被引原帖 ↗
又一轮 Codex 重置来了。这群人绝对是传说。
时间刚刚好。我超爱!<3
引用 Tibo @thsottiauxCodex和ChatGPT Work已达800万活跃用户,重置使用限制,持续探索GPT-5.6 Sol能力。查看被引原帖 ↗
这个 App 最开始是自己用的,是走的 LLM 方案,先整体翻译,然后按句子配对,再 LLM 拆分,但是拆分效果总是不理想。
另外走 LLM 还有一个问题,就是要配置 API Key,这其实对普通人不友好,另外就是成本其实不低,Gemini 3.5 Flash 一部长一点视频都几美元。
最后发现还是 Agent + Skill 路线最好:
1. Agent 有很好的纠错能力,哪怕你不给它这样的工具,它自己都能一边翻译一边纠错,质量不错。
2. 把 App 的能力封装成 cli,让 Agent 可以通过命令行调用 App 的功能
3. 配合一个 Skill 把常用的工作流比如像转录、润色、翻译、对齐、剪辑都固化下来,这样 Agent 就知道最佳实践是什么,不需要每次都自己摸索
4. App 解决的是人工预览、校对的部分。
Agent 操作完,如果你是人肉看文本字幕,或者你每次修改一点都要重新 ffmpeg 生成一遍视频,那效率太低了。最好的方式其实不是完全交给 Agent,而是可以有一个图形化的工具快速的预览、二次编辑。
5. Agent 相对比较通用和便宜,现在大家都有 Agent,包月的 Token 经常花不完,用来干这种活正合适
引用 宝玉 @dotey字幕转录翻译剪辑 Skill —— BaoCut(仅支持 Mac) 借助 Agent Skill,可以转录视频、对转录结果识别 Speaker、润色(纠正错别字口癖等)、也可以根据转录结果对视频进行简单的剪辑,比如删除口癖、重复等。 这次尝试解决一个问题就是 Agent 对字幕转录翻译后,无法通过一个友好的操作界面二次编辑的问题。 现在的做法是为 Agent 提供一个 cli,配合 Skill 的说明,Agent 可以借助 cli 去转录,获取转录结果润色、翻译,并实时同步进度到 GUI。后续可以在 GUI 进行预览和人工编辑。 安装了 Skill 和 App 后,后续只要从 Codex 或者 Claude Code 这种 Agent,触发 Skill 即可执行,比如: > /baocut 转录并翻译视频:<视频 url 或路径> 已知问题: - 仅支持 Mac - 翻译速度略慢,但质量会不错 下载地址: baocut.app/ Skill 从 App 内可以安装,或者 Skill 地址: github.com/jimliu/baocut查看被引原帖 ↗
Bonsai 27B 现已在 Claude Code 中上线,可通过 HuggingFace Claude 访问。
想让agent在公司内真正发挥作用,得把公司架构设计成它能读得懂的样子。
Shopify就这样干的——他们的agent根本没有私聊功能,只有公开频道。结果就是促进了同行学习
再见了,周日晚上的备课。Claude 现在对美国 K-12 教师免费开放。它可以在几分钟内生成课程计划、测验、工作表、家校沟通邮件、IEP 支持和符合教学标准的教材。教师可以用它做 5 件事 + 注册方式:
1. 规划课程
提示词:
设计一节45分钟的7年级数学课,讲授两步方程的求解。我用 Illustrative Math 教材,学生已经掌握了单步方程。给学生准备材料,包括课前热身、讲解示例和课堂出口测试。再准备一份我明天课堂上可以用的讲稿。
2. 分层教学
提示词:
根据我4年级 ELA 学生在年级标准上的表现做一份电子表格分析。然后把学生分成三组(复习、达标、拓展),为明天讲解主旨和细节的课做准备。
3. 检验学生理解
提示词:
为8年级科学的光合作用创建一份10题形成性评估,对标 NGSS MS-LS1-6。包括两个难度等级和答案键。
4. 与家长沟通
提示词:
每周五下午3点,根据我计划文件夹里这周的课程计划,帮我起草周家长通讯。包括这周学了什么、下周的安排,以及家长在家可以练习的一个知识点。给我准备一份邮件初稿供我审阅。
5. 预测学生的常见误解
提示词:
5年级学生在分数乘法上最常见的误解有哪些?给我三个讨论问题,分别揭示这些误解。
如果你是美国 K-12 教师,现在就验证吧
claude.com/solutions/teacher…
引用 Claude @claudeaiWe're introducing Claude for Teachers: free access to premium Claude capabilities for verified K-12 educators in the US, with a library of teaching skills and a direct connection to evidence-based curricula, mapped to academic standards in all 50 states. claude.com/solutions/teacher…查看被引原帖 ↗
通过 Direct On-Policy Distillation 实现弱强泛化
等待30分钟出几周的工作成果,这个等待感觉真是无限漫长。真的应该在 Codex 里加个闲置点击游戏,这样在等输出的时候能打发打发时间。
刚开发找片网站,不知道看啥时点一下就行:
imdb.qiaomu.ai/
支持自然语言对话找片,再次感谢Deepseek,v4 flash太便宜了。
所以现在做的不少站,都加上了一点AI功能。
现在我真的完全不知道 Anthropic 在搞什么了
我最好的猜测就是他们被 Mythos 在某个 cyber eval 上打败了,现在觉得一年内能出 AGI。至少从最近的广告看,已经完全失去理智了。
但真正离谱的是,他们的计划里竟然没把 Fable/Mythos 算上
他们这等于是给 OpenAI 送了数十亿美元
引用 Lisan al Gaib @scaling01Anthropic is truly doing God's work and preventing a lot of harm!查看被引原帖 ↗
Ollama 今天回到纽约了!
很兴奋看到越来越多人和企业意识到开源模型的好处!自有。实惠。隐私。
感谢 @Nasdaq 和 @Theoryvc 团队。
要知道这是 OpenAI 对 GPT-5.6-Sol 说的话
那你凭什么觉得 GLM-5.2 在 PostTrainBench 上并列第一很重要?
我一个月前做的分析,大家都说我 GLM-5.2 黑粉
现在 OpenAI 说同样的话,突然没人在乎了
引用 Lisan al Gaib @scaling01GPT-5.6 Sol and Terra "often collapse to a narrow set of strategies, and do not yet reliably design and execute full post-training recipes across varied base models and downstream objectives"查看被引原帖 ↗
最新的 ChatGPT iOS 新功能: Codex 可视化现在也在 iOS 上可用,可以生成各种图表和自定义内容,实时预览效果。
引用 Thomas Ricouard @Dimillian更新到最新版 ChatGPT iOS 应用,可使用来自 @PhilippSpiess 的新功能。Codex 可视化现在支持 iOS,可即时生成各种图表和自定义内容。查看被引原帖 ↗
申请链接在下面,我的DM也随时开放:google.com/about/careers/app…
我第一次见Richard是在我去中国的时候。他给我看了当时正在开发的产品Slock,后来演变成了Raft。
Raft 1.0把AI agents变成一个协调的团队,在一个共享工作区里工作,他们可以认领任务、协作、互相审查,还能保持长期的上下文。已经有20,000+的开发者在用了,它用消息风格的界面取代了一堆开着的终端和会话,让人类保持对全局的掌控。
强烈推荐试一下 :) launch顺利!
引用 stdrc @istdrcHi, I'm RC. I built Kimi CLI at Moonshot last year, and back in 2015, bots that lived in group chats. For the past four months, I've been building Raft in public. Today I'm launching Raft 1.0. Right now, working with agents means juggling terminals, sessions, and skills. The more you run, the more you end up holding it all together yourself, and the easier it is to lose the thread. Raft puts your agents in team mode: one workspace where working with agents feels like messaging your team. The work keeps moving, and you stay at the wheel. Meet my Raft agent team👇查看被引原帖 ↗
@X 团队报告一个问题:当你在网页上看到推文并点击 Grok 按钮想询问相关问题,点击停止后输入问题,它就忘了你之前提到的那条帖子了。
欧洲永远无法打造自己的前沿编程模型
因为我没有通过传统方式学编程,使用编码代理对我来说纯粹是创意和自我表达。GitHub 基本上就是我的 Substack。
引用 David Pan @davepWhen I was growing up, programming was an expression of creativity. Somewhere along the way, it became more about the chores. Merge conflicts. Flaky tests. CI failures. Bug triage. Let's give the chores to the robots and get back to building cool shit.查看被引原帖 ↗
Codex 用量重置的同时
Grok 的Build用量也重置了
只有Claude 没有跟进...
引用 Tibo @thsottiaux已达800万活跃用户。重置所有使用限制,无5小时速率限制,用户可充分探索GPT-5.6 Sol的能力。查看被引原帖 ↗
今天在 ChatGPT 里面找 Codex 没找到,原来改名叫 Remote 了
引用 Thomas Ricouard @DimillianHere is the latest update to Codex Remote on iOS! As I posted, we now support the new visualisation feature, but there is also a ton of other improvements and fixes! learn.chatgpt.com/docs/chang…查看被引原帖 ↗
Microsoft AI Futures 团队今日在 Nature Health 发表新论文。
在 109 个国家审查了 170 万条对话后,结果很清楚:Copilot 对那些对医疗系统信心不足的人来说是无价的资源。
技术一直都是伟大的平衡器,推动更多人获得更优质的服务。这进一步证明了 AI 正在为全球服务不足的群体在最需要的时刻提供无价的支持。
感谢所有作者。查看论文:
nature.com/articles/s44360-0…
语音输入法升级
HeyClicky:一个能 “屏幕感知语音输入”工具
它不仅能将语音内容转文字,还能看到你屏幕的内容,能理解你屏幕上正在看的内容,再根据上下文帮你写。
在 Gmail 中,可以看到邮件内容后自动生成合适的回复
在 Claude 终端里,可以根据当前技术信息替小白补充追问
在演示文稿中,可以调用 YC Skill,帮助修改融资材料和开场文案
可以在各种应用里看到你的内容进行智能回复
它还会记住你的表达习惯,让生成内容更像本人
一句话概括:它把传统语音输入升级成了“能看懂屏幕、理解上下文、直接替你完成表达”的 AI 写作助手。
引用 Farza 🇵🇰🇺🇸 @FarzaTV推出屏幕感知语音输入功能。语音转文本极快(约450ms),可根据屏幕内容自动生成文本。在Claude Code中自动生成提示词,在Gmail中用语音回复邮件。查看被引原帖 ↗
我给想理解 AI 真正发展方向的人写文章,embodiment 是大家马上就要关心的重点。Booster T2 让我感兴趣是因为它首先被设计成开发平台——板载 2070 TFLOPS 配合 Booster Studio 让开发者可以在真实机器人上迭代而不是玩具。这就是如何建立社区,而社区正是把机器人变成平台的方式。
引用 Booster Robotics @boosteroboticsBooster T2 is now available. Smart. Powerful. Built to Perform. As a new flagship embodied development platform, Booster T2 delivers up to 2070 TFLOPS of computing power, the highest in its class for bipedal humanoid robots. Combined with a high-output, high-DOF body, it enables sharper motion perception, stronger understanding, and reliable execution in complex scenarios. From real-time perception to rapid response, from agile movement to precise manipulation, Booster T2 combines powerful computing performance and reliable hardware with Booster Studio's integrated development platform, unlocking limitless possibilities for developers. Search "Booster Robotics" to visit the official website and order now.查看被引原帖 ↗
旧金山个人 AI 工程师——如果你正在构建个人代理,这周四晚上来新媒体实验室演示(并见见 @shloked,我今年有幸遇到的最好的建筑师-作家之一)。
上次我们举办这个 meetup 时,我们的特色演讲者被 @Amazon 硬件部门收购……两年后我仍然是日常使用者。看到 PAI 的持久力真是不可思议。
引用 Latent.Space @latentspacepodFor those in SF - we're hosting the epic return of our Personal AI meetup this week, hosted by @swyx and @shloked : luma.com/personai come if you are building in Personal AI - people with demos prioritized! max 50 spots only, this is not one of those slopfests.查看被引原帖 ↗
现在 Claude Code 增加了内置浏览器,你终于可以原生运行 MagicPath 作为扩展画布来设计和构建了。就像 Dmitry 在这里展示的那样 👇
引用 Dmitry Chesnokov @dmitrychesnok0v在 X 上首次亮相,分享如何使用 @claudeai 浏览器设置 @MagicPathAI 的教程。作为 @MagicPathAI 工程师,想听听你们的想法和使用方式,看你们如何用它发挥创意、创作美妙的东西。查看被引原帖 ↗
“Apple智能”大模型已获手机端侧AI服务备案
国行 Siri 要来了…
网信办发布7款提供手机端侧生成式人工智能服务已备案信息的公告
为促进生成式人工智能服务创新发展和规范应用,网信部门会同有关部门按照《生成式人工智能服务管理暂行办法》要求,有序开展生成式人工智能服务备案工作
现将新增的“Apple智能”等7款提供手机端侧生成式人工智能服务备案信息予以公告。
其中包括,苹果智能、华为小艺、vivo蓝心、小米澎湃及努比亚豆包大模型。
🚀 MiniMax Hub 重大升级!
现在更新 >>
hub.minimax.io/
新版本亮点:
🎵 音频进化:ElevenLabs Music v2 & Seed Audio 1.0 现已上线!
⚡ 特色技能:一站式 AI 工作流,支持短剧、运动图形和高级摄像机控制。
🛠️ 更智能的工作区:跨所有节点的统一全局搜索和一键媒体批量下载。
#MiniMax
#MiniMaxHub
🎵 音频模型更新
- ElevenLabs Music v2:可从场景、风格和情绪提示生成任何风格的音乐。
- Seed Audio 1.0:从文本、参考音频或图像生成声音,支持调节速度、音量和音高。
语言的污染是很可怕的
很多人说话和写文已经越来越GPT味儿了...
平时没事儿还是多换几个模型换着用
PrismML 将 27B 模型塞进你的 iPhone 里
而且智商几乎没怎么缩水
PrismML公司基于Qwen3.6-27B模型,将约 54GB 的 27B 模型压到约 3.9–5.9GB
使其能在手机上运行
在「高强度思考模式」下用 15 项测试对比原版:
Ternary 版本(5.9GB 电脑版):保留了原版 95% 的战斗力!
1-bit 版本(3.9GB 手机版):也保留了 90% 的战斗力!
在电脑(RTX 5090)上最快能达到每秒 163 个字;在苹果 M5 Max 芯片上也能达到每秒 87 个字。
我用这个数据集做的↓
引用 Guillermo Rauch @rauchg🏁 I animated the token 💰 spend race, from ~lifetime Vercel AI Gateway usage, which aggregates trillions of tokens from millions of developers a month. Fascinating to see the fluctuations among the labs, Anthropic's dominance, and the rise of open weight AI.查看被引原帖 ↗
博客和论文:
research.nvidia.com/labs/gea…
来自NVIDIA GEAR Lab的呈现。
千万看看Yunfan的技术深潜!
引用 Yunfan Jiang @YunfanJiangWe scaled robot policies to 8K timesteps of visuomotor context, orders of magnitude beyond current SoTAs, at constant inference latency. Introducing RoboTTT 🤖 With minutes of experience in context, our robots: 🎥 one-shot imitate human video demos 📈 improve themselves during deployment 🛡️ recover from perturbations ⚙️ complete a 5-minute, 10-stage assembly end to end 🌐 research.nvidia.com/labs/gea… Dive in 🧵查看被引原帖 ↗
本站由 Jedee杰哥 打造 · 公众号「Jedee杰哥」每早送 AI 日报
姊妹站:𝕏 简中账号数据榜单 · X 关注 @jedeeai · RSS 订阅 · AI 日报 · 历史归档