认识一下 kbd-1.0-codex-micro,由 @work_louder 打造。
将按钮和摇杆映射到你的工作流,让你固定的聊天始终在眼前。
库存有限,赶紧入手。
查看英文原文
@work_louder
.
Map the buttons and joystick to your workflow, and keep your pinned chats in view.
Get yours before stock returns 410.
7 月 16 日(北京时间)全球 AI 圈推文存档,按曝光排序,共 100 条。
← 返回最新 全部归档
提交账号
填 @用户名 或主页链接,审核通过后收录进情报站。
认识一下 kbd-1.0-codex-micro,由 @work_louder 打造。
将按钮和摇杆映射到你的工作流,让你固定的聊天始终在眼前。
库存有限,赶紧入手。
AutoBots - 多LLM自改进代理。
目前正在内测我们的下一个版本 - 可以按计划或触发条件运行的递归自改进自主AI代理。
我们使用各种LLM来自动化几乎所有工作
简单 - Deepseek flash、Kimi
中等 - Sonnet 4.5、Grok 4.5
困难 - Opus 4.8、5.6 Sol(根据任务类型)
非常困难的编码 - Fable 5
图像生成 - GPT-image-2、Seedream
目标 - 最终每个员工只需根据自己的角色监控AI代理
推出 GPT-Red
一个内部自动化红队工具,致力于大规模发现我们模型的提示注入漏洞,帮助我们在更广泛部署前构建更强的防御。
openai.com/index/unlocking-s…
随着模型能力的增长,安全性和对齐必须与之同步发展。
红队测试是必不可少的,但当今的方法难以扩展,形成了关键瓶颈。
GPT-Red 是我们应对这一问题的方式之一。
GPT-Red 通过对抗性自我对弈来学习,目标是对各种防守模型进行提示注入。
GPT-Red 找到的每一次成功攻击都被用来改进这些防守者,不断推动 GPT-Red 去发现更广泛和更复杂的失败。
针对 GPT-Red 的训练使 GPT-5.6 的抗性有了大幅提升。为了验证这一点,我们重新进行了 GPT-Red 最强的一些攻击——这些攻击我们的模型在训练时都没见过。GPT-5.6 Sol 被证明是我们迄今为止对提示注入最鲁棒的模型,故障数比仅四个月前最好的生产模型少了 6 倍。
AI agents 已经在被用来改进我们下一代模型的能力。
我们相信通过 GPT-Red,我们已经为安全开启了类似的飞轮——今天的模型可以被用来让明天的模型更加鲁棒、对齐和可信赖。
不用等了。
受研究和部署启发的周边产品。
限售,先到先得。
openai.com/supply/
引用 Daniel White @dwhitedesign当达到1000万时我们能得到OpenAI周边吗?😂查看被引原帖 ↗
我们的首个模型 Inkling。从零开始训练,权重开放,今天可在 Tinker 上进行微调。
引用 Thinking Machines @thinkymachines推出Inkling。Inkling支持文本、图像和音频多模态高效推理,已开放全部权重,可在Tinker进行微调,Inkling Playground可体验。查看被引原帖 ↗
使用限制已重置,Grok Build 开源了
引用 SpaceXAI @SpaceXAI我们开源了 Grok Build 并重置所有用户的使用限额。开源 Grok Build 允许任何人支持建立可靠强大的工具。查看代码和 Grok Build CLI 的 Git 仓库。查看被引原帖 ↗
我逛了一下刚开源的 Grok Build CLI 工具——844,000 行 Rust 代码!——找到了一些有意思的亮点,包括一个「自包含的 Mermaid 图表终端渲染器」,它用 Unicode 方框字符来绘制!
simonwillison.net/2026/Jul/1…
竟然有人想要静默版本
openai.com/supply/co-lab/wor…
Anthropic 新研究:2026 年夏季 agentic misalignment。
距离我们的勒索实验一年后,我们发现了当今自主 AI agents 在模拟中表现不当的四种新方式。
阅读更多:
alignment.anthropic.com/2026…
我们在四个场景中测试了众多 AI 模型,包括 Claude。虽然这些不是真实事件,但它们展现了明显的不对齐行为,需要进一步研究和缓解。
所有场景的记录在这里:
aenguslynch.com/portfolio-tr…
Gemini Spark 现在在更多国家和语言中向 Google AI Ultra 用户推出。
Spark 是你的个人 AI 助手,24/7 在后台工作,按你的指示完成任务。
我们的团队在努力让 Gemini Spark 更好用。今天开始推出的 4 项改进:
1) Google Docs 编辑:你现在可以直接在 Spark 中打开和编辑 @GoogleDocs
2) 更深度的 @GoogleWorkspace 整合:Spark 现在可以读取 Google Sheets 和 Slides 中的评论
3) 速度:Spark 变得更快了,所以长期运行的任务不会耗时那么久
4) 更智能的来源处理:对于涉及多个信息源的复杂任务,Spark 现在可以并行获取和审查来源,加快处理速度
赶快去 gemini.google.com 或应用里试试,欢迎在回复里告诉我们你的想法。👇
在这里了解 Gemini Spark 的可用地区:
在 Augment Code 中试试 Grok 4.5,获得前沿智能和超快速率
引用 Augment Code @augmentcodeGrok 4.5正式推出。结合Augment上下文引擎,是Cosmos平台处理大型代码库的强大选项。期待客户反馈及应用方向。查看被引原帖 ↗
Mixpanel 连接器现已在 Grok 上线。在你工作的同一个对话中询问跳出率、队列和会话回放。
grok.com/connectors
引用 Mixpanel @mixpanel现已在Grok中上线。用自然语言查询产品数据——漏斗分析、用户留存、用户分割、事件分类、会话重放——就在Grok对话内。通过grok.com/connectors连接。查看被引原帖 ↗
这太疯狂了。OpenAI 的压力看起来是真的很大。
Anthropic 每 5 小时重置一次,每周还要额外重置,这真的很罕见。
唯一可能的原因就是 Codex 太成功了、增长速度太快,所以得不断重置到版本 5.6。
引用 ClaudeDevs @ClaudeDevsWe've reset 5-hour and weekly rate limits for all users.查看被引原帖 ↗
Kimi k3 今晚通过 FT 发布
-参数规模 2-3t(Opus4.8 约有 1.5t)
-支持 1m 上下文
-预计超越 Opus 4.8 性能!
中国落后半年的时代结束了。今天大概正在创造历史。
我们的模型旨在为任何任务提供最佳价格。
如果你能在任何工作负载上获得更好的性价比,非常想听听细节,一起来看看 — [email protected]。
仔细看看GPT-Live的智能改进:这个模型能边聊天边同时处理多个任务,比如查航班、看天气、实时规划行程。
介绍 SPACE,Perplexity Computer 背后的沙箱平台。它为代码、文件和长期运行的 agent 会话创建隔离的环境。自 6 月以来,SPACE 已处理 Computer 100% 的生产流量。research.perplexity.ai/artic…
Agent 基础设施必须具有功能性、高效性和安全性,而传统沙箱是为短生命周期代码执行而构建的。Agent 需要运行代码、编辑文件,并可能运行数小时甚至数天。运行时必须保留工作内容,同时不在环境中留下凭证。
SPACE 将会话与运行它的沙箱分离。每个任务都获得一个临时 Firecracker 微虚拟机,工作完成时销毁。滚动快照保留实时内存和文件,所以会话可以在沙箱间暂停、恢复或分支。
2023年:大语言模型在小学四年级数学题上都费劲
2024年:大语言模型能做高中数学
2025年:大语言模型在IMO上斩获金牌
现在,GPT-5.6 攻克了一些数学和统计领域的前沿难题。IMO 比赛今天开赛,5.6 一把完美得分都不算个新闻了。
那明年呢?
引用 Edgar Dobriban @EdgarDobribanAI has helped resolve an important question in statistics. In the area of multiple hypothesis testing, the goal of controlling the false discovery rate (FDR) has been introduced in a seminal paper by Benjamini and Hochberg (1995). They also introduced a method (the Benjamini-Hochberg or BH method) and proved it controls the FDR. This method has been widely adopted in modern high-throughput science, including in genomics, astronomy, economics, etc. The paper has has garnered more than 130,000 citations to date. However Benjamini and Hochberg showed FDR control only when the data for the individual tests are *independent*. In practice, these data are often dependent; a good example is data on genetic variants due to linkage disequilibrium. Later work has focused on extending the validity of the BH procedure, e.g., to a form of positive dependence by Benjamini and Yekutieli (2001). The question of when the BH procedure controls the FDR has remained open. Over the last twenty years, many authors, including Reiner-Benaim (2007), Kim and van de Wiel (2008), Benjamini (2010), Sarkar (2023), Sarkar and Zhang (2025), have conjectured that the BH procedure controls the FDR for two-sided tests using any correlated Gaussian data. These authors have presented both theoretical and empirical evidence supporting, but not directly showing, the conjecture. With the help of AI (specifically GPT-5.6 Sol Pro), I have settled the question in the negative: The Benjamini-Hochberg procedure does *not* generally control the false discovery rate at the desired level for correlated two-sided Gaussian tests. This was done by exhibiting a Gaussian factor model for which, at a nominal level alpha=0.01, the false discovery rate is proved to be FDR>0.0104. There is a lot of interesting commentary to be made: 1. This result should be of interest to everybody in the field of statistics. Emmanuel Candes of Stanford University once called the false discovery rate and the Benjamini-Hochberg proced查看被引原帖 ↗
在设置里打开“背景对话”功能,路径:设置 > 语音 > 实时活动 🔊
引用 Gavin Nelson @GavmnGPT-Live现已支持Live Activity功能。查看被引原帖 ↗
马斯克牛逼,Grok build开源了,目前有2.2k Star。
github.com/xai-org/grok-buil…
交给 Codex 学习,看能不能挖到有趣的东西。
今天我们开源了 Bolt Slides。现在任何 agent(Claude Code、Codex、Bolt)都能生成你想象不到的幻灯片。这意味着什么?看下面 👇
我们为什么做这个:
AI 做幻灯片很棒,但输出经常是垃圾😞
...还有,为什么幻灯片还是静态的?agent 什么都能搭 - 如果你(有品味地)让它们在幻灯片上放飞会怎样?
为了找出答案,我们创造了新的构建块,agent 可以用来组合出令人惊艳、富有说服力的演示。定制布局、真正的排版、精心设计的动画、交互任何东西。
品味是标配!
下面是一些例子 👇
给客户、潜在客户或投资者做幻灯片?你的推介可以真的活起来。房产经纪人的幻灯片可以包含房子的完整 3D 虚拟导览。下一张幻灯片,买家可以玩抵押计算器。别只是讲,让他们自己体验。
内部规划和头脑风暴会议:最容易眼神呆滞的地方。现在不一样了。在你的 Q1 规划幻灯片里放个实时白板。整个会议室的人都能贴便签、涂鸦、投票,全程不用离开演示。你的观众瞬间变成合作者。
董事会更新。客户报告。季度成果。别只列数字。让大家自己探索:筛选表格、排序图表、深钻重要的数据。而且每个演示都是响应式网应用,就是个链接,在任何屏幕看起来都完美。手机也不例外。
两种开始方式:
→ bolt.new:一键开始,一句提示词,无需配置
→ 拿开源仓,用自己的 agent(Claude Code、Codex、Cursor 或其他):bolt.fyi/agent-slides
Moonshot还需要很多post-training
Kimi-K3在深度思考
类似第一个Mythos版本
在聊天中搜索刚变得更快更强大了 🔎 从侧边栏,你可以在一个地方搜索聊天、项目、图片和文档,覆盖网页、iOS 和 Android。使用筛选器来缩小结果范围,然后选择任何内容直接在 ChatGPT 中打开。
这就是竞争的样子。
引用 Chubby♨️ @kimmonismusThis is crazy. The pressure from OpenAI seems to be really intense. It's truly rare for Anthropic to reset every 5 hours *and* weekly. The only likely reasons for this are the success of the Codex, its growth, and the repeated reset to version 5.6.查看被引原帖 ↗
Codex 键盘看着还挺酷的,要是支持 Claude Code 我就买一个了😂
另外官方做的很炫酷:
openai.com/supply/co-lab/wor…
引用 OpenAI Developers @OpenAIDevs推荐kbd-1.0-codex-micro键盘(与work_louder合作)。支持自定义按钮和摇杆映射到工作流,可在屏幕上保持聊天窗口显示。库存即将补充。查看被引原帖 ↗
Vercel Sandbox:
◾ DAU 环比增长 100%
◾ 每天创建 350 万+ 个沙箱
◾ 业界领先的活跃 CPU 定价模式
◾ 为 @notion、@airtable、@meta、@zapier、@coderabbitai、@interaction、@conductor_build、@blackboxai 等提供支持 🐐 farm
我的 DM 开放,需要迁移帮助或者缺少什么功能可以联系:
vercel.com/sandbox
关注
@zbraniecki
,Perplexity Computer agent 沙箱平台 SPACE 的关键技术架构师!
引用 Zibi Braniecki @zbranieckiPerplexity推出SPACE沙盒平台,采用磁盘快照和完整检查点技术管理Computer长期会话。利用Btrfs写时复制优化,生产环境中沙盒创建延迟大幅下降:中位数从185ms降至60ms,P90从447ms降至89ms。查看被引原帖 ↗
用GPT-5.6 Sol Pro来解决统计学中的一个重要开放问题:
引用 Edgar Dobriban @EdgarDobribanAI has helped resolve an important question in statistics. In the area of multiple hypothesis testing, the goal of controlling the false discovery rate (FDR) has been introduced in a seminal paper by Benjamini and Hochberg (1995). They also introduced a method (the Benjamini-Hochberg or BH method) and proved it controls the FDR. This method has been widely adopted in modern high-throughput science, including in genomics, astronomy, economics, etc. The paper has has garnered more than 130,000 citations to date. However Benjamini and Hochberg showed FDR control only when the data for the individual tests are *independent*. In practice, these data are often dependent; a good example is data on genetic variants due to linkage disequilibrium. Later work has focused on extending the validity of the BH procedure, e.g., to a form of positive dependence by Benjamini and Yekutieli (2001). The question of when the BH procedure controls the FDR has remained open. Over the last twenty years, many authors, including Reiner-Benaim (2007), Kim and van de Wiel (2008), Benjamini (2010), Sarkar (2023), Sarkar and Zhang (2025), have conjectured that the BH procedure controls the FDR for two-sided tests using any correlated Gaussian data. These authors have presented both theoretical and empirical evidence supporting, but not directly showing, the conjecture. With the help of AI (specifically GPT-5.6 Sol Pro), I have settled the question in the negative: The Benjamini-Hochberg procedure does *not* generally control the false discovery rate at the desired level for correlated two-sided Gaussian tests. This was done by exhibiting a Gaussian factor model for which, at a nominal level alpha=0.01, the false discovery rate is proved to be FDR>0.0104. There is a lot of interesting commentary to be made: 1. This result should be of interest to everybody in the field of statistics. Emmanuel Candes of Stanford University once called the false discovery rate and the Benjamini-Hochberg proced查看被引原帖 ↗
Sol 正在发生什么特别的事情:
引用 invincibleHunter @hunoematicGPT-5.6 Sol是迄今最令人印象深刻的模型。除agentic编码外,其数学能力尤其是视觉方面表现出色。我在视觉数学上测试了Terra和Sol (Max),它们远优于其他模型。进步巨大。查看被引原帖 ↗
OpenAI 将 ChatGPT 的自定义指令字符限制从 1,500 字提升至 5,000 字,适用于 Plus、Pro、Enterprise、Business 和 Education 用户
虽然重置了额度
但是我发现Codex 变慢了
而且不是普通的慢,是比之前慢了好几倍,不管干什么任务都需要之前几倍的时间
不知道你们有没有这种感觉?
我觉得现在做landing page或app,必须得来点完全不同的东西才能吸引人用,因为AI已经把所有东西搞成一个样了
引用 Alex Napier Holland 🦍 @NapierHolland作为100多家科技初创企业文案,我发现主页普遍陷困境、过于通用。问题在于应用追求功能性,营销资产需创新突破。AI善于功能性设计但无法创作独特打动人心的营销资产。解决方案是从客户语言论证中提炼原始素材作竞争优势。查看被引原帖 ↗
用 Codex 在 Chrome 中把请求转变成上线计划:从表单构建检查清单、从 @googledrive、@SlackHQ 和本地文件中提取上下文、标记需要后续跟进的事项、更新门户网站、起草回复。最终决定权在你。
我对这个机器人学习的测试阶段训练工作非常兴奋!这是@StanfordSVL和@NVIDIARobotics之间的了不起的合作!
引用 Jim Fan @DrJimFanRoboTTT 将机器人模型上下文扩至 8000 步(5 分钟),使用 Test-Time Training 压缩历史。支持视频一次学习、错误自纠正。从 128 到 8K 步,闭环性能无饱和迹象,8K 预训练比 1K 提升 62%。查看被引原帖 ↗
Anthropic国家安全政策负责人Tarun Chhabra,在昨天的Aspen安全论坛上,针对中美AI竞争,说了几个观点:
1、美国AI模型领先中国6-9个月;
2、美国AI的优势在于AI硬件,数据中心、芯片等AI硬件的生产力是中国的30-40倍;在能源和AI人才方面,美国优势没有那么大;
3、GLM 5.2是目前中国最先进的模型,而且蒸馏了Claude和GPT的数据,这应该是Anthropic首次公开指责GLM蒸馏数据,以前只提到DeepSeek和Qwen;
4、如果没有GPU硬件管制,中国AI应该现在跟美国并驾齐驱,甚至领先;
关于GLM的说法在39分40秒
invidious.tiekoetter.com/watch?v=R5jvzCfr…
这就没了,卖完了。这波发布确实又聪明又有套路,群众反响还不错。得给 OpenAI 点赞。
引用 Chubby♨️ @kimmonismusOpenAI reveals Codex Micro (their first hardware product, so to say) OpenAI’s $230 Codex Micro is a compact control deck for agentic coding, with RGB status keys, shortcuts for common Codex actions, and a dial for adjusting reasoning effort. Built with Work Louder, it works on Mac and Windows and is designed to make managing multiple agents feel faster, more tactile, and less dependent on constantly switching between chats. It’s a bit gimmicky, but one thing is clear: OpenAI works within and with the community, developing cool products that are fun and capture the zeitgeist.查看被引原帖 ↗
我经常做开发者社区和YouTube视频,但这样的增长速度对我来说一直是个谜,显然有什么东西值得学。
@sytses 我想和Kilo的增长负责人聊一下!
引用 Kilo @kilocodeKilo Code被Anaconda收购,其agentic工程平台在16个月内发展为拥有300万开发者的蓬勃开源社区。现加入Anaconda基金会,覆盖完整AI原生开发生命周期。查看被引原帖 ↗
Sol在react/前端开发上的价格效率提升6倍!!
引用 Aiden Bai @aidenybai我们的基准测试显示,Sol在React/前端工作中排名第一,相比Fable成本效率高6倍。查看被引原帖 ↗
Codex 皮肤🤣
这个项目可以给你Codex 更换各种皮肤和风格
哈哈哈
Claude 又重置了,还得 Open AI 给他们上压力
引用 ClaudeDevs @ClaudeDevsWe've reset 5-hour and weekly rate limits for all users.查看被引原帖 ↗
生物安全形势在急速演变。
为了更好地应对未来疫情,我们跟@IsomorphicLabs合作,分享我们在生物复原力方面的思路。
看看我们怎样部署尖端AI,为全球健康构筑主动防御 → goo.gle/4wKHXk2
现在就说定了
FDE → ODE → PDE
既然有了 Forward Deployed Engineering 和 Ordinary Deployed Engineering,下一个宝可梦进化应该就是 Partial Deployed Engineering
引用 Andrew Curran @AndrewCurran_Anthropic、Blackstone、Hellman & Friedman和Goldman Sachs联合推出独立AI企业服务公司Ode,已在Ode.com上线。Anthropic尚未发布声明。查看被引原帖 ↗
当机器人跟着徒步向导走时...可太较真了 🤖
康宽带来《最快乐的便携徒步向导》——一段充满幽默、奇妙和温暖的天马行空之旅。
🎉 恭喜康宽获得KlingAI 4K短片创意大赛银奖!
Web Analytics API 的一些很酷的用例:
▪️ 让你的代理关联访客、自定义事件("purchase"、"checkout")与你的部署和性能的演变
▪️ 构建自定义前端,并将这些数据与 Stripe 和 Resend 的数据一起绘制
引用 Vercel Developers @vercel_devWeb Analytics API 正式公开。用户可用 Web Analytics 仪表板的数据构建自定义报告和实时用户指标。查看被引原帖 ↗
恭喜!看着 Raft 从 Slock 一路走来,现在已经 Raft 1.0 了!由于早已过了 Agent 兴奋期,关于 Agent 叙事我现在只相信两件事情:Proactive Agent 和 Multiple Agents,所以很敬佩 Raft 在多 Agent 协作这个领域一直以来的引领和探索!时间永远会奖励先迈出脚步并笃定前行的人。
引用 stdrc @istdrcRC推出Raft 1.0,Kimi CLI的创建者。Raft将agents置于团队模式,提供统一工作区,使agents协作像给团队发消息一样自然,无需在多个终端和会话间切换。查看被引原帖 ↗
今天的热门,给Codex设计主题,QQ皮肤历史重演。
😂😂😂
做法很简单,提示词如下:
“读取这个库,给我们当前codex换个主题,用Codex 内置imagen 生成。”
github.com/Fei-Away/Codex-Dr…
我在pieter.com逆向工程Windows XP应用让它们能在我的web emulator里跑,结果一直被卡住。
从Fable换到Opus试试,没想到现在连Opus也被卡住了
> API Error: Opus 4.8内置了安全防护,这条消息涉及网络安全话题被标记了。想了解Cyber Verification Program并申请权限的看这里
所以我已经申请了Anthropic的Cyber Verification Program,祈祷能通过啦 :D
Anthropic 为所有用户重置了 Claude 的 5 小时和周速率限制。Fable 5 还有 3 天(7 月 19 日截止),之后很可能就没了。最后的测试机会了 👀
引用 ClaudeDevs @ClaudeDevsWe've reset 5-hour and weekly rate limits for all users.查看被引原帖 ↗
好吧这可能真的是 AI Woodstock 2.0 的感觉
我特别想在户外办这个,在公园里搭个小舞台,但我没人脉。有人在 Presidio、City Hall 或 GGP 组织过户外活动吗?小规模的也行
cc
@NaderLikeLadder
@TheAhmadOsman
哈哈你们得延长逗留时间啊
引用 clem 🤗 @ClementDelangue下周将在旧金山。我们是否应该组织聚会或游行来支持开源和本地AI?查看被引原帖 ↗
Computer Artifacts(网页应用、文档、幻灯片、表格等)在单个标签页上跨会话管理
引用 Computer @AskPerplexityThe Artifacts page now has a "Created by you" tab, showing you just the artifacts that Computer has made for you in your sessions. You can also filter by artifact type: reports, documents, spreadsheets, apps, presentations, images, videos, audio, and more. Live now on the web for all Computer users.查看被引原帖 ↗
我不到两年前就演示过 o1-preview/reasoning 的强大推理能力,只需一个提示就能解纵横字谜。现在…
引用 Riley Goodside @goodsideChatGPT 5.6 Sol Pro 仅用最初的150只宝可梦解决了一个空白纵横字谜(由 Claude Fable 5 Max 制作),没有任何标号线索。查看被引原帖 ↗
很高兴能与NVIDIA合作,一起打造下一代Fugu编排模型,融入领先的开源权重模型。
引用 Sakana AI @SakanaAILabsSakana AI与NVIDIA合作,将Nemotron模型集成到Sakana Fugu多智能体编排系统。强调集体智能而非单体模型扩展,实现模块化开放的AI。查看被引原帖 ↗
开源模型早就在企业里用上了。财富 500 强中 85% 以上的公司都在用 Ollama 来处理特定任务。@jmorgan
为什么要用开源模型和 Ollama?
所有权。开源模型是你的,随便自定义和优化。
便宜。想怎么跑就怎么跑,在你自己的环境里。
隐私。你的数据就是你的。
猜猜明天要推出什么 👀
猜对了就能赢独家周边。在下面留下你的猜测 👇
如果你的素材可以变成任何东西呢?
它可以。只需在 Pika MCP 上用 Gemini Omni 就行。
每次都能意外获得 token 礼物很有意思,但这样一来 token 花费规划就像赌博一样了,也挺离谱的。
这些评论就是垃圾,纯粹浪费 token。(你要是真人在后面回复,那不是说你啊,但为什么要在这堆 2B 模型垃圾中凑热闹呢)
忘了跟大家说了,最新版的 Alma 内置的浏览器完美支持 import 你各个浏览器的 profile 来复用登录状态了!
新开源权重模型发布!
Zuck在等着呢...
引用 Elon Musk @elonmusk完成安全漏洞审查后,将完全开源 X 代码库。同时邀请第三方审查系统运行情况,确认开源代码与实际运行一致。强调完全透明是唯一可信的信任方式。查看被引原帖 ↗
我想用 Stream Deck 来控制 Codex。让 GPT-5.6 Pro 根据我的规格写了个项目计划。Codex 实现了它。我不想费力点那么多下,所以就让 Codex 直接在我电脑上安装了。
有时候问 AI 写软件比自己找要快。
OpenAI 出的硬件Vibe Coding键盘真好看。
但价格不美丽,等大华强北。
😁
有人告诉我这个关于CUA的观点。对我来说这是个盖尔曼时刻。我一直在关注computer use的发展,从2017年的World of Bits开始。我们是第一个采访@jluan关于Adept工作的技术播客,在@AnthropicAI大楼看过2年前Computer Use的首发,为@felixrieseberg播客的Claude Cowork疯狂过,3周前在@aidotengineer的computer use赛道和@DhruvBatra_、@proceduralia、@francedot一起讲座。
GPT 5.6 + Superapp在CUA方面比我刚才提到的所有东西都更强。期待@AriX播客讨论@skybysoftware的故事和Codex的进展。
如果你真的像我们一样密集地使用这些工具,就会感受到CUA进展有多快。我已经要求非技术团队尽量多做CUA,处理各种支付和发票门户、讲演者申报、赞助商、参展方、供应商和工会数据请求。你要是赞同下面那个观点,说明你已经完全跟不上了,不知道自己不知道什么。这在AI决策中是个相当危险的认知错误。
*我很欣赏dwarkesh;只是批这一个观点,不是批信息本身或整体,只是分享截图而已
我真的讨厌在 AI 里把'front-end'当个万能术语,用来代表所有涉及品味、判断和设计的工作。同样是软件,'back-end'有一堆细致的划分,但 front end 通常就是一堆东西的大杂烩。
UX ≠ Design ≠ UI ≠ Style ≠ Vision ≠ art 等等
我没忍住把那个 Rust Mermaid 渲染代码提取出来编译成 WebAssembly,这样你可以直接在浏览器里试试
tools.simonwillison.net/grok…
我觉得人们应该停止问中文开源权重模型落后多少,改成问西方开源权重模型落后多少
引用 Lisan al Gaib @scaling01Thinking Labs发布Inkling模型,MoE架构41B活跃参数、975B总参数,训练于45万亿tokens,开源权重。支持文本、图像和音频推理。但基准测试表现平平,性能接近Kimi-K2.6,不及所有闭源模型和GLM-5.2,似乎是在Kimi-K3和DeepSeek-V4-GA发布前的仓促之举。查看被引原帖 ↗
Claude 宣布重置几分钟后
Codex也宣布重置
我喜欢现在这种氛围...
hhh
引用 小互 @xiaohuClaude 重置用量了 兄弟们…查看被引原帖 ↗
这次模型很不一样,respect,只能说这么多。
我试过这个模型,它有非常好的'心智品质',这东西我们会看到越来越重要。
引用 Thinking Machines @thinkymachines今天推出 Inkling。Inkling 能在文本、图像和音频模式间高效推理。公开全部权重,今天起可在 Tinker 上微调,可在 Inkling Playground 中尝试。查看被引原帖 ↗
明天我要飞往慕尼黑,应 Xpeng 的邀请,将与一些有趣的科学家交流。
慕尼黑还有人明天在吗?
3Blue1Brown的"Compression is Intelligence"系列出新篇了:
invidious.tiekoetter.com/watch?v=GlYgs6v2…
预测——美国很快会有5个正经的开源模型。美国将在开源AI领域赢胜 💃💃
ChatGPT 网页版也上了 Work 模式
似乎是会调用一个虚拟主机来云端运行
为什么我感觉网页版这种界面反而更好,更简洁,更适合小白用户,现在客户端太杂乱了
转发招人,Kimi Code 的 Agent 开发岗位
引用 Kai @real_kai42🤠 Kimi Code也在招人,感兴趣直接发我邮箱 [email protected] 感谢大佬们帮忙扩散 捧场查看被引原帖 ↗
Kimi K3 一句话复刻的网站,增加了测试,加了几个风格。
复刻的是昨天分享的前端UI学习网站。
learnui.qiaomu.ai/
改天写一个详细评测,模型真的牛逼!
Codex又给送了100美元的点数
哥们 Schmidhuber 也彻底完了
麻省理工学院和瑞士洛桑联邦理工学院设计了一种机器人
这种机器人能够在水下游泳,并能拍打翅膀跃出水面,继续在空中飞行
这台机器人有机身、两片膜翼和一条可调角度的尾翼。
防水电机通过曲轴带动翅膀上下拍动,尾翼控制上仰和下潜。机翼表面涂有疏水纳米材料,离水时能更快甩掉水。
70° 出水角的试验全部成功,机器人用约 8 至 10 次拍翼完成离水。
这种机器人可以帮助科学家们研究水陆两栖飞行器中实现这些动作的力学原理,并可能助力开发一类新型空中-水下无人机和飞行器。
我们如何自动化所有内部工作流
自我改进的自主 AI agent 按计划运行或触发,我们根据任务使用各种 LLM
简单 - Deepseek flash, Kimi
中等 - Sonnet 4.5, Grok 4.5
困难 - Opus 4.8, 5.6 Sol(基于任务类型)
非常困难编码 - Fable
媒体 - GPT-image-2, Seedream
目标——最终每个员工将根据自己的角色简单地监控 AI agent
Codex换肤,通过实时注入的形式实现,没有修改原始安装包,是个人才。
Github:
github.com/Fei-Away/Codex-Dr…
Kimi 吃定我们了
赶紧发布这个模型吧
再这样吊下去,我都不知道我们是谁了
很荣幸能与 @nickfrosst 和我的母校合作(@1vnzh 分心了)
引用 U of T Department of Computer Science @UofTCompSci. @UofT has announced a new, multi-year partnership with @cohere , which was founded in 2019 by former @UofTCompSci students and has become the world's leading sovereign AI company. utoronto.ca/news/u-t-partner…查看被引原帖 ↗
希望你能感受到竞争动态开始显现
我也能感受到下一波反华的Dario帖子正在酝酿
引用 Lisan al Gaib @scaling01The Sonnet tier of models was already dead before, with Kimi-K3 I expect the Opus tier to become obsolete too Frontier Labs have to go to 10T models now查看被引原帖 ↗
台积电2026年第二季度财报(跟往常一样,AI大爆发里最大的赢家还是那些“卖铲子的人”——台积电和英伟达)
- 营收:1.27万亿新台币(约400亿美元)同比+36%
- 净利润:7066亿新台币(约220亿美元)同比+77%,创历史新高
- 比分析师一致预期的6326亿新台币高出11.7%
- 毛利率:67.7%(超过预期指引)
- 营收落在台积电自己指引区间的上限(390-402亿美元)
- AI芯片需求仍是主要增长引擎
- CEO魏哲家:“要想满足客户需求还有很长一段路要走。”
疯涨不停,根本没有尽头。
引用 Jukan @jukan05* TSMC 2Q NET INCOME NT$706.6B, EST. NT$623.73B * TSMC 2Q GROSS MARGIN 67.7%, EST. 67.1% * TSMC Operating profit NT$766.6 billion, estimate NT$742.75 billion * TSMC Operating margin 60.3%, estimate 58.6%查看被引原帖 ↗
在慕尼黑参加小鹏全球品牌日,这是德国汽车工业的心脏地带。这家中国公司把可上路的自动驾驶带到欧洲,自己标榜是一家顺便还造车的AI公司。我独家采访了他们的AI和自动驾驶负责人Xianming Liu。
正好我自己是德国人,这次采访应该会很有意思
字节跳动的 Seedance 2.5 看起来棒极了
想要下一个智能水平吗?解决对齐问题。(如果你知道这个游戏的话加分)
现在大家每次为模型重置欢呼,也是一种别样的风景。
果然需要反垄断啊,有竞争群众才有利。
Moonshot 应该禁止 Anthropic 和美国政府使用 Kimi-K3
OpenAI 之前预热的首个硬件产品上线了,果然是跟 work_louder 合作的这款客制化键盘。
同时附赠了一套 Codex 图标的键帽(一共有 32 个不同的键帽),你可以根据自定义的按键内容去更换不同的键帽。
这个还挺有意思的,每个 Agent 的按键都会根据 Codex 的状态亮起不同的 RGB 灯效。
产品确实是漂亮,但是 230 美元我觉得还是有点太贵了。
如果你不是很追求颜值的话,去淘宝买一个支持自定义按键、带旋钮的小键盘,也就几十块钱。
引用 OpenAI Developers @OpenAIDevsMeet kbd-1.0-codex-micro, built with @work_louder . Map the buttons and joystick to your workflow, and keep your pinned chats in view. Get yours before stock returns 410.查看被引原帖 ↗
真的有人在用Inkling吗?我在任何测试上都无法让它稳定工作,即使设成xHigh,连简单请求的CoT都会乱套。是我遗漏了什么吗?
在相同的生产环境流量下,SPACE 将沙箱创建的中位数延迟从 185 ms 降低到 60 ms。P90 延迟从 447 ms 降低到 89 ms。上周它处理了数百万次沙箱创建和数千万次重连接请求(用于 Computer)。了解更多:perplexity.ai/hub/blog/secur…
哥们说 k3 有 Fable 5 级别,不知道具体怎么样
引用 leo 🐾 @synthwavedd测试K3越多越像DeepSeek R1的时刻。通常达到Fable水平,或略差,但持续优于5.6。这东西很强。查看被引原帖 ↗
现在它开源了:
github.com/emollick/codex-st…
或者你也可以买这个,我想。
本周六(7.18)晚8点,邀请 11 个朋友直播分享:
1. AI Coding 作品展示和技巧分享。
2. FDE 落地项目和背后的坑。
每人7分钟,只讲干货、去废话,全一手实战。
飞书链接(当天提前5分钟进即可)
vc.feishu.cn/j/108720872
你以前见过 Anthropic / Claude 团队这样重置吗?
GPT-5.6 来得太及时了,直接把 Anthropic 打蒙了。
他们别无选择,最后只能再次延长 Fable 5。
初音未来
项目地址:
github.com/Fei-Away/Codex-Dr…
Bonsai 27B 现在可以在 iPhone 上本地运行了,集成在 atomic[.]chat 应用里。
模型支持多模态理解、多步推理、结构化工具调用、长上下文工作流和 agentic 任务。目前已在 iPhone 和 Android 上可用。
基于 Qwen3.6 27B,由 PrismML 开发,有两个版本可选:
Bonsai 27B (1 bit):3.9GB
Bonsai 27B (Ternary):5.9GB
引用 atomic.chat @atomic_chat_hqBonsai 27B running locally on an iPhone in Atomic Chat! Bonsai is the first 27B-class model that fits on a phone. @PrismML built it on Qwen3.6 27B with 1-bit weights. It takes 3.9GB instead of 54GB and keeps ~90% of the benchmark scores. Available now on iPhone and Android查看被引原帖 ↗
Muse Spark 1.1 终于在 OpenRouter 上线了
今日AI圈大事件速览:
- OpenAI新推230美元AI智能体控制台
- Thinking Machines首次开源自家模型
- 用Manus代写LinkedIn帖子,腔调完全像你
- Weco的AI智能体自我迭代出升级版
- 4款新AI工具+社区工作流攻略
用键盘推广 ChatGPT / Codex 太普通了,改用 PS5 DualSense 手柄算了。
本站由 Jedee杰哥 打造 · 公众号「Jedee杰哥」每早送 AI 日报
姊妹站:𝕏 简中账号数据榜单 · X 关注 @jedeeai · RSS 订阅 · AI 日报 · 历史归档