<?xml version='1.0' encoding='UTF-8'?><rss version='2.0'><channel><title>AI 情报站</title><link>https://jedeeai.com/ai/</link><description>全球 AI 圈一手动态，自动翻译成中文，每小时更新</description><lastBuildDate>Fri, 17 Jul 2026 07:05:56 GMT</lastBuildDate><item><title>swyx：卧槽，React 复仇者联盟集结了</title><link>https://x.com/swyx/status/2078004977294032991</link><guid isPermaLink='false'>2078004977294032991</guid><pubDate>Fri, 17 Jul 2026 06:32:00 GMT</pubDate><description>卧槽，React 复仇者联盟集结了</description></item><item><title>Greg Brockman：我们的团队在快速响应反馈，不断迭代。我们❤️用户们，谢谢大家！</title><link>https://x.com/gdb/status/2078004399675503093</link><guid isPermaLink='false'>2078004399675503093</guid><pubDate>Fri, 17 Jul 2026 06:30:00 GMT</pubDate><description>我们的团队在快速响应反馈，不断迭代。我们❤️用户们，谢谢大家！</description></item><item><title>宝玉：最早我做字幕翻译的时候，语音转文字是用的 Whisper，但是 Whisper 有几个问题：

一个问题是时间戳不准，时…</title><link>https://x.com/dotey/status/2078003883855524314</link><guid isPermaLink='false'>2078003883855524314</guid><pubDate>Fri, 17 Jul 2026 06:28:00 GMT</pubDate><description>最早我做字幕翻译的时候，语音转文字是用的 Whisper，但是 Whisper 有几个问题：

一个问题是时间戳不准，时间戳不准拆分的就是就可能字幕和语音对不上，很影响效果，需要人工去从头到尾校对一遍

一个问题是中英文混排支持不好，中文其实支持也不算太好，所以中文的转录就效果很差

一个问题是不直接支持识别发言人

虽然这些问题都可以通过收费的云端模型来解决，但是成本相对高一些。

最近测试了 Qwen3 ASR，效果是真的很不错，配合 Qwen3-ForcedAligner 模型，可以识别后把词级时间戳对的很精准。0.6b 就足够了，本地运行资源占用也不高。
github.com/QwenLM/Qwen3-ASR


发言人识别也有开源的模型：Pyannote + WeSpeaker。不过这个发言人一多尤其是一起说话识别的不够准，但配合 Agent 结合上下文就能做到相对比较准了。

如果真的要求高，也可以走云端模型，比如火山引擎上的豆包录音文件识别模型 2.0 就质量挺好，速度也快，就是要额外花钱。</description></item><item><title>Greg Brockman：ChatGPT Work 非常适合处理你日常生活中的各种任务：</title><link>https://x.com/gdb/status/2078001746358784163</link><guid isPermaLink='false'>2078001746358784163</guid><pubDate>Fri, 17 Jul 2026 06:19:00 GMT</pubDate><description>ChatGPT Work 非常适合处理你日常生活中的各种任务：</description></item><item><title>Amjad Masad：$NVDA 这波应该被 K3 新闻带起来啊。反而跌了。</title><link>https://x.com/amasad/status/2077989946565206267</link><guid isPermaLink='false'>2077989946565206267</guid><pubDate>Fri, 17 Jul 2026 05:33:00 GMT</pubDate><description>$NVDA 这波应该被 K3 新闻带起来啊。反而跌了。</description></item><item><title>Bindu Reddy：Kimi K3 缩小了差距但仍排在前沿模型之后

我们的 LiveBench 基准有很多隐藏问题，所以模型很难靠记忆取巧…</title><link>https://x.com/bindureddy/status/2077980360793788789</link><guid isPermaLink='false'>2077980360793788789</guid><pubDate>Fri, 17 Jul 2026 04:54:00 GMT</pubDate><description>Kimi K3 缩小了差距但仍排在前沿模型之后

我们的 LiveBench 基准有很多隐藏问题，所以模型很难靠记忆取巧

K3 是最好的开源模型，但表现不如 Opus 4.8、Sol 和 Fable

在实际应用中，Kimi 输出很冗长，处理接近 Opus 级别问题的成本和 Opus 4.8 一样，但速度慢得多</description></item><item><title>AshutoshShrivastava：Kimi K3 好得绝</title><link>https://x.com/ai_for_success/status/2077973747903127668</link><guid isPermaLink='false'>2077973747903127668</guid><pubDate>Fri, 17 Jul 2026 04:28:00 GMT</pubDate><description>Kimi K3 好得绝</description></item><item><title>歸藏(guizang.ai)：藏师傅的 Kimi K3 测评来了，这次确实非常牛逼！

可以说是一个比较小的 DeepSeek 时刻

我直接拿它跟 …</title><link>https://x.com/op7418/status/2077969583018066116</link><guid isPermaLink='false'>2077969583018066116</guid><pubDate>Fri, 17 Jul 2026 04:12:00 GMT</pubDate><description>藏师傅的 Kimi K3 测评来了，这次确实非常牛逼！

可以说是一个比较小的 DeepSeek 时刻

我直接拿它跟 Opus 4.8 做了对比测试。

从结果来看，互有胜负。

在复杂前端和复杂开发的情况下，我觉得它跟 Opus 4.8 差不多是相当的水平。

至于 Fable 5 和 5.6，我觉得还差一些，但已经是一个非常牛逼的成绩了。</description></item><item><title>Ethan Mollick：Kimi K3 确实不错，但人们又开始过度迷信 Arena 排名了（还记得 Llama 4 吗？）

Arena 用户投…</title><link>https://x.com/emollick/status/2077969350573572490</link><guid isPermaLink='false'>2077969350573572490</guid><pubDate>Fri, 17 Jul 2026 04:11:00 GMT</pubDate><description>Kimi K3 确实不错，但人们又开始过度迷信 Arena 排名了（还记得 Llama 4 吗？）

Arena 用户投票的 ELO 评分本身就有局限，前端也就是个文本聊天而已，在这种主观评比下相对容易通过训练或调整 system prompt 来达到用户偏好的效果。</description></item><item><title>Lisan al Gaib：如果排除 OpenAI 和 Anthropic 在 Kimi K2 之前的模型，赶超时间线会被推到 Q1，因为最近的进展…</title><link>https://x.com/scaling01/status/2077966195878215862</link><guid isPermaLink='false'>2077966195878215862</guid><pubDate>Fri, 17 Jul 2026 03:58:00 GMT</pubDate><description>如果排除 OpenAI 和 Anthropic 在 Kimi K2 之前的模型，赶超时间线会被推到 Q1，因为最近的进展明显比 2025 年前快得多</description></item><item><title>Gorden Sun：Codex又开始了新一轮的老带新活动，这次最多可获得10次重置次数</title><link>https://x.com/Gorden_Sun/status/2077965748962783552</link><guid isPermaLink='false'>2077965748962783552</guid><pubDate>Fri, 17 Jul 2026 03:56:00 GMT</pubDate><description>Codex又开始了新一轮的老带新活动，这次最多可获得10次重置次数</description></item><item><title>Gorden Sun：Kimi K3生成的版本，也非常好。</title><link>https://x.com/Gorden_Sun/status/2077960441997975735</link><guid isPermaLink='false'>2077960441997975735</guid><pubDate>Fri, 17 Jul 2026 03:35:00 GMT</pubDate><description>Kimi K3生成的版本，也非常好。</description></item><item><title>歸藏(guizang.ai)：Codex 昨晚的更新在交互上终于对味了：

1. 左上角的切换：从 Work 和 Codex 切换成 ChatGPT …</title><link>https://x.com/op7418/status/2077959202627285056</link><guid isPermaLink='false'>2077959202627285056</guid><pubDate>Fri, 17 Jul 2026 03:30:00 GMT</pubDate><description>Codex 昨晚的更新在交互上终于对味了：

1. 左上角的切换：从 Work 和 Codex 切换成 ChatGPT 和 Codex

2. 历史聊天整合：ChatGPT 的历史聊天全部并进了左边“最近聊天”里面，你可以筛选是普通聊天还是 ChatGPT Work 的任务

3. 顶部导航：分了 Chat 和 Work 两个 Tab，交互逻辑跟网页版和移动端一致了</description></item><item><title>Ethan Mollick：基于GPT-4的巴基斯坦法官助手让他们处理的案件数量增加了6%，对质量没有任何影响。</title><link>https://x.com/emollick/status/2077958864478048321</link><guid isPermaLink='false'>2077958864478048321</guid><pubDate>Fri, 17 Jul 2026 03:29:00 GMT</pubDate><description>基于GPT-4的巴基斯坦法官助手让他们处理的案件数量增加了6%，对质量没有任何影响。</description></item><item><title>向阳乔木：如果只能推荐一个去 AI 味设计Skill。

那必须是大神 emil 的作品，而且动效超赞。

安装指令：
npx s…</title><link>https://x.com/vista8/status/2077955236048879724</link><guid isPermaLink='false'>2077955236048879724</guid><pubDate>Fri, 17 Jul 2026 03:15:00 GMT</pubDate><description>如果只能推荐一个去 AI 味设计Skill。

那必须是大神 emil 的作品，而且动效超赞。

安装指令：
npx skills add emilkowalski/skill</description></item><item><title>Lisan al Gaib：算了吧，拿出点胆量来
做出你的预测吧

不像 Nathan 发的那样：
"开源和闭源模型之间的差距 ~0 个月"
然后又…</title><link>https://x.com/scaling01/status/2077952519339131188</link><guid isPermaLink='false'>2077952519339131188</guid><pubDate>Fri, 17 Jul 2026 03:04:00 GMT</pubDate><description>算了吧，拿出点胆量来
做出你的预测吧

不像 Nathan 发的那样：
"开源和闭源模型之间的差距 ~0 个月"
然后又删了

希望你已经看到问题了

他们在声明中提到了 Mythos，但在实际基准测试时完全忽略它

那要是那些事都不发生呢？

那就是中国模型没追上，落后还不止1.4个月，且/或者 Artificial Analysis Index 其实不是在测通用能力，只是某个方面
或者中国模型确实在蒸馏，因此无法超越和拉开与美国模型的差距

我得简短点。我需要睡觉了。</description></item><item><title>Lisan al Gaib：MoonshotAI 会在年底前超越 OpenAI 和 Anthropic

或者不会呢？至少 X 上的炒作小伙伴想让你…</title><link>https://x.com/scaling01/status/2077950993342316923</link><guid isPermaLink='false'>2077950993342316923</guid><pubDate>Fri, 17 Jul 2026 02:58:00 GMT</pubDate><description>MoonshotAI 会在年底前超越 OpenAI 和 Anthropic

或者不会呢？至少 X 上的炒作小伙伴想让你这样信。

那我就把这个假设变成可证伪的。他们在说：
 - 中国 / MoonshotAI 在追赶
 - 他们全面追赶（不仅编码，几乎所有领域，包括受限模型比如 Mythos 5）
 - 根据 Artificial Analysis Index 和 MoonshotAI 提供的基准，目前差距约 ~1.4 个月，Kimi-K3 在 35 个基准中击败 Opus 4.8 30 个，击败 GPT-5.6-Sol 19 个
（他们直接忽视了所有 Mythos 变体）
 - 中国模型追赶不是靠蒸馏，所以他们应该会超过美国实验室

隐含的预测就是：
 - 某个中国模型 / MoonshotAI 会在 Artificial Analysis Index 上超越 Anthropic（和 OpenAI）的时间：
 - 中位数：2026-12-24（80% 置信区间：2026-09-17，2027-09-14）

既然他们说中国模型和美国模型一样通用，那就应该看到中国模型在解决未竟的数学、物理问题上的成功率超过美国模型。

就通用性而言，Kimi-K3 应该在这些基准的大多数上击败 Opus 4.8 和 GPT-5.6-Sol：
 - METR Time Horizons、FrontierCode、MirrorCode、UK AISI 网络靶场、ExploitBench/ExploitGym、CritPT、FrontierMath T4、ARC-AGI-2 / ARC-AGI-3、WeirdML、ALE-Bench、GSO、MRCR2/GraphWalks
 - 凭感觉

---

还有更投机的下游影响，来自中国超越美国模型这个事儿：
 - USG 参与度上升
 - 对芯片的出口管制更严
 - 可能搞个曼哈顿计划式的项目，因为 2027 年咱们要落后，正在跟中国竞速
 - 也有可能：美国禁中国模型或美国实验室从中国模型蒸馏

---

我的立场已经表得很清楚了。
中国模型大概落后 6-8 个月，有些领域比如编码落后稍少一些。

Kimi-K3 没有显著改变我对差距的估计，也还改变不了我对未来的看法，但等我们拿到我上面提的所有基准数据以后，就能看得清清楚楚了。

我这个立场的主要原因：
 - Kimi-K3 连 Mythos Preview 都没超过，而那是个 ~5 个月前的模型
 - 未来几个月咱们可能看不到比 Kimi-K3 更大的开源模型，可能得等到 2027 年初中期
 - 与此同时，Anthropic 从 2 月起就在研一个 10T 的模型，OpenAI 可能刚训完 GPT-6，规模也在这儿，SpaceX AI、Google 和 Meta 的 10T 参数美国模型也在路上。
 - 咱们现在看不到模型的真正前沿。Anthropic 和 OpenAI 在保守应对，因为发布新前沿模型的法律局面不清楚。
 - 历史上中国模型比美国模型更追求基准分，意味着他们的基准数字转化成真实世界性能的效率不如美国同行
 - GPT-5.6-Sol 在 Artificial Analysis Index 上的 token 效率仍然比 Kimi-K3 高 2-3 倍（而且可能更小，约 2T）
- 美国实验室算力更多

---

我对 Kimi 兄弟们发这个模型很高兴。
这是个牛逼的模型，可能是第一个真正好用的中国模型。</description></item><item><title>Simon Willison：给感受数据中心用水压力的超大规模云计算厂商们的建议：

买下几个高端乡村俱乐部，把高尔夫球场改成公园，花钱雇导游配备双筒…</title><link>https://x.com/simonw/status/2077943635765841993</link><guid isPermaLink='false'>2077943635765841993</guid><pubDate>Fri, 17 Jul 2026 02:29:00 GMT</pubDate><description>给感受数据中心用水压力的超大规模云计算厂商们的建议：

买下几个高端乡村俱乐部，把高尔夫球场改成公园，花钱雇导游配备双筒望远镜让前会员们去观鸟——帮他们拥抱更可持续的爱好！</description></item><item><title>Orange AI：Arena 这个指标有点离谱了…
如果开源模型能超过 Fable 这么多…
那 A 社还有什么价值…</title><link>https://x.com/oran_ge/status/2077942239343571298</link><guid isPermaLink='false'>2077942239343571298</guid><pubDate>Fri, 17 Jul 2026 02:23:00 GMT</pubDate><description>Arena 这个指标有点离谱了…
如果开源模型能超过 Fable 这么多…
那 A 社还有什么价值…</description></item><item><title>swyx：我们每年都确保在 AIE 大会上展示一些顶级 YC AI 公司。今年很荣幸邀请到 @garrytan 和 @eve_bo…</title><link>https://x.com/swyx/status/2077938877407633857</link><guid isPermaLink='false'>2077938877407633857</guid><pubDate>Fri, 17 Jul 2026 02:10:00 GMT</pubDate><description>我们每年都确保在 AIE 大会上展示一些顶级 YC AI 公司。今年很荣幸邀请到 @garrytan 和 @eve_bouff 分别为初创公司和设计工程师专场压轴分享。真的很享受这些坦诚而高价值的观点！</description></item><item><title>AshutoshShrivastava：Kimi K3 轻松击败 Fable 5。
目前在 Next.js Agent Performance Benchmar…</title><link>https://x.com/ai_for_success/status/2077932379667394692</link><guid isPermaLink='false'>2077932379667394692</guid><pubDate>Fri, 17 Jul 2026 01:44:00 GMT</pubDate><description>Kimi K3 轻松击败 Fable 5。
目前在 Next.js Agent Performance Benchmark 排名第一，性能远超 Fable 5。</description></item><item><title>小互：Suno 训练库被黑：代码泄露其从 YouTube Music 等抓了约 38 万小时内容

一名黑客用一种叫 Shai…</title><link>https://x.com/xiaohu/status/2077931885259538719</link><guid isPermaLink='false'>2077931885259538719</guid><pubDate>Fri, 17 Jul 2026 01:42:00 GMT</pubDate><description>Suno 训练库被黑：代码泄露其从 YouTube Music 等抓了约 38 万小时内容

一名黑客用一种叫 Shai-Hulud的蠕虫，搞到了公司员工的登录账号黑进了Suno公司，拿到其训练数据相关的源码。

信息显示，Suno抓取了：

- 113,879 小时的 YouTube Music 
- 62,117 小时的 Pond5 
- 12,287 小时的 Deezer

资料显示Suno还计划：准备下载大概 100 万小时的播客

入侵里，这名黑客还拿到了 Suno 用户的邮箱、电话，以及支付公司 Stripe 那边的相关信息。涉及的用户大约有几十万。

TechCrunch 在转述中写到，材料里还有部分卡号信息。</description></item><item><title>Bindu Reddy：Opus 5 近在咫尺了

4.8 现在有点过时了</title><link>https://x.com/bindureddy/status/2077930993902932367</link><guid isPermaLink='false'>2077930993902932367</guid><pubDate>Fri, 17 Jul 2026 01:38:00 GMT</pubDate><description>Opus 5 近在咫尺了

4.8 现在有点过时了</description></item><item><title>宝玉：Gemini 养一帮人真的是天天吃白饭，人家 Codex 一天发几个版本，他们几个月才更新一次，这一年来 Gemini …</title><link>https://x.com/dotey/status/2077929393729511716</link><guid isPermaLink='false'>2077929393729511716</guid><pubDate>Fri, 17 Jul 2026 01:32:00 GMT</pubDate><description>Gemini 养一帮人真的是天天吃白饭，人家 Codex 一天发几个版本，他们几个月才更新一次，这一年来 Gemini 网页版没半点长进，上次升级还把原来好用 Gem 列表从左边 sidebar 去掉了，到现在都不支持 Skills。</description></item><item><title>Lisan al Gaib：Kimi-K3 在 LiveBench 上落后于 GPT-5.4-xhigh</title><link>https://x.com/scaling01/status/2077927915338019074</link><guid isPermaLink='false'>2077927915338019074</guid><pubDate>Fri, 17 Jul 2026 01:26:00 GMT</pubDate><description>Kimi-K3 在 LiveBench 上落后于 GPT-5.4-xhigh</description></item><item><title>歸藏(guizang.ai)：我的时间线上已经全是 Kimi K3 了

估计 Anthropic 达里奥又要气疯了，可能今天晚上又得发一篇博客来强调…</title><link>https://x.com/op7418/status/2077927715639017633</link><guid isPermaLink='false'>2077927715639017633</guid><pubDate>Fri, 17 Jul 2026 01:25:00 GMT</pubDate><description>我的时间线上已经全是 Kimi K3 了

估计 Anthropic 达里奥又要气疯了，可能今天晚上又得发一篇博客来强调开源模型的危害了</description></item><item><title>Ethan Mollick：我想现在该思考一个问题：开源模型的预审核制度是怎样运作的？Kimi K3 还没有发布模型卡，不过可能在几周后权重发布时会…</title><link>https://x.com/emollick/status/2077912902032392661</link><guid isPermaLink='false'>2077912902032392661</guid><pubDate>Fri, 17 Jul 2026 00:26:00 GMT</pubDate><description>我想现在该思考一个问题：开源模型的预审核制度是怎样运作的？Kimi K3 还没有发布模型卡，不过可能在几周后权重发布时会发布。但开源模型容易被越狱。那些声称达到 Mythos/Sol 级别的开源模型（K3 还没到，但迟早会有人达到）会受到美国/英国等国家的审核吗？中国会开始关注网络安全风险吗？既然政策一直在演变，我猜没人知道。

我知道会有人说，开源模型一旦发布就无法召回，这是对的！但政府可以强制要求任何与本国国民交易的公司不使用未审核模型或向他们提供这些模型。没人会强制收走你下载的权重，但政府完全可以通过风险太高的理由让企业都避免使用它们。

这一切都表明，需要某种国际合作机制来审核模型。</description></item><item><title>Orange AI：我实测 glm 5.2 和 deepseek 都是中文的</title><link>https://x.com/oran_ge/status/2077908565118030089</link><guid isPermaLink='false'>2077908565118030089</guid><pubDate>Fri, 17 Jul 2026 00:09:00 GMT</pubDate><description>我实测 glm 5.2 和 deepseek 都是中文的</description></item><item><title>Amjad Masad：看起来蒸馏模型竟然能超越教师模型 😂</title><link>https://x.com/amasad/status/2077908318975332417</link><guid isPermaLink='false'>2077908318975332417</guid><pubDate>Fri, 17 Jul 2026 00:08:00 GMT</pubDate><description>看起来蒸馏模型竟然能超越教师模型 😂</description></item><item><title>Amjad Masad：想玩我的国际象棋引擎（开发中）：qwen-chess.replit.app/

它在国际象棋上的性能已经超越了前沿模型。…</title><link>https://x.com/amasad/status/2077908032944779732</link><guid isPermaLink='false'>2077908032944779732</guid><pubDate>Fri, 17 Jul 2026 00:07:00 GMT</pubDate><description>想玩我的国际象棋引擎（开发中）：qwen-chess.replit.app/

它在国际象棋上的性能已经超越了前沿模型。

在 200 万个 Stockfish 标记位置上进行了微调，然后进行了短的 GRPO RL pass。

附带文档/教程，包含所有实验和注释代码。</description></item><item><title>Kling AI：一颗樱桃种子承载了一整段记忆 🍒

踏入乔瑞英的《The Well》—— 一个关于童年和我们珍藏时刻的安静而强有力的故事…</title><link>https://x.com/Kling_ai/status/2077906127950581864</link><guid isPermaLink='false'>2077906127950581864</guid><pubDate>Fri, 17 Jul 2026 00:00:00 GMT</pubDate><description>一颗樱桃种子承载了一整段记忆 🍒

踏入乔瑞英的《The Well》—— 一个关于童年和我们珍藏时刻的安静而强有力的故事。

祝贺乔瑞英荣获 Kling AI NEXTGEN 2026 韩国大学创意挑战最佳叙事奖！</description></item><item><title>Aravind Srinivas：Agent在Vera CPU上跑得特别溜。沙盒运行时和CPU芯片的垂直整合，在大规模部署cloud agent时会带来更…</title><link>https://x.com/AravSrinivas/status/2077905903576109291</link><guid isPermaLink='false'>2077905903576109291</guid><pubDate>Thu, 16 Jul 2026 23:59:00 GMT</pubDate><description>Agent在Vera CPU上跑得特别溜。沙盒运行时和CPU芯片的垂直整合，在大规模部署cloud agent时会带来更好的margin、吞吐量和延迟表现。</description></item><item><title>🚨 AI News | TestingCatalog：AI/ML API 允许用户使用同一套 key、SDK 和计费。所有模型都跑在一个兼容 OpenAI 的单一接口后面，还…</title><link>https://x.com/testingcatalog/status/2077902929810399453</link><guid isPermaLink='false'>2077902929810399453</guid><pubDate>Thu, 16 Jul 2026 23:47:00 GMT</pubDate><description>AI/ML API 允许用户使用同一套 key、SDK 和计费。所有模型都跑在一个兼容 OpenAI 的单一接口后面，还有 1000 多个其他模型可用，切换到不同的模型只需要改一个参数而已。

来试试看 👀

aimlapi.com</description></item><item><title>OpenAI Developers：不需要离开 Codex 就能审核 Pull Request 并做后续修改。  
PR Chat 让你在具体代码审查上下文…</title><link>https://x.com/OpenAIDevs/status/2077902662973190570</link><guid isPermaLink='false'>2077902662973190570</guid><pubDate>Thu, 16 Jul 2026 23:46:00 GMT</pubDate><description>不需要离开 Codex 就能审核 Pull Request 并做后续修改。  
PR Chat 让你在具体代码审查上下文中向 Codex 提问。  
内联代码编辑支持把审核反馈发给 Codex，当场检查补丁改动，还可以选择修改、接受或拒绝。</description></item><item><title>Chubby♨️：今年才开始真正感受到并理解了什么叫加速度。

产品一茬接一茬，每次发布都是大跃进，中美双方互相较劲你追我赶。

相比之下…</title><link>https://x.com/kimmonismus/status/2077902097270673472</link><guid isPermaLink='false'>2077902097270673472</guid><pubDate>Thu, 16 Jul 2026 23:44:00 GMT</pubDate><description>今年才开始真正感受到并理解了什么叫加速度。

产品一茬接一茬，每次发布都是大跃进，中美双方互相较劲你追我赶。

相比之下，2024 和 2025 简直慢得不像话。</description></item><item><title>Guillermo Rauch：Kimi K3 在 nextjs.org/evals 评测中表现最佳，超越 Fable，用更短的时间达到了同等成功率。
…</title><link>https://x.com/rauchg/status/2077900518404321759</link><guid isPermaLink='false'>2077900518404321759</guid><pubDate>Thu, 16 Jul 2026 23:37:00 GMT</pubDate><description>Kimi K3 在 nextjs.org/evals 评测中表现最佳，超越 Fable，用更短的时间达到了同等成功率。

这是首个开源模型在这个全面的 Web 工程基准测试中超越所有商业闭源模型。

几点说明：

▪️ 基准测试并不总能反映全貌，虽然这是一个重要信号，进一步佐证这可能成为开源模型的突破性时刻

▪️ 目前还没有模型在这组评测中达到 100% 完成度，最高分的模型达到 92%，"借助辅助"时达到 96%</description></item><item><title>Lisan al Gaib：而且这也不奇怪，原因可能有几个：
- Kimi-K3 不是 Mythos 级别的模型
- Project Glasswi…</title><link>https://x.com/scaling01/status/2077898959410892978</link><guid isPermaLink='false'>2077898959410892978</guid><pubDate>Thu, 16 Jul 2026 23:31:00 GMT</pubDate><description>而且这也不奇怪，原因可能有几个：
- Kimi-K3 不是 Mythos 级别的模型
- Project Glasswing 就是为了防这个才搞的
- Project Glasswing / Mythos 的网络风险纯粹是吓唬人的噱头</description></item><item><title>ChatGPT：速看新版ChatGPT应用里的电脑使用和内置浏览器 👀


@dkundel 展示了ChatGPT如何连上你的电脑应用并…</title><link>https://x.com/ChatGPTapp/status/2077898407591718936</link><guid isPermaLink='false'>2077898407591718936</guid><pubDate>Thu, 16 Jul 2026 23:29:00 GMT</pubDate><description>速看新版ChatGPT应用里的电脑使用和内置浏览器 👀


@dkundel 展示了ChatGPT如何连上你的电脑应用并浏览网页，帮你做调研、逛网站，和你一起搞定任务。</description></item><item><title>Aravind Srinivas：有点意思。价值不在权重本身，而在 RSI harness 和能够运行高价值上下文推理的能力。</title><link>https://x.com/AravSrinivas/status/2077894147071991850</link><guid isPermaLink='false'>2077894147071991850</guid><pubDate>Thu, 16 Jul 2026 23:12:00 GMT</pubDate><description>有点意思。价值不在权重本身，而在 RSI harness 和能够运行高价值上下文推理的能力。</description></item><item><title>Greg Brockman：基准测试现在饱和得特别快。</title><link>https://x.com/gdb/status/2077887553655689239</link><guid isPermaLink='false'>2077887553655689239</guid><pubDate>Thu, 16 Jul 2026 22:46:00 GMT</pubDate><description>基准测试现在饱和得特别快。</description></item><item><title>Cohere：我们联合创始人@nickfrosst十年前还是@UofT的学生研究员，如今他正帮助领导加拿大的主权AI领军企业。

他会…</title><link>https://x.com/cohere/status/2077886455716691982</link><guid isPermaLink='false'>2077886455716691982</guid><pubDate>Thu, 16 Jul 2026 22:41:00 GMT</pubDate><description>我们联合创始人@nickfrosst十年前还是@UofT的学生研究员，如今他正帮助领导加拿大的主权AI领军企业。

他会给多伦多大学的学生创业者提什么建议呢？</description></item><item><title>Lisan al Gaib：这是IPO后的第一次星舰发射吧？

如果火箭爆炸的话，看市场怎么反应会很有趣</title><link>https://x.com/scaling01/status/2077886148223897694</link><guid isPermaLink='false'>2077886148223897694</guid><pubDate>Thu, 16 Jul 2026 22:40:00 GMT</pubDate><description>这是IPO后的第一次星舰发射吧？

如果火箭爆炸的话，看市场怎么反应会很有趣

或者是个被砍掉的发布？</description></item><item><title>Bindu Reddy：以防Kimi 3被禁就先下载权重吧😂</title><link>https://x.com/bindureddy/status/2077881273717256330</link><guid isPermaLink='false'>2077881273717256330</guid><pubDate>Thu, 16 Jul 2026 22:21:00 GMT</pubDate><description>以防Kimi 3被禁就先下载权重吧😂</description></item><item><title>Simon Willison：Turso要扩展超越SQLite，成为支持多个数据库兼容层的基础——这样这个项目就有意思多了！</title><link>https://x.com/simonw/status/2077880571150389751</link><guid isPermaLink='false'>2077880571150389751</guid><pubDate>Thu, 16 Jul 2026 22:18:00 GMT</pubDate><description>Turso要扩展超越SQLite，成为支持多个数据库兼容层的基础——这样这个项目就有意思多了！</description></item><item><title>🚨 AI News | TestingCatalog：Google正在为Gemini桌面版打造Skills原生菜单。这些Skills有望在所有对话中都能用上（祈祷中）。

用…</title><link>https://x.com/testingcatalog/status/2077879966889382371</link><guid isPermaLink='false'>2077879966889382371</guid><pubDate>Thu, 16 Jul 2026 22:16:00 GMT</pubDate><description>Google正在为Gemini桌面版打造Skills原生菜单。这些Skills有望在所有对话中都能用上（祈祷中）。

用户可以上传、创建和编辑Gemini Skills，也可以用Gemini来帮忙创建。

Skill文件夹也会上线，用户可以从本地文件夹选择需要的Skills。</description></item><item><title>AK：Harness手册

让不断演进的代理框架保持可读、易导航、可编辑</title><link>https://x.com/_akhaliq/status/2077879378982166621</link><guid isPermaLink='false'>2077879378982166621</guid><pubDate>Thu, 16 Jul 2026 22:13:00 GMT</pubDate><description>Harness手册

让不断演进的代理框架保持可读、易导航、可编辑</description></item><item><title>AK：论文：
huggingface.co/papers/2607.1…</title><link>https://x.com/_akhaliq/status/2077879380647305299</link><guid isPermaLink='false'>2077879380647305299</guid><pubDate>Thu, 16 Jul 2026 22:13:00 GMT</pubDate><description>论文：
huggingface.co/papers/2607.1…</description></item><item><title>clem 🤗：我不止一次强调过，那些在开放科学和开源 AI 领域领先的国家或公司，会在几年后开始引领 AI 前沿，因为这能大幅加速 A…</title><link>https://x.com/ClementDelangue/status/2077873510144512400</link><guid isPermaLink='false'>2077873510144512400</guid><pubDate>Thu, 16 Jul 2026 21:50:00 GMT</pubDate><description>我不止一次强调过，那些在开放科学和开源 AI 领域领先的国家或公司，会在几年后开始引领 AI 前沿，因为这能大幅加速 AI 进步。美国就是通过这样做才取得领先地位的</description></item><item><title>Simon Willison：Turbo 正在超越 SQLite 的范围扩展，成为多个数据库兼容层可以构建的基础——在我看来这让这个项目有趣多了！</title><link>https://x.com/simonw/status/2077872001914748947</link><guid isPermaLink='false'>2077872001914748947</guid><pubDate>Thu, 16 Jul 2026 21:44:00 GMT</pubDate><description>Turbo 正在超越 SQLite 的范围扩展，成为多个数据库兼容层可以构建的基础——在我看来这让这个项目有趣多了！</description></item><item><title>Guillermo Rauch：我很兴奋地欢迎开发工具的两位传奇人物 Pete Hunt (@floydophone) 和 Nick Schrock (…</title><link>https://x.com/rauchg/status/2077870043833229692</link><guid isPermaLink='false'>2077870043833229692</guid><pubDate>Thu, 16 Jul 2026 21:36:00 GMT</pubDate><description>我很兴奋地欢迎开发工具的两位传奇人物 Pete Hunt (@floydophone) 和 Nick Schrock (@schrockn) 加入 Vercel。

Pete 是 @reactjs 在 Meta 的先驱之一。他早早下注在用 ⚛️ React 驱动 Instagram Web，并在内部和外部推广了它。他将负责 Frameworks 并领导 @nextjs。我想不出还有谁更合适来领导 React 最受欢迎的框架走向更伟大的高度。

Nick 共同发明了 @graphql，解决了 Facebook 规模下一些最复杂的数据基础设施和访问问题，还提供了令人愉快的开发体验。他将专注于 Agentic Developer Experience，解决为下一个十亿 agents 赋能的问题，并引领通向自我改进软件未来的方向。

对于创业公司创始人来说，欢迎这样级别的工程天才同时又是好人，这简直是梦想成真。你可能想和他们一起工作，他们现在在招人 😁。他们的 DM 是开放的，无论是工作申请还是 bug 报告！</description></item></channel></rss>