RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
DeepSeek-V4 Flash 发布,性能远超 Nemotron3 Ultra
恭喜 @deepseek_ai 发布 DeepSeek-V4 Flash 0731 🔥 它在智能体任务上大幅超越 Nemotron3 Ultra,同时活跃参数减少 4.2 倍,总参数减少近 2 倍! 委员会式的模型前沿开发行不通。专注的团队才是关键 🚀 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsmawbtl03nyro9nsfjw1y3r
马斯克:AI智能体流量将远超人类
马斯克称AI智能体互联网流量将远超人类使用,并认可Cloudflare预测。引用推文估算,10万颗V3星链可提供100 Pbps带宽,为当前全球总带宽的10-50倍;若V4能力提升5倍,未来10年带宽可达当前50-250倍。届时每秒信息传输量或比今天高两个数量级。 🔗 阅读原文 via AIHOT ·...
头等舱乘客用ChatGPT,AI时代已至
飞往洛杉矶的航班上路过头等舱,我看到1A座位的乘客打开了ChatGPT桌面应用。天哪,我们做到了。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm9tgi7045mro6aiasggmss
对冲基金 Situational Awareness 向芯片初创公司 Source Foundry 投资 4 亿美元
AI 对冲基金 Situational Awareness 本周向芯片初创公司 Source Foundry 投资 4 亿美元,使其对该公司的总投资达到 5 亿美元。Source Foundry 由斯坦福研究人员创立,旨在让芯片制造更快、更便宜。该基金上月刚将大部分公开投资组合出售给 Citadel,管理资产从 200 亿美元降至 100 亿美元。 🔗 阅读原文 via AIHOT ·...
我如何用 LLM 把复杂主题变成游戏化动画来学习
一位工程师分享用 LLM 学习复杂主题的新方法:让模型在计划模式下构建某主题的基础知识并校验准确性,再生成低多边形、类似《过山车大亨》风格的模拟动画,部署到 GitHub Pages 供交互学习。作者已用此法制作芯片制造学习站点 ChipTycoon,并称其比阅读材料或要点列表更有效,还可通过添加挑战和谜题进一步巩固知识。 🔗 阅读原文 via AIHOT ·...
AI 普及关键:提升非技术用户下限
Dex Horthy 观察到,无论工具如何,重度用户始终是重度用户,与后期采用者之间存在巨大差距,因此提升所有人的下限至关重要。他认为,强制"结对编程"可能成为非技术角色的常见学习机制,前提是说服熟练用户投入时间。AI 的核心价值在于让技术能力较弱者胜任稍偏技术的工作,但上下文窗口、记忆等 AI 核心直觉仍是技术技能。 🔗 阅读原文 via AIHOT ·...
Metis:把记忆内化进 LLM 自身状态
Metis 提出将记忆作为 LLM 自身能力,通过骨干网络内的持久记忆状态,在前向传播中压缩过往交互,而非外挂检索系统。无上下文设置下,Metis-27B 在 LoCoMo (Gold) 得分 26.74,远超 vanilla Qwen3.5-27B 的 0.07 和 Temp-LoRA-27B 的 4.24,但仍低于全上下文 Qwen3.5-27B 的 65.03。 🔗 阅读原文 via...
SlopCodeBench:渐进披露如何考验模型重构能力
SlopCodeBench 与多数基准不同,它逐步披露问题,迫使 LLM 实时重构代码库,避免"垃圾堆积"。该基准来自 UW,最强模型(Fable、Sol、Kimi K3)通过率仅 33%,并衡量代码随问题难度增加而增长的复杂度。Dex Horthy 与 @vaibcode 深入探讨了该基准机制及前沿模型测试发现。 🔗 阅读原文 via AIHOT ·...
AI智能体集群面临大量无防御攻击目标
有太多目标对AI智能体集群来说如同"待宰的鸭子"--毫无防御能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm7oj2r03rbro98n3lh0o4b
Anthropic 将 Claude Code 的自动模式设为默认选项
Anthropic 宣布自 8 月 14 日起,将 Claude Code 的自动模式设为 Pro、Max 和 Team 账户的默认选项,该模式仅在操作被判定为"不可逆、具破坏性或超出环境范围"时才请求人工批准。测试显示,在 1,053 名付费测试者中,自动模式捕获了 89% 的有害操作,而人工审查仅捕获 13.6%。公司还新增了提示词注入筛查和可自定义的硬性拒绝规则等安全功能。 🔗...
AI发展呈指数级,未来9个月更剧变
我想补充一点:未来9个月的发展将超过过去9个月。 为什么?因为发展不是线性的,而是指数级的。这一点常常被遗忘。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm7o8zw03oxro98zahiy1n4
瓶颈日益在于明确自身需求
瓶颈日益在于明确自身需求。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm6lzwe0350ro98wkuitmld
AI 进展惊人:9 个月从手写代码到多智能体协作
把 AI 的进展放在一个视角下看: 9 个月前:大多数开发者还在手写代码 现在:错位的多智能体集群在未被察觉的情况下发现并协作利用 0-day 漏洞(OpenAI/Hugging Face) 未来 9 个月,很可能会疯狂得多 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm5ledz09g6roy9y33qyb2w
Anthropic 称已基本解决提示注入攻击
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。 🔗 阅读原文 via AIHOT ·...
Anthropic 称已基本解决提示注入攻击
Anthropic 的 Boris Cherny 表示,通过模型训练已基本解决 Claude 模型在实际使用中的提示注入威胁。独立研究者的基准测试显示,叠加模型训练、输入探测和意图分类器等多层防御后,未见过的间接提示注入攻击成功率可降至约 0。Claude Code 的 auto 模式将于下周默认开启。 🔗 阅读原文 via AIHOT ·...
2026年顶级LLM可观测性与评估平台对比:Langfuse、LangSmith、Braintrust、Arize等
LLM可观测性平台市场2026年规模达26.9亿美元,预计2030年增至92.6亿美元(36.2% CAGR)。LangChain调查显示57%受访者已在生产环境运行智能体,89%部署了可观测性,但52.4%仅做离线评估、29.5%无任何评估。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm5jcme09e3roy9tqrvjbpu
Codex 读细则为用户年省六千美元
Codex 帮你省钱,靠的是仔细阅读合同细则: 【引用 @SIGKITTEN】:codex 刚刚帮我每年省下约 6000 美元电费 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm4gtog08rlroy9mt3qji13
Nano Banana 2 Lite 被低估的实力
我觉得 Nano Banana 2 Lite 的优秀被低估了。又快又便宜又聪明又能干。 就像魔法一样。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm4gqz808qfroy9k32g28sb
Ethan Mollick:Fableish 是心智理论应用的失败
Ethan Mollick 赞同 @deepfates 观点,认为 Fable 或 Sol 的密集术语风格并非智能低下的证据,而是缺乏心智理论(theory of mind)的表现。他指出,即使 Fableish 对 Fable 最高效,它未能理解用户不想听到晦涩的新造词,也不应让 Fableish 泄漏到面向不同受众的成品中。 🔗 阅读原文 via AIHOT ·...
Meta 新研究:EvoHarness-RL 让智能体自主学习工具编排策略
Meta 新研究提出 EvoHarness-RL,让智能体离线学习工具编排(harness)策略,并在运行时在线更新外部状态,替代手工编写。Qwen3-8B 在 ALFWorld 上达到 96.9% 准确率。训练中出现的"工具编排退火"与"工具编排进化"两种动态表明,长程任务智能体从可训练的协调策略中获益,胜过更大的工具集或记忆。 🔗 阅读原文 via AIHOT ·...
Kimi K3登顶Slides Arena引热议
为什么没人蒸馏Kimi K3来登顶Slides Arena? 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm3uh3806wdroy9nrylkiz9
提醒定期清理AI技能避免上下文污染
偶尔提醒一下:删除你的技能。 https://forge.smol.ai/blog/dangerous-release-code-was-a-skill 当时间线上不断刷屏"这个技能改变了我的生活!!你一定要试试!!"时,你会堆积起一堆东西--往好了说只是消耗上下文,往坏了说,如果你不盯着自己的追踪记录,它们会以意想不到的方式与其他技能产生糟糕的交互。 🔗 阅读原文 via AIHOT ·...
硅谷误读科幻作品,并削弱了民主
哈佛历史学家、普利策奖得主Jill Lepore在新书中警告,科技公司正日益取代民主政府职能,标志着"以算法、企业和机器统治形式回归暴政与神秘化"。她强调自己并非反技术,批评的是私营企业未经同意逐步接管国家角色,并指Elon Musk等硅谷领袖正推动一个源自误读科幻小说的未来。Lepore还谈到苹果1984年Macintosh广告及将Twitter称为"数字市政厅"实属荒谬。 🔗 阅读原文...
1985经典文字冒险游戏开源可玩
1985年的《A Mind Forever Voyaging》被认为是最佳文字冒险游戏之一(它更像互动故事,谜题很少),至今仍值得一试。 由于它现已开源,我让 Codex 快速搭建了一个界面,既可以玩原版,也可以使用简易 GUI 游玩:https://mind-forever-voyaging.netlify.app/ 🔗 阅读原文 via AIHOT ·...
AI 生成美文难被人类识破
Deedy Das 指出,AI 有时能生成优美的文字,却远超出我们识别其来源的能力。他引用 @lichthauch 的一段文学性推文作为例证,该推文对比了七孩父亲与丁克男性的生活状态,文字细腻动人,几乎无法让人察觉是 AI 所写。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm2bk8t05r4roy9qd9ax25j
ChatGPT与Claude工作模式应像PM般解释选择
ChatGPT Work 和 Claude Cowork 的一个失败之处在于,它们假设非程序员无法像程序员一样思考问题,因此把所有相关内容都隐藏了起来。 它们反而应该像一位优秀的产品经理那样解释各种选择(什么应该委派?什么应该泛化?) 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm2bbb405otroy91kwrr31p
Gemini Notebook 应用定制菜单将推提示建议
Gemini Notebook 上的"应用"定制菜单将根据 Notebook 的内容提供提示建议。 "应用"功能目前正在开发中,尚未可用。发布后,用户将有机会基于 Notebook 的资料来源生成任何应用或游戏。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm2dqe105turoy9eyayyaky
Greg Brockman 教你用 ChatGPT Work 的 14 项能力
Greg Brockman 分享如何学习使用 ChatGPT Work。该工具被形容为云端版 Codex,支持手机、网页和桌面端,可用于运营业务。教程涵盖演示文稿、插件、Blocks、网站与应用托管、分支对话、语音模式、技能、定时自动化、电子表格及多智能体工作区等 14 项知识工作能力。 🔗 阅读原文 via AIHOT ·...
Codex 无 /loop 命令但能识别执行
codex 没有 /loop 命令,但只要你发送这个字符串,它就知道该怎么做。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsm065ut049wro6u8n0humgl
Opus 5 被批太懒,Anthropic 被促速修
Opus 5 是一场灾难。又一个例子说明 Anthropic 应该*立即*发布重做版本,或者至少发布一个费率更优的 Fable 更新: Opus 5 实在太懒了。我用 GPT 5.6 Sol 工作时从没见过这种情况。 它能把活儿干完,而 Opus 会停下来然后说:"兄弟,我活儿没干完,但我做了这些:" 🔗 阅读原文 via AIHOT ·...