RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
swyx引Noam Brown:开源模型评估应以美元成本而非token数为基准
swyx引用OpenAI研究员Noam Brown的观点,强调任何评估报告都应保持恒定推理预算。由于开源模型每美元可获得的token量远超闭源API,因此发布开源模型时,应按主流推理提供商的美元成本(而非token数量)来报告思考水平。该观点源自@saranormous与Noam...
AI认知分歧:指数增长与稳态的误解
我注意到的一件事是,现在相信AI是"真实"的人更多了,但在那些知道我们正处于指数增长的人与那些心智模型认为我们处于某种稳态的人之间,分歧正在扩大。这种差异导致了误解。 🔗 阅读原文:https://x.com/emollick/status/2070949202335551600
Gallup民调:71%美国人反对本地建设AI数据中心
Gallup民调显示,71%美国人反对在本地建设AI数据中心,女性(55%)强烈反对比例高于男性(43%)。反对主因并非恐惧AI,而是资源压力(50%反对者提及,其中水、电各占18%);支持者则看重经济(66%)和就业(55%)。政治风险广泛,多数民主党、独立派、共和党均反对,民主党最强烈(56%强烈反对)。自2023年以来,美国已出现300+州及地方数据中心禁令/暂停。但现代数据中心已能缓...
循环工程即系统设计增强的提示词工程
循环工程就是带优秀系统设计的提示词工程。 🔗 阅读原文:https://x.com/omarsar0/status/2070946371255804208
AI研究员Nathan Lambert:因批评监管俘获与开源攻击遭更多敌意
AI研究员Nathan Lambert发文称,因公开批评监管俘获(regulatory...
BINEVAL:新型LLM-as-Judge评估方法
BINEVAL 是一种新型 LLM-as-Judge 评估方法,解决整体评分隐藏推理与天花板效应。它将每个评估标准分解为原子的是/否问题,对每个输出独立回答,再汇总为校准的多维分数。每个问题级判定均可检查,用于精确定位低分原因,并直接作为提示改进信号。在 SummEval、Topical-Chat 和 QAGS 基准上,无需训练即可匹配或超越 UniEval 和...
玛格丽特·阿特伍德批评AI:只用过一次Claude,给出错误答案,直言"垃圾进垃圾出"
《使女的故事》作者玛格丽特·阿特伍德在葡萄牙波尔图的Babell文学节上表示,她仅用过一次Anthropic的Claude聊天机器人,询问英国侦探剧《Father...
DeepSeek 发布 DSpark:半并行推测解码推理优化方法
DeepSeek 提出 DSpark,一种半并行推测解码系统,使 DeepSeek-V4 在相同吞吐量下每用户生成速度提升约 60% 至 85%。核心创新在于选择性验证:草稿模型并行生成多个候选 token,再由一个小型马尔可夫头根据前一个 token 微调每个猜测,弥补纯并行推测后段 token 组合质量下降的缺陷。置信度调度器基于接受概率和 GPU 负载,动态决定每个请求需验证的...
LLM讲解通俗易懂引热议
一位老师以通俗易懂的方式讲解大语言模型(LLM),引发网友共鸣,并邀请大家分享看法。原文信息有限,未提及具体模型名称或课程细节。 🔗 阅读原文:https://x.com/berryxia/status/2070931122675130396
Kim评论GPT-5.6评测:性价比或优于Fable 5,但Fable 5.1仍是整体更优选择
Kim认为GPT-5.6性价比可能优于Fable 5,但Fable已发布新版5.1,短期内Fable仍是更好模型。@synthwavedd评测指出:GPT-5.6继承5.5较弱基座,最大配置(Sol...
开放AI讨论须区分开源与开放权重模型
关于开放性与AI的讨论需要区分充满活力和创新的开源运动(它在束缚及其他关键领域推进了技术前沿)与开放权重前沿模型,后者完全依赖于少数中国公司的善意。 🔗 阅读原文:https://x.com/emollick/status/2070928706843898117
DeepSeek 发布 DSpark 推测解码并开源 DeepSpec
DeepSeek 是 GOAT。🐳 他们刚刚发布了 DSpark,一种新的推测解码方法,将吞吐量提升 51% 到 400%。 他们还开源了背后的训练框架 DeepSpec。 这才是真正的开放 AI。 🔗 阅读原文:https://x.com/Yuchenj_UW/status/2070928299744972814
Claude Code 桌面版新增原生多会话拖拽分屏
Claude Code 桌面版更新,支持原生多会话拖拽分屏,将并行 Agent 工作流可视化。用户可在桌面 App 中开多个会话,左侧侧边栏统一管理,拖拽即可排列并排窗格,支持单独弹出窗口。内置终端、文件编辑器、预览面板均可分屏排布,底部同时显示多个会话的输入区。相比此前依赖 tmux 和终端窗口切换,效率大幅提升。 🔗...
美国AI基础设施建设瓶颈从GPU转为许可:300多项数据中心禁令,但水耗与电费担忧被数据驳斥
美国AI基础设施建设最大瓶颈已从GPU变为许可。《The Information》地图显示2023年以来有300多项州级和地方数据中心禁令或暂停,今年通过275项,还有75项在审,中西部和南部抵制最强。但现实数据反超担忧:微软新一代AI数据中心采用芯片级闭环冷却,每站每年避免超1.25亿升水,全舰队用水效率自2021年提升39%至0.30升/kWh;谷歌86%淡水来自低中风险源,全球PUE...
Codex 质量更新改善长线程滚动
🆕 Codex 质量提升更新本周发布。 从长线程开始:滚动现在更流畅,并且在浏览对话时你的位置保持不变。 🔗 阅读原文:https://x.com/OpenAIDevs/status/2070922791529091376
Anthropic Fable 被美国政府要求下架,OpenAI GPT-5.6 被迫延迟发布
Anthropic 发布 Fable 三天后,美国政府要求限制非美公民访问,模型被撤下。一个月后 OpenAI GPT-5.6 准备就绪,Sam Altman 因政府压力延迟发布,仅向可信伙伴开放。研究员称 GPT-5.6 编程极强,官方博文侧重安全。Box CEO 指出已形成事实监管:达到特定算力规模的模型发布前需政府审查。OpenAI 推迟 IPO 至 2027 年。Anthropic...
AI Engineer World's Fair 2026 参会人数超6000,预计7000时售罄
swyx 宣布 AI Engineer World's Fair 2026 参会人数已超6000,预计本周末达到7000时正式售罄。本届博览会规模为历届最大:展区扩大4倍,设4个展区舞台;新增研究员海报与 Poaster 环节、AI 领袖闭门会议(Token Billionaires & Off the Record);覆盖医疗、GTM、FDE、AGC、金融等垂直领域;边会包括 NEO 和...
医疗AI的真正壁垒:工作流而非答题准确率
医疗AI常被简化为"模型答题准确率"的竞争,但真正的难点在于进入实际工作流--包括医生自然语言处理、病历结构化、患者上下文理解、支付方对接、院内系统集成以及审计责任。产品壁垒最终大概率不是一个 chatbox,而是与医疗场景的深度融合。 🔗 阅读原文:https://x.com/frxiaobei/status/2070920165966164327
LangChain 从零构建深度 Agent 教程:三大上下文工程技巧解决长任务忘事崩链
LangChain 官方发布深度 Agent 从零构建教程,通过三大上下文工程技巧解决长任务"忘事崩链":1)结构化 TODO 带状态管理;2)虚拟文件系统省 token 实现跨轮记忆;3)子代理委派并隔离上下文。教程含 5 个渐进式 Notebook,从 ReAct 循环起步,逐步叠加规划、文件系统、子代理,最终搭建可联网深度研究 Agent。配套 deepagents...
苹果Vision负责人跳槽OpenAI,触控OLED MacBook用M5芯片
2026年6月26日,Mark Gurman称苹果Vision产品组副总裁Paul Meade下周离职加入OpenAI硬件部门。他负责Vision Pro、无屏幕AI智能眼镜及AR眼镜研发。苹果计划首款触控OLED MacBook使用M5 Pro/Max芯片,2026年底到2027年初发布;M7...
苹果Vision负责人跳槽OpenAI,触控OLED MacBook用M5芯片
2026年6月26日,Mark Gurman称苹果Vision产品组副总裁Paul Meade下周离职加入OpenAI硬件部门。他负责Vision Pro、无屏幕AI智能眼镜及AR眼镜研发。苹果计划首款触控OLED MacBook使用M5 Pro/Max芯片,2026年底到2027年初发布;M7...
Anthropic Fable 5 或数日内恢复,特朗普政府准备解除限制
Axios报道,Anthropic的Fable 5模型可能数日内重新可用。特朗普政府即将解除限制,商务部长Howard Lutnick致信称Anthropic已与美国政府合作解决风险,但五角大楼和NSA仍需最终批准。该模型因安全担忧于6月12日被关停,其无附加安全限制的变体Mythos 5已面向部分合作伙伴恢复。Fable 5恢复后是否会面临持续限制(类似GPT-5.6...
SemiAnalysis:AI token支出已达薪酬30%
我们在《AI价值捕获》一文中一个令人不安的内部观察是:SemiAnalysis 现在的 token 支出约占员工薪酬的 30%,员工平均每月使用近 50 亿 token,是 Meta 的 5 倍以上,而我们的顶级贡献者已超过 1000 亿。我们公开写下这一点,是因为我们认识的每一家研究公司、对冲基金和律所,都在朝着类似的数字迈进,只是时间上有所延迟。(1/4)🧵 🔗...
DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60-85%
DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60-85% 和 57-78%。离线测试中,接受长度比 Eagle3 高...
DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60-85%
DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60-85% 和 57-78%。离线测试中,接受长度比 Eagle3 高...
Cloudflare免费使用GLM 5.2有每日限制
在Cloudflare Workers AI上配置GLM 5.2免费使用:登录后创建API Token,在Chatbox中设置OpenAI API兼容的自定义API,填入API Key和拼接了Account ID的Host地址,模型名选@cf/zai-org/glm-5.2即可。但实测每日有使用限制,并非真正无限。冲! 🔗...
Anthropic Lamis谈上下文工程实践:从Claude MD到"做梦"机制
在2026年AI DevCon上,Anthropic的Lamis介绍了上下文工程演进路径:从纯Markdown的Claude MD文件起步,到记忆工具(Agent自主读写)、Skills(渐进式披露)、文件系统(Markdown +...
Apple Vision Pro 主管副总裁加入 OpenAI 硬件团队
据 Bloomberg 的 Mark Gurman 报道,负责 Apple Vision Pro 头显的副总裁 Paul Meade 将离开苹果,加入 OpenAI 的硬件团队。Meade 此前还主导了苹果计划于明年推出的 AI 智能眼镜的开发。Vision Pro 因成本高昂未获市场成功,苹果希望更便宜的智能眼镜能与 Meta 的可穿戴设备竞争。Gurman 认为此举与 John...
新许可制度终结实验室模糊新模型发布
所以,这一新的许可制度可能意味着实验室不再发布模糊的新模型预告。 晚安,亲爱的王子,愿天使的歌声伴你安息。 🔗 阅读原文:https://x.com/emollick/status/2070909447015141606
Anthropic 分享 Claude Code 记忆管理方法论:四层架构与"做梦"机制
Anthropic 应用 AI 负责人 Lamis 在 2026 年 AI DevCon 上介绍 Claude Code 记忆管理。起点是 CLAUDE.md 纯文本文件,但会上下文膨胀。第二层让 Agent 自主读写记忆;第三层 Skills 实现渐进式披露;第四层将记忆系统建模为普通文件系统,用 bash/grep 操作。生产环境设版本控制、哈希并发控制、权限分层和干净 API...