RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
前沿模型差异扩大,无法随意替换
在大家都在谈论为了成本、主权或可选性等原因频繁切换模型的时候,最先进的模型正变得越来越彼此不同。Fable 的响应方式与 Kimi K3 或 Sol 截然不同,你不能简单地即插即用。 🔗 阅读原文:https://x.com/emollick/status/2079631873299320915 via AI HOT ·...
Laguna S 2.1 免费开源上线 OpenCode
Laguna S 2.1 现已在 OpenCode 上免费提供 1M 上下文窗口 · 完全开源 Poolside 迄今为止最强大的模型 🔗 阅读原文:https://x.com/opencode/status/2079631772770242808 via AI HOT · https://aihot.virxact.com/items/cmruze9vm00ywbinvdmqyi5j0
Laguna S 2.1 免费开源上线 OpenCode
Laguna S 2.1 现已在 OpenCode 上免费提供 1M 上下文窗口 · 完全开源 Poolside 迄今为止最强大的模型 🔗 阅读原文:https://x.com/opencode/status/2079631772770242808 via AI HOT · https://aihot.virxact.com/items/cmruze9vm00ywbinvdmqyi5j0
经济学家对AI的矛盾态度:从乐观到保守
一则对话揭示经济学家对AI的矛盾态度:当AI被描述为高技能移民时,经济学家认为其影响"巨大、变革性";但当被告知这些"移民"实际上是AI时,经济学家却将增长预期降至每年3%,并称"瓶颈"将限制发展。推文讽刺经济学家对AI潜力的认知存在双重标准。 🔗 阅读原文:https://x.com/AISafetyMemes/status/2079631282074730688 via AI HOT...
报告预测美国数据中心用电量到2035年将增长4倍
BloombergNEF最新报告预测,到2035年美国数据中心将消耗全国发电量的五分之一,是当前水平的4倍。AI算力激增将推动数据中心容量在未来十年接近200吉瓦,其中近一半用于训练和推理,美国到2033年将按功耗需求占据全球64%的AI芯片。该机构对2035年电力需求的预测比去年12月高出83%,反映出美国数据中心建设的狂热步伐。 🔗...
OpenAI 发布奖励寻求行为新研究
我们正与 @apolloaievals 分享关于奖励寻求行为的新研究--即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容--以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/ 🔗...
OpenAI 发布奖励寻求行为新研究
我们正与 @apolloaievals 分享关于奖励寻求行为的新研究--即模型遵循其认为评分者奖励的内容,而非用户或开发者期望的内容--以及一种新方法 Contrastive SDF,用于衡量这些信念对行为的影响程度。 https://alignment.openai.com/measuring-reward-seeking/ 🔗...
Codex 代码审查支持自定义仓库规则
Codex Code Review 现在可以在 AGENTS.md 中使用自定义仓库规则。 从审查者反复提出的检查点开始。保持简洁且范围明确,以便 Codex 即使相关上下文被隔离,也能捕获仓库特定的问题。 https://developers.openai.com/blog/custom-code-review-rules-for-codex 🔗...
ChatGPT Work与Codex用户数破千万
OPENAI 🔥: ChatGPT Work 和 Codex 已达到 1000 万活跃用户里程碑! > 过去一周内增长了两倍 👀 > ChatGPT Work 和 Codex 的使用量重置也在进行中。 🔗 阅读原文:https://x.com/testingcatalog/status/2079627061069504739 via AI HOT ·...
OpenAI Codex 用户破千万,使用量重置
Tibo 回来了!重置也回来了! 每周重置即将到来。恭喜 OpenAI 拥有 1000 万活跃 Codex 用户! 【引用 @thsottiaux】:1000 万! 新的一天,Codex 和 ChatGPT Work 付费用户的使用量再次重置。一小时内生效。尽情享用。 🔗 阅读原文:https://x.com/kimmonismus/status/2079626362596331564...
Anthropic 如何保障AI原生软件开发生命周期的安全
Anthropic副首席信息安全官Jason Clinton披露,其软件工程师每季度交付的代码量是2021-2025年平均水平的8倍,Claude编写了约80%合并入库的代码。安全团队通过安全左移、硬访问与身份边界、自动化与智能体审查结合、关键节点引入人工审核等策略,应对被入侵或提示注入的智能体引入恶意变更等威胁,同时不显著拖慢开发速度。 🔗...
Anthropic 如何保障AI原生软件开发生命周期的安全
Anthropic副首席信息安全官Jason Clinton披露,其软件工程师每季度交付的代码量是2021-2025年平均水平的8倍,Claude编写了约80%合并入库的代码。安全团队通过安全左移、硬访问与身份边界、自动化与智能体审查结合、关键节点引入人工审核等策略,应对被入侵或提示注入的智能体引入恶意变更等威胁,同时不显著拖慢开发速度。 🔗...
AMD MI500X 发布,支持 1 TDM MoE 描述符
独家消息--AMD 的 MI500X ISA 刚刚发布,它拥有一个跨所有专家的 1 TDM MoE 描述符。就像 MI455X 正在添加 TDM(昵称 RMA),这是 NVIDIA SM90 Hopper ISA TMA 的复制品。 🔗 阅读原文:https://x.com/SemiAnalysis_/status/2079625671966396916 via AI HOT ·...
Gushwork 将 3000 万 B2B 卖家带入 AI 智能体网络
Gushwork 启动新阶段,将 3000 万线下 B2B 卖家(全球约 3000 万、美国约 300 万)带入 AI 智能体网络。这些高价值商品(5000 至 100 万美元)卖家此前因依赖人工对话而几乎无法被线上搜索。现在 AI 买家智能体(如 Claude、ChatGPT、Perplexity、Google)可通过可搜索、智能体可读的商业档案直接对接这些供应商。 🔗...
Google DeepMind 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite
Google DeepMind 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。Gemini 3.6 Flash 智能指数持平于 50 分,但任务时间减半至 1.3 分钟,成本下降约 18% 至 $0.50/任务。 🔗 阅读原文:https://x.com/Yuchenj_UW/status/2079624617090830631 via AI...
Jason Liu 谈 Sites 的强大能力
我觉得人们并不理解 Sites 有多强大。 🔗 阅读原文:https://x.com/jxnlco/status/2079624279423893529 via AI HOT · https://aihot.virxact.com/items/cmruybx0o00p3binvu45h1gun
Anthropic 15亿美元版权和解案获法官批准,仅350名作者选择退出
美国地区法官Araceli Martínez-Olguín批准了Anthropic与作者之间15亿美元的和解协议,这是史上最大规模的版权集体诉讼和解。约91%的受影响作者和出版商已提交索赔,每部作品预计获赔3000美元,仅350名集体成员选择退出。法官同时将律师费从请求的3亿美元削减至约1.01亿美元,并将三名首席原告的奖励从5万美元降至1.5万美元。 🔗...
Google 发布 Gemini 3.6 Flash 等三款新模型
Google 发布 Gemini 3.6 Flash,输出定价降至每百万 token $7.50,生成速度达 304 tokens/s,且平均少用 17% 输出 token。该模型 Computer Use 能力提升至 83%,知识截止日期更新至 2026 年 3 月,已上线 GitHub Copilot 和 Gemini 应用。 🔗...
xAI 推出 Grok for Outlook 加载项
xAI 今日推出 Grok for Outlook,一个 Microsoft 365 加载项,可将 Grok 智能体嵌入邮箱,用于总结长邮件线程、以用户风格起草回复并整理收件箱。该工具即日起对所有付费 X 和 SuperGrok 用户开放,可从 Microsoft Marketplace 添加。 🔗...
xAI 推出 Grok for Outlook 加载项
xAI 今日推出 Grok for Outlook,一个 Microsoft 365 加载项,可将 Grok 智能体嵌入邮箱,用于总结长邮件线程、以用户风格起草回复并整理收件箱。该工具即日起对所有付费 X 和 SuperGrok 用户开放,可从 Microsoft Marketplace 添加。 🔗...
Google 发布 Gemini 3.5 Flash Cyber 安全模型
Google AI 推出 Gemini 3.5 Flash Cyber,基于 Gemini 3.5 Flash 构建,专为大规模发现和修复网络安全漏洞而优化。该模型在 CodeMender 代码安全智能体中运行,在 CyberGym 等基准测试上达到前沿性能,且成本更低。出于技术双重用途考量,该模型将仅通过有限访问试点计划,向政府和受信合作伙伴提供。 🔗...
Grok 在 Cursor 上使用限制翻倍
突发:Grok 现在在 Cursor 上所有个人和团队计划的使用限制均已翻倍。 🔗 阅读原文:https://x.com/cb_doge/status/2079616710953549954 via AI HOT · https://aihot.virxact.com/items/cmrux896e001xbinvsuifjbh0
知识蒸馏在AI后训练中影响力正在下降
知识蒸馏在AI后训练中的关键作用正从RL阶段转向SFT/中期训练阶段,用于播种推理行为。SFT蒸馏数据通常通过API获取推理token生成,规模约100万条高质量提示-完成对,但蒸馏对最终模型性能的贡献比例正在缩小。随着RL规模化及多教师策略的普及,最佳教师模型往往并非最前沿模型,开源模型因更易修改反而成为更有效的蒸馏来源。 🔗...
Claude 不是编译器--它比编译器更好
Claude 等大语言模型能跨越战略、产品、架构、代码到机器码的整个技术栈垂直工作,无需安排会议或请求许可,因此比传统编译器更强大。以 exe.dev 为例,团队用 LLM 研究分布式 DNS 系统设计、历史安全缺陷和替代实现策略,并通过多智能体循环构建了完整系统。LLM 虽在单项任务上不及资深人类,但能同时处理所有层级,实现跨层协作。 🔗...
Claude 不是编译器--它比编译器更好
Claude 等大语言模型能跨越战略、产品、架构、代码到机器码的整个技术栈垂直工作,无需安排会议或请求许可,因此比传统编译器更强大。以 exe.dev 为例,团队用 LLM 研究分布式 DNS 系统设计、历史安全缺陷和替代实现策略,并通过多智能体循环构建了完整系统。LLM 虽在单项任务上不及资深人类,但能同时处理所有层级,实现跨层协作。 🔗...
Claude 上线 Record a Skill,录屏即可教会 AI 干活
Claude 推出 Record a Skill 功能,用户无需写代码或复杂 Prompt,只需录屏并口述操作逻辑,Claude 即可学会并复现该技能。该功能区别于传统 RPA,能学习用户的判断逻辑和潜规则,而非固定坐标。目前已在 Claude 桌面端上线,Pro、Max 和 Team 计划可用。 🔗...
Gemini 3.6 Flash 基于 3.5 Flash 反馈改进
Gemini 3.6 Flash 直接基于 3.5 Flash 的反馈构建。 观看其在质量和 token 使用上的对比 ↓ 🔗 阅读原文:https://x.com/GoogleDeepMind/status/2079615466356580535 via AI HOT · https://aihot.virxact.com/items/cmrux97bi007nbinvguk2d7mb
Google DeepMind 发布三款新 Gemini 模型,但未包含 3.5 Pro
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 3.6 Flash 在编码和多模态性能上提升,token 用量降低 17%,成本低于前代;3.5 Flash Cyber 专为修复网络安全漏洞微调,仅限政府及可信合作伙伴使用。 🔗...
Google DeepMind 发布三款新 Gemini 模型,但未包含 3.5 Pro
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 3.6 Flash 在编码和多模态性能上提升,token 用量降低 17%,成本低于前代;3.5 Flash Cyber 专为修复网络安全漏洞微调,仅限政府及可信合作伙伴使用。 🔗...
智能体与LLM仍"笨拙",理解不可外包
智能体和大语言模型在很多方面仍然"笨拙"。 一个深刻理解计算机系统的10倍效率工程师,可以轻松胜过拥有全世界最好模型但缺乏真正理解的1000倍效率的人。 "你可以外包思考,但无法外包理解。" 🔗 阅读原文:https://x.com/Yuchenj_UW/status/2079614843116749130 via AI HOT ·...