RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
组织:已统治地球的超级智能体
我们已经拥有了统治地球的超级智能体:我们称之为组织。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2hldfa011yro3f7bha5tlp
脑电波能否成为物理AI的下一个突破口?
Encord正与Zander Labs合作,通过头戴设备测量操作员脑电波来推断其心理状态,为机器人模型生成更优质的训练数据。Encord机器人学习主管指出,物理AI的核心瓶颈是真实世界训练数据的极度稀缺。目前该试验旨在构建初始脑波标记数据集,评估其对模型性能的提升效果。 🔗 阅读原文 via AI HOT ·...
OpenAI 专注高效状态引关注
氛围很好。从未见过 OpenAI 如此专注且高效。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2hi7sm00xhro3fspdtass9
英伟达与韩国 Naver 达成 10 亿美元投资,扩容 NVIDIA DSX AI 工厂至 200 兆瓦
英伟达与韩国互联网巨头 Naver 达成 10 亿美元投资协议,将 NVIDIA DSX AI 工厂扩容至 200 兆瓦。工厂将采用 Vera Rubin、Blackwell 等最新平台,为韩国和美国 AI 企业提供算力,用于开发大模型、智能体和 AI 服务。Naver 计划进一步扩展至 1 吉瓦,并于今年下半年推出基于英伟达 Agent Toolkit 的 AI Agent 平台。 🔗...
浪费20亿Token后,我开源了帮Agent定义目标的Leader.skill
作者开源了Leader.skill,用于将模糊的人类需求转化为Agent可独立执行数小时的目标任务书。该Skill基于"目标七问"方法论,涵盖目的、完成态、反作弊、边界等维度,并推荐用Claude Fable 5或Kimi K3规划目标,再交由GPT-5.6 Sol或GLM-5.2等模型长程执行。项目已开源。 🔗 阅读原文 via AI HOT ·...
浪费20亿Token后,我开源了帮Agent定义目标的Leader.skill
作者开源了Leader.skill,用于将模糊的人类需求转化为Agent可独立执行数小时的目标任务书。该Skill基于"目标七问"方法论,涵盖目的、完成态、反作弊、边界等维度,并推荐用Claude Fable 5或Kimi K3规划目标,再交由GPT-5.6 Sol或GLM-5.2等模型长程执行。项目已开源。 🔗 阅读原文 via AI HOT ·...
AI HOT 日报 · 2026-07-27 — xAI 发布 Grok CLI 并支持 /tutorial 命令
xAI 发布 Grok CLI 并支持 /tutorial 命令 — 点击查看完整日报 via AI HOT · https://aihot.virxact.com/daily/2026-07-27
JAXBench发布:TPU内核优化迎来专属基准
谷歌、哈佛与UC Berkeley联合推出JAXBench,包含50个基于Llama-3.1、DeepSeek-V3等真实架构的JAX工作负载。使用Gemini 3 Flash并配合TPU文档后,单样本正确率从5.8%提升至37.3%,解决48/50个基准任务,几何平均加速1.28倍;束搜索进一步将加速比推至1.36倍。研究指出,正确性是文档问题,速度是搜索问题。 🔗 阅读原文 via...
InMind 基准揭示智能体记忆系统的隐式关联盲点
研究团队发布 InMind 基准,包含 125 个专家验证任务,测试智能体记忆系统处理隐式关联的能力。当关键记忆直接放入上下文时,骨干模型能回答 84.0% 的间接查询;但通过六种记忆系统检索时,命中率最高仅 14.4%,尽管这些系统直接召回准确率可达 100%。失败根源在于查询驱动的检索接口本身,将"路由--决定哪些事实必须保持可见"确立为核心开放问题。 🔗 阅读原文 via AI...
四位菲尔兹奖得主三人拒绝转向AI研究
2026年菲尔兹奖四位得主中,三人宣布不会转向AI研究,尽管他们认为自己的工作很快将被AGI自动化。SemiAnalysis引用Dijkstra言论评论称,编程是应用数学中最难的领域之一,较弱的数学家最好保持纯数学。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2gjch500tgro3frsq5pp3x
BestBlogs早报:NVIDIA心法、Anthropic产品方法等
BestBlogs 早报精选 10 篇 AI 内容,涵盖黄仁勋分享 NVIDIA 转型方法论、LLM-as-a-Judge 实战指南、Anthropic 产品负责人复盘 Claude Code 与模型发布。其他要点包括 Nanbeige4.2-3B 小模型、腾讯开源具身基座模型、Meta 开源脑机接口 Brain2Qwerty v2 等。 🔗 阅读原文 via AI HOT ·...
Anthropic 产品方法论:用 Eval 连接研究与用户反馈
Anthropic 产品负责人 Diane Penn 分享了前沿模型产品化的核心方法:将用户笼统抱怨(如"Claude 出现幻觉")拆解为研究可行动的问题,并用 eval 作为研究与产品间的共同接口。Golden Gate Claude 案例展示了如何将可解释性研究成果在 24 小时内转化为公开体验。她强调直接使用模型获取触感、让 eval 成为跨团队共享的产品语言,而非依赖静态路线图。...
陶哲轩:《人工智能时代的数学》【pdf】
数学家陶哲轩在《人工智能时代的数学》中探讨了AI对数学研究的影响。他指出,大语言模型(LLM)等AI工具已能辅助证明验证、猜想生成和教学,但当前模型在严谨推理和发现全新数学结构上仍有局限。文章分析了AI作为"协作伙伴"而非替代者的角色,并展望了未来数学实践的可能演变。 🔗 阅读原文 via AI HOT ·...
Kimi k3 开源权重兑现承诺
他们兑现了承诺。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2gh9sj00r5ro3faujyl4zi
月之暗面 Kimi K3 庆功照流出,现场标语"冲上月球"
月之暗面据传为 Kimi K3 大模型举办庆功活动,现场标语显示"K3 扩容升级!""K4 给我狠狠干到极致!""冲上月球!",联合创始人张予彤疑似到场。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2gb17m00laro3f6e04p6sy
Sam Altman:ChatGPT Voice 将催生新型计算机
Sam Altman 回应称 ChatGPT Voice 功能"感觉很重要,我想要一种新型计算机"。引用推文作者 @AlexFinn 分享体验:通过 AirPods 在 4 小时徒步中完成的工作量超过在桌前 8 小时,核心在于 Voice 能控制电脑,让用户在任何地点通过语音完成工作。他建议将一台常开桌面设备设为"总部",其他设备作为节点远程控制,认为工作方式将因此彻底改变。 🔗 阅读原文...
Anthropic Claude Code主管谈token成本优化策略
Anthropic Claude Code负责人Boris Cherny建议,不要过度关注削减token成本,而应优先使用最昂贵的模型并专注于提升回报。他认为成本削减机会约50%,但回报提升潜力可达1000%、10000%甚至100000%。核心策略是自问"如何增加回报",而非主要聚焦于成本控制。 🔗 阅读原文 via AI HOT ·...
Opus 5 基准测试全面超越 Fable 5,但实际体验远不及后者,公开基准几乎失效
Opus 5 在多项通用基准测试上超越 Fable 5,但实际使用体验远不及后者,表明现有公开基准几乎完全失效。Anthropic 在 5 系列中采用先训练 Mythos 再蒸馏出 Sonnet 和 Opus 的新路线,但 Sonnet 5 表现不佳、Opus 5 评价两极。 🔗 阅读原文 via AI HOT ·...
把细节推给别人并不能让人感到有能力--AI 无法替代对细节的专注
作者认为,AI 无法让人绕过细节来获得能力。要做出新颖或优秀的工作,必须深入、细致地理解事物本身,而依赖 LLM 等技术来回避细节只会适得其反。真正的能力来自对细节的极度关注,而非将细节推给 AI。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2d9dac007eroyzeckqijfw
AI 时代的"超能力":专注与坚持到底
一位连续创业者发现,用 Claude 将任务效率提升 2-100 倍后,反而因同时启动 40 多个概念验证项目而陷入倦怠。AI 并未减少工作量,而是催生了大量"为忙而忙"的琐事。作者提出,在 AI 时代更应践行"少而精"原则,将精力垂直投入少数重要项目并坚持到底,而非水平扩张任务数量。 🔗 阅读原文 via AI HOT ·...
开源AI压力下Anthropic面临抉择
美国科技界除Anthropic外已一致支持开源AI。Anthropic面临日益强烈的反对压力,其是否放弃反开源立场或继续抵制尚待观察。批评者警告Anthropic正以"限制使用"等说辞掩盖实质打压开源,呼吁行业警惕。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2c6w1601kuro25rblw1vjs
Grok 4.5 被赞为可靠主力模型
Grok 4.5 是一款可靠的主力模型。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms2b6uky01d5ro25kw5krqhw
奥特曼称将造出实现愿望的精灵
你的愿望会是什么? 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms29yc1100wkro25kuhitmy3
Charlie Holtz 预告转向云端智能体
剧透警告 【引用 @charlieholtz】:嘿!是的,我也对此非常兴奋。剧透警告:未来几周我们将把重心完全转向云端智能体。我们还在构建移动应用、Slack 集成和 API,以便你(或你的智能体)可以从任何地方启动工作空间。 > 理想情况下,我应该能在同一个工作树上切换本地与云端。 能详细说说吗?我们的赌注是,一旦我们把云端的人体工学做好,本地就不再重要了。 🔗 阅读原文 via AI...
揭秘支撑代币转售与欺诈的接力市场:折扣高达97.8%的中转站生态
一个由卡商、账号池、中转站和终端用户构成的四层接力市场,正以低至官方价格0.13美元/1美元的成本转售OpenAI、Anthropic等模型token。其中Top 1中转站"Now Coding"提供97.8%折扣,425元人民币即可获得价值3333美元的Anthropic额度。 🔗 阅读原文 via AI HOT ·...
Opus 5与Codex语音模式更新指南
我周四写的AI模型使用指南已经需要更新,以纳入Opus 5和Codex的语音模式,这两项功能都很重要,并于周五发布。即使你密切关注这些动态,跟上节奏也颇具挑战。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms28zc0p00qgro25s08u6tu9
Odyssey 宣布延长停留时间
再待一会儿。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms28z2ev00ouro25gx1qcr9x
NVIDIA 研究:AdamW 存在规模天花板,SOAP/Muon 更优
NVIDIA 新研究指出,在高达 1 亿 token 的批大小下,AdamW 优化器训练稳定性下降,而 SOAP 和 Muon 能保持稳定。团队通过每步 QR 正交化消除了 SOAP 在大批大小下的损失尖峰,并在数万亿 token 训练的多十亿参数模型上验证了两种优化器持续优于 AdamW。他们还提出了与 Megatron-LM...
中国AI模型Kimi引发美国新一轮恐慌:开放与封闭之争再起
月之暗面(Moonshot AI)的Kimi模型发布后,硅谷和华盛顿再次围绕中国AI竞争力与开放模型安全性展开激烈辩论。OpenAI和Anthropic据报已游说监管机构表达对开源中国模型的担忧。TechCrunch播客指出,此类恐慌已多次重演,背后涉及保护主义与"谁将赢得AI竞赛"的核心问题,而全面封禁中国开放权重模型可能主要利好OpenAI等美国前沿实验室。 🔗 阅读原文 via AI...
Meta AI 应用新增定时任务与移动端 Artefacts
Meta AI 应用已升级,新增定时任务和移动端 Artefacts! > 用 Meta AI 做更多事--设置每日简报、获取日历帮助、创建交互式 Artefacts。 Meta 正在扩张 👀 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms281pwt00jvro25wf5b5yr5