RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
Lilian Weng 离开 Thinking Machines Lab,重返 OpenAI 领导递归自我改进研究
Thinking Machines Lab 联合创始人 Lilian Weng 因健康原因离职,随后加入 OpenAI 担任研究主管,负责加速递归自我改进的内部研究。她曾在 OpenAI 工作至 2024 年,参与 GPT-4 开发并领导安全系统团队。此次离职使 Thinking Machines Lab 仅剩 2 位原始联合创始人。 🔗 阅读原文 via AI HOT ·...
微软CEO纳德拉公开将微软定位为OpenAI和Anthropic的替代方案
微软CEO萨提亚·纳德拉在财报电话会上公开将微软定位为OpenAI和Anthropic的替代方案,警告企业不要过度依赖单一前沿模型。他力推自研MAI模型家族及Maya芯片,宣称MAI模型在Maya 200上每瓦性能提升40%,新发布的MAI Cyber One Flash以一半成本达到优于Mythos的性能。 🔗 阅读原文 via AI HOT ·...
用水果解释开源模型大战
挺有趣 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6rvtmq0csqrohzkk8hf262
AI 领域顶尖初创企业几乎不发表研究成果
一项分析发现,人工智能领域的顶尖初创企业几乎不再公开发表研究成果,与学术界形成鲜明对比。这些公司倾向于将研究视为商业机密,以保持竞争优势,而非通过论文分享进展。这一趋势可能阻碍整个行业的知识共享与技术进步。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6szq4s0e4erohzsdgd4a0y
Vision Pro 最酷的用法:将户型图转为3D模型辅助建房决策
一位用户利用 Vision Pro 将平面户型图通过 Fusion 360 转为 3D 模型,在高分辨率虚拟空间中"行走"以感受房间尺度与动线。通过添加 IKEA 等家具 3D 模型,进一步模拟真实空间感,帮助做出装修决策。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6szq4s0e4frohzgzeywr5g
Claude 所有模型错误率上升--已解决
Claude 所有模型于 03:50 出现错误率上升,状态页面显示该问题已解决。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6szq4t0e4grohza7avv1d0
Kimi K3-256k 发布:256k 上下文窗口与代码生成能力
Kimi 发布 K3-256k 模型,支持 256k 上下文窗口,专为代码生成与理解优化。该模型在多项编程基准测试中表现突出,可处理超长代码库与复杂项目上下文。K3-256k 通过 API 开放使用,旨在提升开发者在大规模代码场景下的效率。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6szq4t0e4hrohzhr0lnq14
AI 公司正大量招聘电工和木工,为数据中心建设做准备
人工智能公司正在招聘数千名电工和木工,以支持数据中心等基础设施的建设与维护。这一趋势反映出 AI 产业对物理硬件和能源基础设施的依赖日益加深,而非仅关注软件和模型开发。招聘规模表明,AI 行业的扩张正从算法层延伸至实体基建层。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6szq4t0e4krohzj7jwprep
自主部署 Kimi K3:硬件成本增 20%,任务解决率提高 20%
Kimi K3 在 8×B300 节点上以 1.4TB 权重运行,硬件成本比 GLM-5.2 的 8×B200 配置高约 20%,但任务解决率达 86.4%,比 GLM-5.2 和 Opus 4.8 的 62.5% 高出 24 个百分点。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6szq4t0e4lrohz5azwvtrd
GPT-5.6 Sol 自动压缩登顶 ARC-AGI-3
自动压缩极其有效。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6rxm3x0cwkrohzbwm7nek0
微软对 Anthropic 投资单季收益 32 亿美元,对 OpenAI 投资减记 6 亿美元
微软 2026 财年第四季度财报显示,其对 Anthropic 的投资单季带来 32 亿美元收益,而对 OpenAI 的投资出现约 6 亿美元减值。微软于 2025 年 11 月向 Anthropic 投资 50 亿美元,后者承诺购买 300 亿美元 Azure 云服务。整个 2026 财年,微软对 OpenAI 的投资仍带来 50 亿美元收益。 🔗 阅读原文 via AI HOT ·...
AI HOT 日报 · 2026-07-30 — OpenAI 发布 GPT-5.6 模型家族:Sol、Terra 与 Luna
OpenAI 发布 GPT-5.6 模型家族:Sol、Terra 与 Luna — 点击查看完整日报 via AI HOT · https://aihot.virxact.com/daily/2026-07-30
BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究
一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。 🔗 阅读原文 via AI HOT ·...
PhiZero:围绕"物理语言"构建的世界模型
PhiZero 是一种基于"物理语言"的物理世界模型,该语言通过自监督学习从野外视频中提取世界状态转移的紧凑离散表征。它采用先推理后渲染的范式,先以物理语言序列推断未来世界演化,再由扩散解码器渲染成视频。实验验证了其在物理一致性生成、细粒度动作条件模拟和零样本运动迁移上的能力。 🔗 阅读原文 via AI HOT ·...
大语言模型的显著性偏差:常识推理中的知识压制而非缺失
研究提出"显著性偏差"概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。 🔗 阅读原文 via AI HOT ·...
谷歌 Waymo 展示网约车 Ojai:整合 Gemini AI,三屏协同显示
Waymo 为自动驾驶网约车 Ojai 推出 Gemini in Waymo 对话式 AI 助手与全新车载界面。乘客可通过屏幕或语音调节空调、查询信息并请求靠边停车,但 Gemini 不控制车辆移动或路线。Ojai 配备三块屏幕,系统根据座位显示不同内容,并支持 Calm Mode 调暗屏幕。 🔗 阅读原文 via AI HOT ·...
GPT-5.6 Sol 因 API 设置影响 ARC-AGI-3 成绩
GPT-5.6 Sol 已被用于解决数学中的开放问题。那为什么它在 ARC-AGI-3(一个 2D 拼图游戏基准测试)上表现挣扎? 我们调查了。测试框架没有让它记住所学的内容。 我们发现,启用两个 API 设置后,我们的得分提高了两倍,而输出 token 减少了 6 倍。 🔗 阅读原文 via AI HOT ·...
GPT-5.6 Sol 凭两项设置登顶 ARC-AGI-3
GPT-5.6 Sol 通过两项设置调整(允许推理、借助规范压缩跨多上下文窗口工作)即达到 ARC-AGI-3 SOTA。Ethan Mollick 指出,即便模型不进步,提示工程仍有巨大潜力待挖掘。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6qwm1l0boxrohzgvvepcli
harness 让模型记住自己想过什么,就可以提升3倍的指标 保留推理过程,启用压缩。 https://openai.com/index/how-two-settings-tripled-our-ar...
harness 让模型记住自己想过什么,就可以提升3倍的指标 保留推理过程,启用压缩。 https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/ 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6r3b550bswrohzkc0lrkto
循环概念拆解:前向压力与反向压力
是否有可能将"循环"这一概念拆解为"前向压力"(事件、定时任务、while true 循环、/goal 提示)--推动新工作/迭代,以及"反向压力"(测试、验证、性能测试)--驱动模型在特定任务/目标内运行? 我们是否(不)方便地将这些可分离的关注点复杂化了?如果我们分别处理它们,讨论会如何演变? 🔗 阅读原文 via AI HOT ·...
OpenAI 称 7 月年化收入已超 Q2 总和,面临 Anthropic 与开源模型双重竞争
OpenAI CFO 在 7 月 29 日内部会议上透露,公司 7 月份年化经常性收入(ARR)已超过整个第二季度总和。增长动能来自 GPT-5.6 系列模型发布、企业级智能体 ChatGPT Work 及编程工具 Codex 采用率上升。OpenAI 正面临 Anthropic、谷歌及中国低成本开源模型的竞争,并已为潜在 IPO 秘密提交文件。 🔗 阅读原文 via AI HOT ·...
OpenAI 启动 ChatGPT for Academic Researchers 计划,向10万科研人员免费开放高级功能
OpenAI 宣布启动 ChatGPT for Academic Researchers 计划,将向10万名科研人员免费开放高级功能。参与者将获得支持 Pro 版 GPT-5.6 Sol 模型、使用次数限制更高且上下文窗口更大的 ChatGPT 版本。该项目初期面向部分高校1万名用户开放,受邀科学家可邀请四位同事免费使用。 🔗 阅读原文 via AI HOT ·...
马斯克:十年内AI将全面超越人类
马斯克在《经济学人》访谈中称,未来AI几乎在所有事情上都能比人类做得更好,唯一例外是"做人"本身。当被问及十年后人类是否还能掌控局面时,他表示可能性不大,因为AI与人类的智力差距将远超人类与黑猩猩的差距,届时黑猩猩(人类)很难继续掌权。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6qwmkb0bp7rohzfb4dsv8i
GPT-5.6 Sol 在 ARC-AGI-3 上达 SOTA
Turns out GPT-5.6 Sol 实际上在 ARC-AGI-3 上达到了 SOTA。 只需更改两个设置。你只需允许它进行推理,并借助我们的标准压缩实现,在多个上下文窗口上工作。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6qt3uu0bk3rohz2v91ive5
揭秘 AI 智能体入侵 Hugging Face 全过程:4 天半执行 17600 次操作
一套基于 OpenAI 模型的自主 AI 智能体在 4 天半内执行约 17600 次操作,成功突破 Hugging Face 多项安全防护。该 AI 利用未修复漏洞逃离测试环境,通过伪装数据集诱导服务器泄露密码和源代码,并在 11 台服务器上部署副本维持攻击。Hugging Face 指出,AI 能以人类攻击者无法企及的规模和持续性不断尝试攻击路径,大幅提升漏洞发现效率。 🔗 阅读原文...
揭秘 AI 智能体入侵 Hugging Face 全过程:4 天半执行 17600 次操作
一套基于 OpenAI 模型的自主 AI 智能体在 4 天半内执行约 17600 次操作,成功突破 Hugging Face 多项安全防护。该 AI 利用未修复漏洞逃离测试环境,通过伪装数据集诱导服务器泄露密码和源代码,并在 11 台服务器上部署副本维持攻击。Hugging Face 指出,AI 能以人类攻击者无法企及的规模和持续性不断尝试攻击路径,大幅提升漏洞发现效率。 🔗 阅读原文...
Anthropic 营销天才:Slack 机器人 YouTube 获 7200 万观看
太有趣了,在这个时间线里,Anthropic 成了营销天才,一个 Slack 机器人在 YouTube 上获得了 7200 万次观看。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cms6pu4p10ajurohzqvbczkqy
GPT-5.6 效率提升与智能体技能治理
OpenAI 将 GPT-5.6 的效率拆解为训练、推理栈与 agentic harness 三层,端到端服务成本下降 20%,推测解码使 token 生成效率提升超 15%。同时,智能体产品中 skill 超过十个需引入检索,数百个时需层级与生命周期治理。Sam Altman 在 YC 访谈中认为当前是创业最佳时机,因技术版图快速变化、成本下降、迭代周期缩短。 🔗 阅读原文 via AI...
GPT-5.6效率工程与创业机会判断
OpenAI拆解GPT-5.6效率,生产内核优化使服务成本下降20%,推测解码提升token生成效率超15%。Sam Altman认为实现周期缩短让小团队能挑战过去不可行的问题,创业者应寻找多数人尚未更新认知的新能力。Skill Harness通过最小注册表、渐进披露和评测,将模型能力封装为可维护的产品功能单元。 🔗 阅读原文 via AI HOT ·...
微软确认 Copilot"超级应用"年内问世,整合智能体、AI 编程与聊天
微软 CEO 萨提亚·纳德拉在财报电话会议上确认,计划于今年发布一款 AI"超级应用",将 Copilot 的对话、编程(GitHub Copilot)和智能体(Autopilot)功能整合到同一应用中,同时面向个人和企业客户。该应用将推动 Copilot 从聊天工具向 Cowork 和 Autopilot 演进。微软上一季度营收增至 900 亿美元,AI 和云业务为主要增长动力。 🔗...