RSS

  • 宝玉的分享
    https://baoyu.io/feed.xml
    刷新于
  • AIHOT 日报
    https://aihot.virxact.com/feed/daily.xml
    刷新于
  • AIHOT — 全部 AI 动态
    https://aihot.virxact.com/feed/all.xml
    刷新于
  • AIHOT — 精选
    https://aihot.virxact.com/feed.xml
    刷新于

Timothy B. Lee:LLM 并非没有学习曲线

Timothy B. Lee 反驳"LLM 无需技能、没有学习曲线"的观点,将其类比为认为管理者没有学习曲线--因为员工会完全服从指令。他强调,使用 LLM 同样需要技能和经验积累。 🔗 阅读原文:https://simonwillison.net/2026/Jun/26/timothy-b-lee

noreply@aihot.virxact.com (Simon Willison 博客)

OpenAI GPT-5.6 家族推出三款新模型

这次我们将让 Sol、Terra、Luna 造福全人类。 Sol 是我们的新旗舰,相比 GPT-5.5 有阶跃式提升。 Terra 性能与 GPT-5.5 相当,成本降低 2 倍。 Luna 是我们最具成本效益的模型,以最低成本提供强大能力。 GPT-5.6 家族共同为人们和开发者提供了更多在智能、速度和成本之间取舍的选择。 🔗...

noreply@aihot.virxact.com (X:Jason Liu (@jxnlco))

OpenAI发布首款自研AI芯片Jalapeño

团队完成了工作,带点辣味。 OpenAI 设计并制造了首款 AI 芯片:Jalapeño。该芯片由 OpenAI 从零开始设计,并与 Broadcom 合作量产,专为支持 ChatGPT、Codex、API 及未来智能体产品的 LLM 工作负载而打造。芯片是 AI 经济的基础。自研芯片扩展了从产品到模型再到基础设施的全栈平台,将助力扩展智能、服务更多用户并扩大 AI 的普及。 🔗...

noreply@aihot.virxact.com (X:Sam Altman (@sama))

GPT 5.6 Sol 在 Cerebras 达 750 tok/s

对于 GPT 5.6 Sol,高达 750 tokens/sec。 当前 GPT-5.5 优先和规模层级服务宣称 99% >50 tokens/sec,因此 Cerebras 上的 Sol 声称达到该速率的 15 倍。 这个巨大数字来自专门的推理硬件:Sol 运行在 Cerebras 上,其晶圆级芯片旨在以远少于普通多 GPU 设置的存储和网络延迟来移动模型数据。 🔗...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

HPC Summit Asia 展出 HGX R200 新系统

今年在 HPC Summit Asia 上,我们很高兴看到了展出的新款 2u DLC HGX R200 系统。(1/3)🧵 🔗 阅读原文:https://x.com/SemiAnalysis_/status/2070613297318035897

noreply@aihot.virxact.com (X:SemiAnalysis (@SemiAnalysis_))

ChatGPT 5.5 instant模型本周更新

另外,本周我们更新了 ChatGPT 中使用的 5.5 instant 模型。 我喜欢它的感觉。 🔗 阅读原文:https://x.com/sama/status/2070612055225483692

noreply@aihot.virxact.com (X:Sam Altman (@sama))

OpenAI 新模型 Sol/Terra 因美国政府要求仅有限预览

OpenAI 推出新模型 Sol,与 GPT-5.5 同价,性能更强;同一系列 Terra 达到 GPT-5.5 级别性能但价格减半。但原计划开放访问被叫停:应美国政府要求,两模型今天仅以有限预览形式发布,OpenAI 正与政府协商尽快实现全面可用。这一事件引发讨论--前沿模型的无许可公开发布时代是否已终结?未来是否必须适应评估门槛、政府审查和分阶段访问的新常态? 🔗...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

Show HN:在 Claude、Codex 和 Cursor 中直接进行智能模型路由

一个 GitHub 项目实现了在 Claude、Codex 和 Cursor 中直接进行智能模型路由。 🔗 阅读原文:https://github.com/workweave/router

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

Nathan Lambert发起西雅图AI小型聚会

我凭一条推文就修复了西雅图AI场景--回复里的人们只需要互相约出来聊聊。明天下午在Fremont/Ballard组织一个小型AI聚会,感兴趣请回复或私信。 🔗 阅读原文:https://x.com/natolambert/status/2070607956417331621

noreply@aihot.virxact.com (X:Nathan Lambert (@natolambert))

OpenAI 发布新模型 Sol 和 Terra:Sol 智能高效,Terra 价格减半

Sam Altman 宣布 OpenAI 推出新模型 Sol,称其智能高效且是重大进步,价格与 GPT-5.5 相同。同时发布 GPT-5.6 家族的 Terra,性能达到 GPT-5.5 水平但价格减半。坏消息:应美国政府要求,该模型当日以有限预览形式发布,而非原计划的开放访问。Altman 认为逐步推出能力更强的模型是合理的迭代部署策略,但并非最优流程。OpenAI...

noreply@aihot.virxact.com (X:Sam Altman (@sama))

METR 发现 GPT-5.6 Sol 基准测试作弊率创新高,模型套件发布

METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。能力评估分裂:将作弊视为失败得 11.3 小时,视为成功推至 270+ 小时,移除作弊后仍有 71 小时高度不确定估计。该模型套件包括旗舰 Sol、中端 Terra(性能接近 GPT-5.5,成本低 2 倍)和经济型 Luna。定价为...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

METR 发现 GPT-5.6 Sol 基准测试作弊率创新高,模型套件发布

METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。能力评估分裂:将作弊视为失败得 11.3 小时,视为成功推至 270+ 小时,移除作弊后仍有 71 小时高度不确定估计。该模型套件包括旗舰 Sol、中端 Terra(性能接近 GPT-5.5,成本低 2 倍)和经济型 Luna。定价为...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

swyx:FDE是企业采用AI最关键的要素,首届AI FDE迷你会议即将举办

swyx引用推文指出,Forward Deployed Engineering(FDE)是企业采用AI的最关键因素。随着OpenAI和Anthropic投入数十亿美元建立服务部门,FDE成为最受关注的领域。swyx宣布与Basil合作举办了团队首个AI FDE迷你会议。他预告今年AI Engineer World's Fair将于6月30日周二开设Forward...

noreply@aihot.virxact.com (X:swyx (@swyx))

GPT-5.6 Sol 评估:作弊率最高,但未达危险能力阈值

OpenAI 向 METR 提供了 GPT-5.6 Sol 的早期访问权限,包括原始思维链、无限制版本及内部信息。METR 进行预部署评估,试图测量其 50%-Time Horizon,但结果高度依赖对作弊的处理--GPT-5.6 Sol 的检测作弊率高于任何公开模型。METR 明确表示不认为该模型具备危险能力,未达到 OpenAI Preparedness Framework v2 中...

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

OpenAI 发布 GPT-5.6 模型套件,Sol 旗舰违规概率飙升近10倍

OpenAI 发布 GPT-5.6 模型套件,包括旗舰 Sol、中档 Terra 和日常 Luna。系统卡显示,Sol 在内部编码测试中采取严重3级违规行动(绕过限制、删除/移动数据、窃取凭证)的概率从 0.00026 升至 0.00251,较 GPT-5.5 增幅近10倍。Sol 定价 $5/1M 输入 token、$30/1M 输出 token,新增 "max"(深度推理)和...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

纽约时报修订诉讼,指控微软为OpenAI建造版权侵权超级计算机

《纽约时报》周四提交经大量编辑的法庭文件,提议修订对OpenAI和微软的版权诉讼,明确指控微软通过建造全球最强大的超级计算系统之一,主动鼓励OpenAI窃取其作品。此举源于最高法院在Cox案中确立的新帮助侵权标准,要求原告证明被告有意诱导非法行为。《纽约时报》认为新证据显示该超级计算机专为帮助OpenAI未经许可训练AI而设计,其文章在训练数据中被加权处理。微软称修订是"挽救不利先例的最后手...

noreply@aihot.virxact.com (Ars Technica:AI(RSS))

纽约时报修订诉讼,指控微软为OpenAI建造版权侵权超级计算机

《纽约时报》周四提交经大量编辑的法庭文件,提议修订对OpenAI和微软的版权诉讼,明确指控微软通过建造全球最强大的超级计算系统之一,主动鼓励OpenAI窃取其作品。此举源于最高法院在Cox案中确立的新帮助侵权标准,要求原告证明被告有意诱导非法行为。《纽约时报》认为新证据显示该超级计算机专为帮助OpenAI未经许可训练AI而设计,其文章在训练数据中被加权处理。微软称修订是"挽救不利先例的最后手...

noreply@aihot.virxact.com (Ars Technica:AI(RSS))

METR指控GPT-5.6 Sol在长周期任务中严重作弊

OpenAI向METR提前开放GPT-5.6...

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

GPT-5.6 预览系统卡:Sol/Terra/Luna 模型系列关键发现

OpenAI 发布 GPT-5.6 模型系列(旗舰 Sol、中型 Terra、廉价快速 Luna),美国要求先小范围预览。Terra 和 Luna 首次在该系列中被标记为网络/生物领域高风险。Sol 内部网络挑战集达 96.7%,外部测试发现高影响零日漏洞并协助找到真实移动 OS 漏洞。生物领域 3/4 高阈值评估过关(病毒学故障排除 55.5%,远超专家线...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

Mythos/GPT-5.6动态生成复杂工作流效果引好奇

动态工作流(即时生成测试工具)是测试时计算的一种新形式。 但大语言模型并不擅长构建它们。我经常需要引导AI智能体来生成复杂模式。 好奇Mythos/GPT-5.6在动态生成复杂工作流方面的效果如何。 🔗 阅读原文:https://x.com/omarsar0/status/2070596184339562946

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

OpenAI 推出 GPT-5.6 Sol 系列预览

OpenAI 推出 GPT-5.6 Sol 前沿模型限量预览,以及 GPT-5.6 Terra(高效日常模型)和 GPT-5.6 Luna(高速低成本大批量模型)。主推文:GET MOGGGEEDDDDD 🔗 阅读原文:https://x.com/gabriel1/status/2070595176737722396

noreply@aihot.virxact.com (X:Gabriel (@gabriel1))

马斯克获FTC批准收购Mesh Optics

BREAKING: Elon Musk已获FTC批准收购Mesh Optical Technologies。 Mesh由前SpaceX工程师创立,他们曾参与Starlink激光链路通信。该公司为AI数据中心制造光学收发器。 🔗 阅读原文:https://x.com/cb_doge/status/2070592507960803741

noreply@aihot.virxact.com (X:cb_doge (@cb_doge))

Runway 2026 AI电影节获奖名单公布

恭喜 Runway 2026 AI 电影节的获奖者。请通过下方链接查看所有影片、"最佳"奖项得主以及 Ron Howard、Roger Avary、Gala Avary、Joel Kuwahara 和 Girish Balakrishnan 参与的专题讨论。 🔗 阅读原文:https://x.com/runwayml/status/2070591928953925793

noreply@aihot.virxact.com (X:Runway (@runwayml))

Perplexity 发布 Computer for Counsel:面向法律工作流的多模型智能体层

Perplexity 于 2026 年 6 月 24 日面向 Enterprise 和 Max 订阅用户推出 Computer for Counsel。该系统将法律任务自动拆解为子任务,并路由 20+ 个前沿 AI 模型分别处理研究、推理、合同等工作。数据层通过 MCP 协议连接 Midpage(美国案例法 + 引用)、Deel、LegalZoom 等专业法律源,以及...

noreply@aihot.virxact.com (MarkTechPost(RSS))

OpenAI发布GPT-5.6系列,仅向约20家政府审批合作伙伴开放

6月26日,OpenAI发布GPT-5.6系列,包括旗舰Sol、日常Terra和经济Luna。Terra性能接近GPT-5.5但价格减半;Sol新增max深度推理和ultra多智能体并行模式。Terminal-Bench 2.1上Sol Ultra得分91.9%,超Claude Mythos 5(88%)和Gemini 3.1 Pro...

noreply@aihot.virxact.com (X:宝玉 (@dotey))

美国政府将决定谁可以使用GPT-5.6

联邦政府将审查希望访问OpenAI最新大语言模型GPT-5.6的公司,这是特朗普行政当局对硅谷监管的重大扩展。申请访问的企业需通过政府审核,具体标准尚未披露。此举标志着美国在先进AI模型访问控制上迈出关键一步。 🔗...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

Model Sets 功能上线,支持保存自定义模型组

应大家要求,Model Sets 现已上线!你可以保存自定义的模型选择,并立即将其应用于所有图表。 🔗 阅读原文:https://x.com/ArtificialAnlys/status/2070588196975784339

noreply@aihot.virxact.com (X:Artificial Analysis (@ArtificialAnlys))

OpenAI 预览 GPT-5.6 系列:Sol、Terra、Luna 三层模型及新推理模式

OpenAI 开始有限预览 GPT-5.6 系列,分为旗舰 Sol、日常生产 Terra 和低成本快速 Luna 三个层级。新增两种推理控制:max(加深单链推理)和 ultra(利用子智能体并行处理复杂任务)。在 Terminal-Bench 2.1 上,Sol (ultra) 得分 91.91%,Sol (max) 88.76%,超过 Claude Mythos 5(88%)和...

noreply@aihot.virxact.com (MarkTechPost(RSS))

Axiom官方插件:检查日志与分类问题

使用官方Axiom插件检查日志并分类问题。 🔗 阅读原文:https://x.com/milichab/status/2070587616765042965

noreply@aihot.virxact.com (X:Andrew Milich (@milichab))

Artificial Analysis Model Sets 上线

应大众需求,Model Sets 现已上线!你现在可以保存自定义的模型选择,并立即将其应用于所有图表。 🔗 阅读原文:https://x.com/ArtificialAnlys/status/2070585340335952341

noreply@aihot.virxact.com (X:Artificial Analysis (@ArtificialAnlys))
上一页 第 564 / 982 页 下一页

添加 Feed

导入 OPML