RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
GLM-5.2 在真实世界智能体基准 GDPval-AA 排名第三,领先所有开源模型
GLM-5.2(max)在真实世界智能体工作基准 GDPval-AA 上获 1524 Elo,排名第三,仅次于 Claude Fable 5(1783)和 Claude Opus 4.8(1615),与 GPT-5.5(xhigh,1509)持平。该模型以约 31 轮次任务平均完成零售主管任务清单、紧急停止电路图等交付物,领先开源权重模型(下一名 MiniMax-M3 仅...
AA-Briefcase基准测试:开放权重模型主导成本-性能帕累托前沿
Artificial Analysis发布AA-Briefcase智能体知识工作基准测试,评估模型在长期任务中的表现。任务成本差异超700倍,最高性能模型Claude Fable 5每任务超$20。成本-性能帕累托前沿上,除Anthropic两个最高分模型外,其余大部分由开放权重模型占据。关键性价比:GLM 5.2 (max)每任务$2.40,得分仅比Claude Opus 4.8低90...
AI用不可能的家欺骗租户
生成式AI让房地产经纪人一键虚拟装修房源照片,导致租户看房时发现现实与图片严重不符。纽约租户Joyce看到带有壁炉、厨房翻新的曼哈顿工作室,实地却发现没有壁炉,炉灶缺旋钮。另一位租户Madison在StreetEasy上看到大量AI增强图片,家具细节明显不真实。佛罗里达州经纪人Bee使用ChatGPT和Stuccco、BoxBrownie等工具为客户演示装修方案,但认为用AI制造虚假房源会引...
Runway Aleph 2.0 改变视频比例适配平台
改变视频的宽高比以适应任何平台。Aleph 2.0 扩展场景以适配新的宽高比,让你的视频看起来从一开始就是那样拍摄的。在今天的 Runway Academy 中了解操作方法。 🔗 阅读原文:https://x.com/runwayml/status/2069147959896240320
OpenRouter 检测 1Password 帮你保存 API 密钥
提示 💡:如果你安装了 @1Password,OpenRouter 会检测到它并帮你保存你的 API 密钥。 🔗 阅读原文:https://x.com/OpenRouter/status/2069144373388820863
Gemini Spark 全天候个人AI智能体
Gemini Spark 是您的 24/7 个人AI智能体,在您的指导下从头到尾处理繁重工作。 以下是我们团队使用 Gemini Spark 让生活更轻松、更高效的一些方式。🧵 🔗 阅读原文:https://x.com/GeminiApp/status/2069143097586700794
GLM 5.2 持续获胜
Kim指出,GLM 5.2是首个能以开放权重处理真实自动研究任务的模型,包括调试设置、跨多节点H100集群运行并比较RL训练实验。其局限在于缺少图像理解能力,需程序化分析原始WandB数据而非可视化图表。引用介绍称,GLM 5.2是其自动研究pipeline上首个能胜任实际研究的开源模型,在Fable...
opencode推出独立用户排名
我们已添加独立用户排名 某些模型 token 消耗大,导致它们在排名中偏高--使用模型的独立用户数是更准确的排名 我们将围绕这一指标调整更多数据 🔗 阅读原文:https://x.com/opencode/status/2069140423197479225
美国机器人公司无法获取所需硬件
这种做法将意味着美国机器人公司无法获得研发所需的硬件。 🔗 阅读原文:https://x.com/SemiAnalysis_/status/2069140417442873760
Sakana Fugu Ultra发布,性能匹配Fable和Mythos
Sakana AI 推出 Fugu 多智能体编排系统,通过单个模型 API 即可访问。其 'Fugu Ultra' 模型性能匹配 Fable 和 Mythos,提供前沿能力且无出口管制风险。在生成程序化地形(Three.js)的对比中,Fugu Ultra 在一次生成(one-shotted)下表现突出。更多示例即将分享。 🔗...
AI 治理清单:LLM 架构先行
Deloitte 报告显示企业 AI 抱负与治理成熟度之间差 53 个百分点,74% 计划两年内部署智能体 AI,仅 21% 拥有成熟治理模型。路由架构是首个治理层。三种姿态--托管网关(如 OpenRouter、Portkey)、自托管网关(如 LiteLLM)和直接 API--默认治理能力不同,直接 API...
NotebookLM 闪卡支持完全自定义与分享
Flashcards 现已完全可自定义。编辑问题、调整答案、添加新卡片,打造终极学习工具集。 与朋友、同学、学术竞争对手等分享--只需准备好迎接随之而来的无尽赞美与赞誉。 🔗 阅读原文:https://x.com/NotebookLM/status/2069132913866953098
OpenAI推出Patch the Planet安全修复计划
Patch the Planet 是 OpenAI 帮助开源维护者从安全发现到合并修复的努力。他们与 Trail of Bits、HackerOne、Calif、研究人员及维护者合作,将 Codex Security 和先进模型引入修复流程,并以人工审查为核心。 🔗 阅读原文:https://x.com/steipete/status/2069132838356840857
Google DeepMind 7500 万美元投资 A24,合作开发电影 AI 工具
Google DeepMind 宣布向独立电影制片厂 A24 投资 7500 万美元(据《华尔街日报》),双方将合作开发电影制作 AI 工具。A24 出品过《万事俱备》《后室》等影片。Google DeepMind CEO Demis Hassabis 称,希望通过与艺术家直接合作,打造支持创意表达的 AI 功能。此举是好莱坞最新一次科技公司与电影 AI 联手,此前 Netflix 已收购...
Google DeepMind 7500 万美元投资 A24,合作开发电影 AI 工具
Google DeepMind 宣布向独立电影制片厂 A24 投资 7500 万美元(据《华尔街日报》),双方将合作开发电影制作 AI 工具。A24 出品过《万事俱备》《后室》等影片。Google DeepMind CEO Demis Hassabis 称,希望通过与艺术家直接合作,打造支持创意表达的 AI 功能。此举是好莱坞最新一次科技公司与电影 AI 联手,此前 Netflix 已收购...
Sakana AI 发布多智能体编排系统 Sakana Fugu,对外表现为单一模型
今日 Sakana AI 发布 Sakana Fugu,一个多智能体编排系统,对外表现为单一模型。用户通过 OpenAI 兼容端点发送请求,Fugu 内部决定直接求解或组建专家模型团队协作。提供两个变体:Fugu(平衡性能与低延迟,支持特定 agent opt-out)和 Fugu Ultra(针对困难多步问题优化,固定 agent 池,当前模型 ID 为...
Codex Security 插件:深度扫描与威胁建模
面向安全团队的 Codex Security 插件:深度扫描、验证发现、追踪攻击路径、构建威胁模型、生成针对代码库的补丁以供审查,以及导出到其他工具:https://openai.com/daybreak/codex-security-plugin/ 🔗 阅读原文:https://x.com/gdb/status/2069128701850386834
不要用AI代写署名作品
作者明确表示绝不让AI起草任何署自己名字的句子。他以亲身经历说明,用AI代写并声称是自己的作品等同于说谎--正如他曾为他人代笔发表文章,至今仍感后悔。他强调,与AI深度协作写内容时,旁人无法核实你实际贡献了多少,因此所有"AI帮助写作"的声明都会让人怀疑作品真实性。作者警告,一旦使用AI代写并冒充原创,专业人士会将其作品视为垃圾信息,个人信誉将毁于一旦。他呼吁读者不要在署名作品中使用AI代写...
SaaS空头竟信Claude能一键生成所有软件
这似乎愚蠢得令人难以置信,但显然SaaS空头的真实信念是"所有软件都是0,因为Claude可以一次性生成这些应用" 这种说法简直是惊人的短视。 🔗 阅读原文:https://x.com/fchollet/status/2069122975371284708
GLM-5.2 在 GDPval-AA 基准排名第三,领先开源权重模型
智谱 AI 的 GLM-5.2 在真实世界智能体工作基准 GDPval-AA 上获得 1524 Elo,排名第三,仅次于 Claude Fable 5 和 Claude Opus 4.8,与 GPT-5.5 持平。它是开源权重模型中领先的,超越 Gemini 3.5 Flash、Qwen 3.7 Max 等专有模型。任务为智能体型,平均每任务约 31 轮。此外,GLM-5.2 在...
GPT-5.5-Cyber完整版发布,安全工具上线
我们希望帮助所有公司变得安全,与美国政府和安全生态系统合作。 *GPT-5.5-Cyber完整版已发布;在CyberGym上达到最先进性能。 *Patch The Planet 和 Codex Security 将帮助解决安全问题,而不仅仅是发现它们。 🔗 阅读原文:https://x.com/sama/status/2069121360744550796
Google 将 Interactions API 作为 Gemini 模型与智能体的默认接口
Google DeepMind 宣布 Interactions API 正式可用,成为 Gemini 模型和智能体的默认接口。该 API 自 2025 年 12 月进入 Beta 测试,现取代 Google AI Studio 和文档中的旧 generateContent 接口;未来新智能体功能仅通过它提供。近期新增功能包括:自带 Linux 沙箱的 Managed...
OpenAI Daybreak 更新:Codex 安全插件 + GPT-5.5-Cyber 实现漏洞自动修复
OpenAI Daybreak 计划更新,推出 Codex 安全插件和专属 GPT-5.5-Cyber 模型,实现从漏洞发现到补丁生成的自动闭环,将以往数周乃至数月的修复时间压缩至数小时。该模型已为 Linux 内核、FreeBSD、cURL、Go、Python、Sigstore、pyca/cryptography 等关键项目发现并生成补丁。GPT-5.5-Cyber...
Bland语音AI:周通话350万+,累计5.13亿,获1亿美元C轮融资
语音AI平台Bland (@usebland) 每周处理超过350万次电话,累计已处理超5.13亿次。公司获得1亿美元C轮融资,将用于训练模型以处理紧急、高风险、长达45分钟的电话呼叫。Bland专注于受监管行业,主打高压力、后果严重的电话场景。 🔗 阅读原文:https://x.com/rohanpaul_ai/status/2069118054798418156
预测机器自指产生方向错觉
镜子对着镜子创造深度的错觉。预测机器指向自身创造方向的错觉。 🔗 阅读原文:https://x.com/fchollet/status/2069116822910366137
Google Interactions API 正式发布
今天我们将 Interactions API 推向 GA,这是我们设计的新 API,可让您在同一个界面中编排跨模型和智能体,并将成为我们未来的默认 API。Interactions 为智能体新时代奠定了基础。 🔗 阅读原文:https://x.com/OfficialLoganK/status/2069115284519346263
宾大教授实测Sakana Fugu Ultra-high:速度极慢,效果仅"fine"未达官方宣称水平
宾大教授Ethan Mollick实测Sakana Fugu Ultra-high模型,指出其速度极慢--典型编码测试需30分钟,实际效果仅"fine",未能匹配此前Sakana官方宣称的"与Fable和Mythos性能相当"。Mollick表示,在真实编码场景中Fugu Ultra远不及Fable,并附上AI港口小镇生成样例链接作为例证。 🔗...
OpenAI Daybreak:加速漏洞修复,推出新工具与模型
Greg Brockman 宣布 OpenAI Daybreak 加速漏洞发现与修复。模型已能发现并生成针对主流浏览器、网络基础设施、FreeBSD 和 Linux 内核等操作系统,以及 cURL、Go、Python、Sigstore、pyca/cryptography 等项目的关键漏洞补丁。同时扩展 Daybreak 项目:推出 Codex Security 插件(在 Codex...
OpenAI 扩展 Daybreak 项目,发布 GPT-5.5-Cyber 等安全工具
OpenAI 宣布扩展 Daybreak 项目,旨在以机器速度民主化修复脆弱软件。主要发布包括:Codex Security 插件(在 Codex 内发现、验证并修复漏洞);完整版 GPT-5.5-Cyber 模型(面向受信防御者的安全专用模型);Cyber Partner Program(支持安全公司基于 OpenAI 顶级网络能力构建产品);以及 Patch the...