RSS

  • 宝玉的分享
    https://baoyu.io/feed.xml
    刷新于
  • AIHOT 日报
    https://aihot.virxact.com/feed/daily.xml
    刷新于
  • AIHOT — 全部 AI 动态
    https://aihot.virxact.com/feed/all.xml
    刷新于
  • AIHOT — 精选
    https://aihot.virxact.com/feed.xml
    刷新于

GLM-5.2 在真实世界智能体基准 GDPval-AA 排名第三,领先所有开源模型

GLM-5.2(max)在真实世界智能体工作基准 GDPval-AA 上获 1524 Elo,排名第三,仅次于 Claude Fable 5(1783)和 Claude Opus 4.8(1615),与 GPT-5.5(xhigh,1509)持平。该模型以约 31 轮次任务平均完成零售主管任务清单、紧急停止电路图等交付物,领先开源权重模型(下一名 MiniMax-M3 仅...

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

AA-Briefcase基准测试:开放权重模型主导成本-性能帕累托前沿

Artificial Analysis发布AA-Briefcase智能体知识工作基准测试,评估模型在长期任务中的表现。任务成本差异超700倍,最高性能模型Claude Fable 5每任务超$20。成本-性能帕累托前沿上,除Anthropic两个最高分模型外,其余大部分由开放权重模型占据。关键性价比:GLM 5.2 (max)每任务$2.40,得分仅比Claude Opus 4.8低90...

noreply@aihot.virxact.com (X:Artificial Analysis (@ArtificialAnlys))

AI用不可能的家欺骗租户

生成式AI让房地产经纪人一键虚拟装修房源照片,导致租户看房时发现现实与图片严重不符。纽约租户Joyce看到带有壁炉、厨房翻新的曼哈顿工作室,实地却发现没有壁炉,炉灶缺旋钮。另一位租户Madison在StreetEasy上看到大量AI增强图片,家具细节明显不真实。佛罗里达州经纪人Bee使用ChatGPT和Stuccco、BoxBrownie等工具为客户演示装修方案,但认为用AI制造虚假房源会引...

noreply@aihot.virxact.com (The Verge:AI(RSS))

Runway Aleph 2.0 改变视频比例适配平台

改变视频的宽高比以适应任何平台。Aleph 2.0 扩展场景以适配新的宽高比,让你的视频看起来从一开始就是那样拍摄的。在今天的 Runway Academy 中了解操作方法。 🔗 阅读原文:https://x.com/runwayml/status/2069147959896240320

noreply@aihot.virxact.com (X:Runway (@runwayml))

OpenRouter 检测 1Password 帮你保存 API 密钥

提示 💡:如果你安装了 @1Password,OpenRouter 会检测到它并帮你保存你的 API 密钥。 🔗 阅读原文:https://x.com/OpenRouter/status/2069144373388820863

noreply@aihot.virxact.com (X:OpenRouter (@OpenRouter))

Gemini Spark 全天候个人AI智能体

Gemini Spark 是您的 24/7 个人AI智能体,在您的指导下从头到尾处理繁重工作。 以下是我们团队使用 Gemini Spark 让生活更轻松、更高效的一些方式。🧵 🔗 阅读原文:https://x.com/GeminiApp/status/2069143097586700794

noreply@aihot.virxact.com (X:Gemini (@GeminiApp))

GLM 5.2 持续获胜

Kim指出,GLM 5.2是首个能以开放权重处理真实自动研究任务的模型,包括调试设置、跨多节点H100集群运行并比较RL训练实验。其局限在于缺少图像理解能力,需程序化分析原始WandB数据而非可视化图表。引用介绍称,GLM 5.2是其自动研究pipeline上首个能胜任实际研究的开源模型,在Fable...

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

opencode推出独立用户排名

我们已添加独立用户排名 某些模型 token 消耗大,导致它们在排名中偏高--使用模型的独立用户数是更准确的排名 我们将围绕这一指标调整更多数据 🔗 阅读原文:https://x.com/opencode/status/2069140423197479225

noreply@aihot.virxact.com (X:opencode (@opencode))

美国机器人公司无法获取所需硬件

这种做法将意味着美国机器人公司无法获得研发所需的硬件。 🔗 阅读原文:https://x.com/SemiAnalysis_/status/2069140417442873760

noreply@aihot.virxact.com (X:SemiAnalysis (@SemiAnalysis_))

Sakana Fugu Ultra发布,性能匹配Fable和Mythos

Sakana AI 推出 Fugu 多智能体编排系统,通过单个模型 API 即可访问。其 'Fugu Ultra' 模型性能匹配 Fable 和 Mythos,提供前沿能力且无出口管制风险。在生成程序化地形(Three.js)的对比中,Fugu Ultra 在一次生成(one-shotted)下表现突出。更多示例即将分享。 🔗...

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

AI 治理清单:LLM 架构先行

Deloitte 报告显示企业 AI 抱负与治理成熟度之间差 53 个百分点,74% 计划两年内部署智能体 AI,仅 21% 拥有成熟治理模型。路由架构是首个治理层。三种姿态--托管网关(如 OpenRouter、Portkey)、自托管网关(如 LiteLLM)和直接 API--默认治理能力不同,直接 API...

noreply@aihot.virxact.com (OpenRouter:Announcements(RSS))

NotebookLM 闪卡支持完全自定义与分享

Flashcards 现已完全可自定义。编辑问题、调整答案、添加新卡片,打造终极学习工具集。 与朋友、同学、学术竞争对手等分享--只需准备好迎接随之而来的无尽赞美与赞誉。 🔗 阅读原文:https://x.com/NotebookLM/status/2069132913866953098

noreply@aihot.virxact.com (X:NotebookLM (@NotebookLM))

OpenAI推出Patch the Planet安全修复计划

Patch the Planet 是 OpenAI 帮助开源维护者从安全发现到合并修复的努力。他们与 Trail of Bits、HackerOne、Calif、研究人员及维护者合作,将 Codex Security 和先进模型引入修复流程,并以人工审查为核心。 🔗 阅读原文:https://x.com/steipete/status/2069132838356840857

noreply@aihot.virxact.com (X:Peter Steinberger (@steipete))

Google DeepMind 7500 万美元投资 A24,合作开发电影 AI 工具

Google DeepMind 宣布向独立电影制片厂 A24 投资 7500 万美元(据《华尔街日报》),双方将合作开发电影制作 AI 工具。A24 出品过《万事俱备》《后室》等影片。Google DeepMind CEO Demis Hassabis 称,希望通过与艺术家直接合作,打造支持创意表达的 AI 功能。此举是好莱坞最新一次科技公司与电影 AI 联手,此前 Netflix 已收购...

noreply@aihot.virxact.com (TechCrunch:AI(RSS))

Google DeepMind 7500 万美元投资 A24,合作开发电影 AI 工具

Google DeepMind 宣布向独立电影制片厂 A24 投资 7500 万美元(据《华尔街日报》),双方将合作开发电影制作 AI 工具。A24 出品过《万事俱备》《后室》等影片。Google DeepMind CEO Demis Hassabis 称,希望通过与艺术家直接合作,打造支持创意表达的 AI 功能。此举是好莱坞最新一次科技公司与电影 AI 联手,此前 Netflix 已收购...

noreply@aihot.virxact.com (TechCrunch:AI(RSS))

Sakana AI 发布多智能体编排系统 Sakana Fugu,对外表现为单一模型

今日 Sakana AI 发布 Sakana Fugu,一个多智能体编排系统,对外表现为单一模型。用户通过 OpenAI 兼容端点发送请求,Fugu 内部决定直接求解或组建专家模型团队协作。提供两个变体:Fugu(平衡性能与低延迟,支持特定 agent opt-out)和 Fugu Ultra(针对困难多步问题优化,固定 agent 池,当前模型 ID 为...

noreply@aihot.virxact.com (MarkTechPost(RSS))

Codex Security 插件:深度扫描与威胁建模

面向安全团队的 Codex Security 插件:深度扫描、验证发现、追踪攻击路径、构建威胁模型、生成针对代码库的补丁以供审查,以及导出到其他工具:https://openai.com/daybreak/codex-security-plugin/ 🔗 阅读原文:https://x.com/gdb/status/2069128701850386834

noreply@aihot.virxact.com (X:Greg Brockman (@gdb))

不要用AI代写署名作品

作者明确表示绝不让AI起草任何署自己名字的句子。他以亲身经历说明,用AI代写并声称是自己的作品等同于说谎--正如他曾为他人代笔发表文章,至今仍感后悔。他强调,与AI深度协作写内容时,旁人无法核实你实际贡献了多少,因此所有"AI帮助写作"的声明都会让人怀疑作品真实性。作者警告,一旦使用AI代写并冒充原创,专业人士会将其作品视为垃圾信息,个人信誉将毁于一旦。他呼吁读者不要在署名作品中使用AI代写...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

SaaS空头竟信Claude能一键生成所有软件

这似乎愚蠢得令人难以置信,但显然SaaS空头的真实信念是"所有软件都是0,因为Claude可以一次性生成这些应用" 这种说法简直是惊人的短视。 🔗 阅读原文:https://x.com/fchollet/status/2069122975371284708

noreply@aihot.virxact.com (X:Francois Chollet (@fchollet))

GLM-5.2 在 GDPval-AA 基准排名第三,领先开源权重模型

智谱 AI 的 GLM-5.2 在真实世界智能体工作基准 GDPval-AA 上获得 1524 Elo,排名第三,仅次于 Claude Fable 5 和 Claude Opus 4.8,与 GPT-5.5 持平。它是开源权重模型中领先的,超越 Gemini 3.5 Flash、Qwen 3.7 Max 等专有模型。任务为智能体型,平均每任务约 31 轮。此外,GLM-5.2 在...

noreply@aihot.virxact.com (X:Artificial Analysis (@ArtificialAnlys))

GPT-5.5-Cyber完整版发布,安全工具上线

我们希望帮助所有公司变得安全,与美国政府和安全生态系统合作。 *GPT-5.5-Cyber完整版已发布;在CyberGym上达到最先进性能。 *Patch The Planet 和 Codex Security 将帮助解决安全问题,而不仅仅是发现它们。 🔗 阅读原文:https://x.com/sama/status/2069121360744550796

noreply@aihot.virxact.com (X:Sam Altman (@sama))

Google 将 Interactions API 作为 Gemini 模型与智能体的默认接口

Google DeepMind 宣布 Interactions API 正式可用,成为 Gemini 模型和智能体的默认接口。该 API 自 2025 年 12 月进入 Beta 测试,现取代 Google AI Studio 和文档中的旧 generateContent 接口;未来新智能体功能仅通过它提供。近期新增功能包括:自带 Linux 沙箱的 Managed...

noreply@aihot.virxact.com (The Decoder:AI News(RSS))

OpenAI Daybreak 更新:Codex 安全插件 + GPT-5.5-Cyber 实现漏洞自动修复

OpenAI Daybreak 计划更新,推出 Codex 安全插件和专属 GPT-5.5-Cyber 模型,实现从漏洞发现到补丁生成的自动闭环,将以往数周乃至数月的修复时间压缩至数小时。该模型已为 Linux 内核、FreeBSD、cURL、Go、Python、Sigstore、pyca/cryptography 等关键项目发现并生成补丁。GPT-5.5-Cyber...

noreply@aihot.virxact.com (X:阿易 AI Notes (@AYi_AInotes))

Bland语音AI:周通话350万+,累计5.13亿,获1亿美元C轮融资

语音AI平台Bland (@usebland) 每周处理超过350万次电话,累计已处理超5.13亿次。公司获得1亿美元C轮融资,将用于训练模型以处理紧急、高风险、长达45分钟的电话呼叫。Bland专注于受监管行业,主打高压力、后果严重的电话场景。 🔗 阅读原文:https://x.com/rohanpaul_ai/status/2069118054798418156

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

预测机器自指产生方向错觉

镜子对着镜子创造深度的错觉。预测机器指向自身创造方向的错觉。 🔗 阅读原文:https://x.com/fchollet/status/2069116822910366137

noreply@aihot.virxact.com (X:Francois Chollet (@fchollet))

Google Interactions API 正式发布

今天我们将 Interactions API 推向 GA,这是我们设计的新 API,可让您在同一个界面中编排跨模型和智能体,并将成为我们未来的默认 API。Interactions 为智能体新时代奠定了基础。 🔗 阅读原文:https://x.com/OfficialLoganK/status/2069115284519346263

noreply@aihot.virxact.com (X:Logan Kilpatrick (@OfficialLoganK))

宾大教授实测Sakana Fugu Ultra-high:速度极慢,效果仅"fine"未达官方宣称水平

宾大教授Ethan Mollick实测Sakana Fugu Ultra-high模型,指出其速度极慢--典型编码测试需30分钟,实际效果仅"fine",未能匹配此前Sakana官方宣称的"与Fable和Mythos性能相当"。Mollick表示,在真实编码场景中Fugu Ultra远不及Fable,并附上AI港口小镇生成样例链接作为例证。 🔗...

noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))

OpenAI Daybreak:加速漏洞修复,推出新工具与模型

Greg Brockman 宣布 OpenAI Daybreak 加速漏洞发现与修复。模型已能发现并生成针对主流浏览器、网络基础设施、FreeBSD 和 Linux 内核等操作系统,以及 cURL、Go、Python、Sigstore、pyca/cryptography 等项目的关键漏洞补丁。同时扩展 Daybreak 项目:推出 Codex Security 插件(在 Codex...

noreply@aihot.virxact.com (X:Greg Brockman (@gdb))

Moebius:0.22B参数轻量级图像修复框架,性能媲美百亿级模型

Moebius是一个仅0.22B参数的轻量级图像修复框架。其核心是Local-λ Mix...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

OpenAI 扩展 Daybreak 项目,发布 GPT-5.5-Cyber 等安全工具

OpenAI 宣布扩展 Daybreak 项目,旨在以机器速度民主化修复脆弱软件。主要发布包括:Codex Security 插件(在 Codex 内发现、验证并修复漏洞);完整版 GPT-5.5-Cyber 模型(面向受信防御者的安全专用模型);Cyber Partner Program(支持安全公司基于 OpenAI 顶级网络能力构建产品);以及 Patch the...

noreply@aihot.virxact.com (X:Kim (@kimmonismus))
上一页 第 649 / 1023 页 下一页

添加 Feed

导入 OPML