RSS

  • 宝玉的分享
    https://baoyu.io/feed.xml
    刷新于
  • AIHOT 日报
    https://aihot.virxact.com/feed/daily.xml
    刷新于
  • AIHOT — 全部 AI 动态
    https://aihot.virxact.com/feed/all.xml
    刷新于
  • AIHOT — 精选
    https://aihot.virxact.com/feed.xml
    刷新于

智能体41种故障模式分类框架发布

一篇面向生产环境智能体构建的论文提出按交互来源组织41种智能体故障模式,将每个故障归因于模型、工具、记忆等组件间的边及修复侧。该框架在四个前沿模型上最强评判者与人工标签的Cohen's kappa达0.76,支持生产轨迹持续自动化标注,为harness工程提供共享词汇。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

微软开源 Orchard 智能体训练框架

Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdnp8wy035jro0oflgpii8f

noreply@aihot.virxact.com (X:Microsoft Research (@MSFTResearch))

微软开源 Orchard 智能体训练框架

Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdnp8wy035jro0oflgpii8f

noreply@aihot.virxact.com (X:Microsoft Research (@MSFTResearch))

fofr 评《披露日》:似二十年前老片

我看了《披露日》。感觉就像一部二十年前的老电影。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdnpqm2039pro0o23ej7bau

noreply@aihot.virxact.com (X:fofr (@fofrAI))

4B 参数 Athena 预测购物行为击败 GPT-5.6

Markopolo AI 发布 4B 参数大型事件模型 Athena(mvrko-sim-1),在 OPeRA 基准的购物行为预测任务中以 24.50% 严格精确匹配率超越 GPT-5.6、Claude Opus 4.8 等前沿模型。Athena 是 Qwen3-4B 的 LoRA 微调模型,可自托管,能预测购物者下一步浏览器动作及目标元素,为下游系统提供实时响应机会。 🔗 阅读原文...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

5月犹他州太阳能发电量首超其他能源,创历史新高

5月份,犹他州太阳能发电量超过其他任何能源,创下历史新高,为该州首次。这一里程碑标志着太阳能首次成为该州月度发电量的首要来源。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdnoxt1033zro0om7fbj3v4

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

DesignArena 开发商 Intelligence 获 790 万美元种子轮融资,为 AI 模型注入"品味"

DesignArena 开发商 Intelligence 完成 790 万美元种子轮融资,由 Index Ventures 领投,Conviction、A*、Valkyrie 等参投。该平台通过"A vs. B"人工排序为媒体生成模型提供规模化反馈,目前拥有 530 万用户,ARR 达 6000...

noreply@aihot.virxact.com (TechCrunch:AI(RSS))

内部版GPT-6解决10个长期难题

"我们的下一个主要模型" 所以,他们那个解决了10个长期难题的内部模型确实是GPT-6。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdmmuse028iro0ou0e31s57

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

Block 与 Spotify 法务负责人如何在 AI 时代给出"同意"

Block 首席法务官 Esperanza 与 Spotify 总法律顾问 Choset 认为,AI 时代"说不"风险更高,法务应深入理解技术并自信放行。两人均主张法务贴近产品、在监管前自定规则,并用 AI 工具自建审查系统。Choset 强调,AI 法律问题本质仍是版权、隐私与雇佣问题。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (Runway:News(网页))

OpenAI 豪华网红之旅引发强烈反弹

OpenAI 上周末邀请网红赴纽约州北部豪华度假村参加"Summer Club"品牌之旅,提供农场到餐桌晚宴、养蜂等养生活动及产品使用课程,但视频评论区涌现大量负面声音,有网友指责网红"为豪华酒店出卖灵魂"。此次行程正值 OpenAI 拟在俄亥俄州达成 5000 亿美元数据中心交易、并持有美国国防部 2 亿美元合同之际,加剧了外界对 AI 社会生态影响的批评。 🔗 阅读原文 via AI...

noreply@aihot.virxact.com (TechCrunch:AI(RSS))

Intology Locus 自动后训练模型超越人工调优版

Intology 的自动化研究系统 Locus 后训练出的模型超越官方人工调优的 Qwen3-1.7B,得分 51.6% 对 49.4%。Locus 在 PostTrainBench+ 上以 4,500 H100 小时预算(原版仅 70 小时)运行 100 小时,验证了扩展算力对自动后训练能力的区分度。该系统已在生产中服务数百万用户。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

AI 监考的远程考试严重失误,墨西哥 UNAM 大学 5.8 万考生需重考

墨西哥最大大学 UNAM 今夏首次采用 AI 监考的远程入学考试,近 16 万考生参加,结果却出现异常:满分 120 分的测试中,今年 16.3% 考生得分不低于 100 分,而 2021 至 2025 年间该比例仅为 3.5%。因成绩与往年差异过大,5.8 万名考生被要求重考。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (Ars Technica:AI(RSS))

Replit Design 用户作品展示

看看大家用 Replit Design 在做什么。 开放讨论串 🧵 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdljeq601horo0oyimv6hjk

noreply@aihot.virxact.com (X:Replit (@Replit))

网友调侃给Dario降薪90%建议

我有个绝妙主意要给你,Dario,试试降薪90%吧 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdljrau01liro0o764m2nxk

noreply@aihot.virxact.com (X:Gabriel (@gabriel1))

OpenAI 内部模型数学难题获十项突破

我们下一代主要模型的内部版本,在数学和理论计算机科学中长期未解的开放问题上取得了 10 项新成果,按 GPT-5.6 Sol API 费率计算,所用 token 成本约为 2,000 美元。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdljdrw01hgro0oe94x8fb4

noreply@aihot.virxact.com (X:OpenAI (@OpenAI))

马斯克称源码将成汇编,Dex Horthy 泼冷水

Dex Horthy 表示,18 个月前曾对"源代码将像汇编语言一样"感到兴奋,但多年极限使用编码模型后,如今不再确信。他认为这是未来方向,但对有正常运行时间和合规需求的严肃软件而言,离"即将到来"还很远。该观点是对马斯克"源代码即将像汇编语言,下一步直接用 AI 生成高效二进制"推文的回应。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:Dex Horthy(HumanLayer)(@dexhorthy))

Siri AI 上线,但为何令人感觉平淡?

Siri AI 已随 7 月发布的 iOS 27 消费者测试版上线,能理解个人上下文、调用世界知识回答问题,并支持自然对话、打字输入及独立应用。该功能由 Apple 与 Google 合作,利用 Gemini AI 模型训练自有 Apple Foundation Models,可在 Apple Silicon 和 Private Cloud Compute 上运行。 🔗 阅读原文 via...

noreply@aihot.virxact.com (TechCrunch:AI(RSS))

金·蒙尼穆斯谈美国放缓前沿AI与中企进展

Kim 认为美国单方面放缓前沿AI开发不现实且风险更大。1300余名前沿AI公司员工签署"Pacing the Frontier"声明,但不等同于OpenAI或Anthropic公司同意放缓。中国模型如Kimi K3、GLM-5.2已开源权重,MiniMax H3、Qwen3.8权重尚未可用,benchmark显示差距缩小但未全面超越。放缓或让中国实验室在特定能力上反超。 🔗 阅读原文...

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

DMARC能保护您免受哪些威胁,以及它无法提供哪些保护

DMARC仅验证域名所有者是否授权发送邮件,并不验证邮件内容是否安全。它能在防钓鱼和防域名冒用方面发挥作用,但无法阻止合法域名发出的恶意邮件。身份验证不等于信任,DMARC的局限在于它不评估邮件内容本身的安全性。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdlj2dj01g8ro0ohfhqyh4k

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

The Best AI Agent Builder Is Trapped Inside Microsoft

🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdkakqf00euro0o9vvnavb8

noreply@aihot.virxact.com (Every:最新文章(网页))

Record A Skill With Claude

🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdlko6t01moro0otviul5u8

noreply@aihot.virxact.com (Claude:YouTube(RSS))

插电式太阳能即将到来,插电式电池也应紧随其后

英国智库Regen发文呼吁,在政府已宣布将放开插电式太阳能面板后,应进一步允许独立插电式电池上市。这类电池无需专业安装,插入标准插座即可在低谷电价时充电、高峰时放电,可为租户、公寓住户和低收入家庭每年节省电费,10年最高可省约2,400英镑,并有望降低总成本30-34%。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

Gabriel 反思过度押注 AI 推理增长

我需要停止把 80% 的钱投入股票,假设推理增长 100 倍。每天早上醒来都感觉像在玩老虎机。 而且这还不包括 OpenAI 的股票,所以我甚至不知道为什么还要在 AI 上投入更多。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdkh5by00mpro0osae5nbvw

noreply@aihot.virxact.com (X:Gabriel (@gabriel1))

Locus 自动后训练 Qwen3 超越官方 Instruct 版

Locus 自动研究系统对 Qwen3 基础模型进行后训练,性能超越官方人工调优的 Qwen3 1.7B Instruct 版本,并在 PostTrainBench 上达到 SOTA。在扩展算力预算的 PostTrainBench+ 测试中,Locus 扩展性最佳,其训练模型整体超越人工后训练的 Qwen3 1.7B。此外,Locus 在 Kaggle 实时竞赛中 16 天取得平均排名第...

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

Replit 设计马拉松 8/4 开启

面向开发者的重磅消息明天发布。👀 大胆的设计。真实的奖品。一周时间证明任何人都能打造出杰出的作品。 Replit 设计马拉松将于 8/4 开启--我们将在太平洋时间上午 9 点进行直播启动。 预留席位:https://luma.com/70wipkmf 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdkgtbv00inro0ov4av2zu9

noreply@aihot.virxact.com (X:Replit (@Replit))

GEM 训练:Meta 如何将 LLM 规模广告基础模型效率翻倍

Meta 通过内核、精度、并行、网络与内存的协同设计,将广告推荐基础模型 GEM 的端到端训练效率翻倍至 20-25% MFU,并在 12 个月内将训练 FLOPs 扩展 4 倍。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdn9udp02iaro0ol303b53a

noreply@aihot.virxact.com (Meta Engineering Blog(RSS))

Chamath:AI 智能体正让"10x 工程师"优势消失

Chamath 在 All-In 播客中称,AI 智能体正让"10x 工程师"的区分度消失,因为最高效的"代码路径"对所有人变得显而易见。他认为开发者不再拥有"更好的判断力",AI 将编码过程简化,如同 AI 破解国际象棋一样,消除了技术差异化,让每个人都能成为 10x 工程师。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

Google 生态助力 Gemini 黑客松应用构建

规划好你的想法之后,就该开始构建了。🏗️ 这段视频展示了如何利用 Google 生态系统,为 Build with Gemini @XPrize 黑客松无缝构建和部署 AI 原生应用。该黑客松将持续至 8 月 17 日。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdjl9lv03r1rocaz06h7qk7

noreply@aihot.virxact.com (X:Google AI for Developers (@googleaidevs))

德国风能和太阳能发电量首次超过化石燃料

德国风能和太阳能发电量首次超过化石燃料,可再生能源在电力结构中占据主导地位。这一里程碑标志着德国能源转型取得关键进展,风电和光伏装机容量持续增长,推动清洁能源发电占比显著提升。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsdjcw5803jdroca5vm77zt1

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

谷歌开发者博客:用会话感知负载均衡扩展实时 AI 智能体

实时 AI 智能体依赖长连接、有状态的双向流,打破了传统请求-响应式负载均衡范式。开发者需在运行时内实现应用级会话跟踪,以准确测量活跃对话的并发工作负载。将精确的会话计数与标准 CPU 利用率指标一同输入混合路由算法,可有效分配有状态的 AI 流量并防止单个后端瓶颈。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (Google Developers Blog(RSS))
上一页 第 165 / 922 页 下一页

添加 Feed

导入 OPML