RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
Fable 5 仅 4.44 美元搭建 Rube Goldberg 机器
用 Fable 5 构建的鲁布·戈德堡机械,仅需 4.44 美元 👀 提示词在此:https://www.reddit.com/r/openrouter/comments/1ulkilz/i_asked_claude_fable_5_to_build_a_rube_goldberg/ 🔗 阅读原文:https://x.com/OpenRouter/status/2072738704922439689
Grok Build 已安装至 Railway 沙箱
Grok Build 现已安装在 Railway 沙箱中 🔗 阅读原文:https://x.com/xai/status/2072738598663946648
西班牙下令将帕兰蒂尔列入公共和私营企业的"黑名单"
西班牙政府下令国企将美国数据分析公司Palantir列入黑名单,担忧其滥用国家安全机密。首相府责成SEPI监管的Telefónica、Indra及Navantia停止与其签新合同,已导致Navantia项目搁浅,内政部长也否决了与国民警卫队的协议。法国此前已停止合作,德国转向欧洲替代品。但Palantir仍保留国防部2023年签署的价值1650万欧元的CIFAS合同,将于今年11月到期,军方...
DAIR.AI 的 Elvis Saravia 分享 PaperWiki:基于 LLM 和智能体的研究知识库
DAIR.AI 的 Elvis Saravia 分享了自己过去几个月构建的 PaperWiki,这是一个基于 LLM 和编程智能体的知识库,用于研究工作流。它通过自动化每日更新,从多个来源摄入论文并存入 Obsidian,使用 qmd 索引,以 HTML artifact 呈现,支持全文和语义搜索。Saravia...
Anthropic 与三星洽谈定制 AI 芯片,同时强调英伟达仍重要
Anthropic 正与三星电子洽谈制造定制 AI 芯片,但项目仍处早期,尚未确定具体设计和性能需求。Anthropic 淡化该努力,称 AWS、谷歌和英伟达的芯片仍是其战略核心。公司已招募芯片工程师,包括曾参与特斯拉和 OpenAI 定制芯片团队的 Clive Chan,他将组建 Anthropic 专属芯片团队。此举紧跟行业趋势--定制芯片可降低 AI 基础设施成本。OpenAI...
SemiAnalysis ECTC 2026 先进封装技术综述
EMIB-T 路线图、定制 HBM、 HBM4 封装挑战、微流冷却、 光子互连,以及更多 ECTC 2026 综述,英特尔、台积电、SK 海力士、 三星、美光、Marvell、Lightmatter、微软 https://newsletter.semianalysis.com/p/ectc2026 🔗...
Claude Fable 5回归后遭严重降级:安全路由导致性能暴跌
Anthropic的Claude Fable 5(7月1日版)回归后在BridgeBench重测中表现大幅下滑:Debugging从86.2暴跌至25.9,Refactoring从73.6降至38.4,Hallucination从75.9滑落至61.7。原因是新安全护栏并非简单拒绝层,而是将标记请求路由至较弱的Opus 4.8,导致大量任务回退。Rohan...
Geoffrey Litt 在 AIE 提出「理解以参与」理念:与编码智能体协作需避免认知债务
Geoffrey Litt 在 AIE 演讲中提出「理解以参与」理念:开发者需要深入理解代码,才能在与编码智能体(coding agents)的协作中保持主动参与,避免因认知债务(cognitive debt)导致无法有效推进项目。他认为,缺乏对代码的概念流畅性会显著限制参与能力。该演讲录像将于三周内陆续放出。 🔗...
电力缺口迫使AI数据中心自建供电
太阳能和储能每年各新增超过20GW。听起来新增大量电力。但电网在需求高峰时实际能依赖的容量几乎没有变化。这一缺口正是AI数据中心开始自建电力容量,而非排队等待接入电网的原因。(1/3)🧵 🔗 阅读原文:https://x.com/SemiAnalysis_/status/2072727395048595512
持续学习是AI最大障碍,EBR-bench无改进
Ethan Mollick指出,持续学习是AI爆炸式采用的最大障碍,并对递归自我改进有重大影响。只要模型健忘、需人类替其学习,采用速度就受限于人类流程。EpochAI Research为此推出EBR-bench,通过让AI反复玩Earthborne Rangers棋盘游戏来测试其即时学习能力。初步结果显示:AI未能从错误中改进,至今无提升迹象。 🔗...
Claude Tag 上线 Claude Fable 5
与 Boris Cherny 和 Cat Wu 关于从 Claude Code 到 Claude Tag 的路径,以及它如何从工程团队扩展到 Anthropic 其他部门的对话。 Claude Fable 5 现已在 Claude Tag 中可用。 🔗 阅读原文:https://x.com/claudeai/status/2072725610061803522
Claude Code的Fable功能强大但不适合长自主任务
Fable in Claude Code 确实能做到非常惊人的事情,包括非程序员也可以用,但界面并不是为管理5小时以上的自主任务而设计的。很难实时观察发生了什么并干预,你经常必须等到输出。 🔗 阅读原文:https://x.com/emollick/status/2072722575126319366
Anthropic Fable 5 遭严重削弱因护栏
Fable 5 不是被削弱,而是被屠杀了。问题甚至不在于模型本身,而在于 Anthropic 设置的硬性护栏。网友对此表示震惊。 🔗 阅读原文:https://x.com/kimmonismus/status/2072721044159287361
Codex用屏幕镜像控制iPhone查附近人发短信
即将使用 codex computer use 通过屏幕镜像控制我的 iPhone,查看 Find My 了解周围有谁并给他们发短信。 🔗 阅读原文:https://x.com/jxnlco/status/2072720993291014438
OpenAI与Anthropic应各捐10%股权予美国儿童
OpenAI和Anthropic应各自将10%的股权投入Invest America账户,用于美国儿童。 🔗 阅读原文:https://x.com/EMostaque/status/2072719294253650411
Firefox 内置免费 VPN,Claude Fable 5 在 ZenMux 上限时免费回归
Firefox 推出官方原生 IP 保护功能,内置免费 VPN,每月赠送 50G 流量。开启方法:地址栏输入 about:config → 显示全部首选项 → 搜索 browser.ipProtection.enabled → 切换为 true。Claude Fable 5 回归上线,ZenMux 上限时免费使用。Fable 5 可输出高质量人像提示词,通过拆解塑料感根源、8...
Anthropic与五角大楼争端:核心非Claude访问权,而是军方使用控制权
WSJ报道的法院文件显示,Anthropic CEO Dario Amodei与五角大楼副部长Emil...
Anthropic与五角大楼控权之争:Claude军事用途护栏分歧
WSJ法庭文件显示,Anthropic CEO Dario Amodei与五角大楼副部长Emil...
Anthropic 为 Claude Code 削减 80% 系统提示词,称 Fable 5 模型"想要更短的提示词"
Anthropic 将 Claude Code 的系统提示词削减了 80%。技术员工 Tariq Shihipar 指出,新 Fable 5 模型(Mythos 类)不再需要更多指令和示例,过多的示例反而会限制模型的想象力。Anthropic 转而通过上下文而非硬性规则来引导模型。这一变化分阶段发生:早期模型需要短提示词配合大量示例,随后提示词随模型理解能力提升而变长,如今又再度缩短。 🔗...
斯坦福 AutoMem:记忆管理成为可训练技能,32B 模型性能媲美顶尖闭源模型
斯坦福大学提出 AutoMem,将智能体的记忆管理从固定模块变为可训练技能。模型自主决定编码内容、检索时机以及笔记组织方式,文件系统操作升级为一级动作。AutoMem 采用双循环机制:强 LLM 审查完整轨迹并重写记忆结构(提示词、模式、动作词表);同时利用智能体自身良好的记忆决策作为训练信号。仅优化记忆(不改任务动作),便在 Crafter、MiniHack、NetHack 上取得...
EBR-bench:即时学习能力基准测试
介绍 EBR-bench,我们用于衡量即时学习的新基准。 AI 反复玩一款名为 Earthborne Rangers 的挑战性棋盘游戏,并尝试从错误中学习。迄今为止:没有改进的迹象。 🔗 阅读原文:https://x.com/EpochAIResearch/status/2072714372175237255
CursorBench 3.1
CursorBench 3.1 新增代码库理解、bug 查找、规划和代码审查任务,并改进了编辑任务的评分标准。排行榜显示,Fable 5 Max 以 72.9% 得分、$18.02 每任务成本居首,Fable 5 Extra High(72.0%,$13.74)和 Fable 5 High(70.6%,$10.81)紧随其后。Opus 4.7 Max 得分 64.8%、成本...
Fable 5早期兴奋消退,失望情绪蔓延
昨天,我看到很多关于Fable 5的早期兴奋。 但正如我所预料,这消失得超快。 我的时间线充满了关于限制、护栏、能力、成本等方面的失望。 我怀念Opus 4.5发布时的光环。它当时就是好用。 🔗 阅读原文:https://x.com/omarsar0/status/2072713255248630227
Replit 开放讨论串展示用户项目
来看看人们在 Replit 上构建了什么: 开放讨论串 🧵 🔗 阅读原文:https://x.com/Replit/status/2072712175462863109
Kim 介绍用 Bloome 实现多 AI 智能体群聊协作
Kim (@kimmonismus) 介绍利用 Bloome 替代传统一对一 AI 聊天窗口,将其作为共享工作空间,让人类与多个 AI 智能体在同一群聊中协同完成内容工作流。通过一键模板创建创意团队,关键特点是智能体主动互相审核而非仅附和用户:Writer 起草视频论文结构,Audience 即时批评节奏并重写枯燥部分以维持观众留存,Art Director 在聊天窗口内整合视觉...
Fable 5回归Replit,高努力模式上线
Fable 5 已回归 Replit! 尤其适合更长、更困难的项目。 在 Replit Agent 中开启 High effort 模式,立即在你最艰巨的项目上尝试吧! 🔗 阅读原文:https://x.com/Replit/status/2072712027144081452
Replit六月发布内容汇总
Replit新动态:我们六月发布的所有内容!https://x.com/i/broadcasts/1yGBeeAYwQMKN 🔗 阅读原文:https://x.com/Replit/status/2072711588101136884
构建LLM验证器和裁判成高需求技能
Elvis Saravia(DAIR.AI)指出,调优和构建LLM验证器及裁判(verifiers/judges)正成为高需求技能。他将这些组件用于自己的测试框架(harness),解锁了远超市面现有方案的智能体编码工作流。同时,引用案例显示,Bridgewater利用其金融专业知识,与Tinker API合作微调模型,帮助分析师聚焦关键任务,体现了"专家提升AI,AI赋能专家"的闭环。...
换助理了!!! 新助理说每个人都需要一个数字人? 那么,还要她干嘛呢? 你说呢?兄弟们~
换助理了!!! 新助理说每个人都需要一个数字人? 那么,还要她干嘛呢? 你说呢?兄弟们~ 【引用 @berryxia】:开始让美女助教卖课了😂 丝滑~ 🔗 阅读原文:https://x.com/berryxia/status/2072709199507882146