RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
自动化SKILL.md生成:三阶段流水线论文
关键要点:OpenAI昨日为Codex推出了从交互中打包技能的类似功能;论文提出三阶段流水线(GUI轨迹分割→聚类候选技能→训练技能感知策略)。聚类纯度优异(5/8簇达0.95以上),但可读性未迁移:GRPO仅将技能步骤准确率从18.5%提至20.5%,在BrowseComp+上无改善,甚至输给简单频率先验。作者指出三个缺陷:弱边界检测器、无序片段表示、离线奖励模型。
商汤 SenseNova U1 实现文本-图像交错生成
商汤 SenseNova U1 具备行业首创的文本-图像交错生成能力。用户上传客厅照片后,U1 可瞬间将其风格转变为温馨阅读角。该演示由 @eigi_and_ai 完成。U1 现已通过 SenseNova Studio、HuggingFace 模型库、GitHub 源码及 Discord 社区开放体验。
OpenRouter vs LiteLLM:如何选择 LLM 网关
OpenRouter 是托管在 Cloudflare 边缘的 LLM 网关,无需管理基础设施,收取 5.5% 平台费(前 100 万次请求免费),支持 70+ 提供商和自动故障转移。LiteLLM 是自部署代理(Docker/PostgreSQL/Redis),数据不离开内网,免费开源,但需承担基础设施成本(生产部署约数百美元/月)。当模型月支出超过约 $3,600(基础设施...
OpenRouter vs LiteLLM:如何选择 LLM 网关
OpenRouter 是托管在 Cloudflare 边缘的 LLM 网关,无需管理基础设施,收取 5.5% 平台费(前 100 万次请求免费),支持 70+ 提供商和自动故障转移。LiteLLM 是自部署代理(Docker/PostgreSQL/Redis),数据不离开内网,免费开源,但需承担基础设施成本(生产部署约数百美元/月)。当模型月支出超过约 $3,600(基础设施...
应对 AI 耗电激增,美联邦能源监管委员会令 6 家电网运营商加速数据中心接入
美国联邦能源监管委员会当地时间周四要求 6 家区域电网运营商,加快大型用电设施接入输电系统,以应对 AI 数据中心急剧增长的耗电需求。能源部长赖特此前敦促委员会采取行动,增强美在 AI 领域与中国竞争的能力。委员会一致通过新命令,确保 AI 数据中心"及时、有序"接入。6 家运营商为约 2 亿美国人服务,覆盖约三分之二人口。数据显示,数据中心目前占美国用电需求约 5%,到 2035 年可能增至三倍。
路透研究所报告:AI聊天机器人新闻使用率升至10%,但信任度仍低
路透研究所2026年数字新闻报告显示,全球每周用AI聊天机器人获取新闻的比例从7%升至10%,仅1%将其视为主要来源。44%活跃用户信任AI生成的新闻,但仅4%经常点击原始来源。用户主要用途为追问(42%)、获取当前新闻(35%)和摘要(34%)。18-24岁年龄段使用率达17%,自称"新闻爱好者"的用户达18%。报告指出,聊天机器人存在强化已有偏见和分裂公共话语的风险,但也能简化复杂话题、...
前OpenAI研究员搭建紧邻办公桌的机器人研究平台
一位前OpenAI机器人研究员用不到€5,000搭建了一套桌面机器人操控实验平台,包括UFACTORY xArm Lite 6工业级机械臂、Intel RealSense D405腕部摄像头、Logitech C920桌面摄像头和3Dconnexion...
普通人一个月工资可开一家互联网公司,AI时代创业成本降至每月$20
推文指出,普通人一个月工资足以启动一家跑通商业闭环的互联网公司,每月固定成本约$20,主要来自Claude Pro或OpenAI...
Nathan Lambert 称 RL speedrun 终将成常态,瓶颈在成本;@jeankaddour 推出 Sokoban Speedrun 项目
Nathan Lambert 评论称 RL speedrun 终将成为常态,当前最大瓶颈是价格--单次 RL 实验因不稳定导致噪声大,多次种子运行成本约 100 美元。@jeankaddour 随后推出 Sokoban Speedrun 项目:基于 Karpathy 的 nanochat 流水线修改,用 RL 训练 Qwen3-4B-Instruct 解决 Sokoban 谜题,GRPO...
美国AI实验室蒸馏争议:API与监管之困
归根结底,如果美国实验室不想被蒸馏,他们就不该提供API。看起来他们最终会对某些模型这么做,这是他们的选择。 更严格的监管实际上不会奏效,反而会伤害美国的初创公司。
开源AI禁令有损美国价值观
禁止任何形式的开源AI将是错误。与@kevinsxu共同发布的一则面向公众的公告,阐述为何开源维护美国价值观。 管理前沿风险是困难的,但通过削弱开放前沿来减少透明度、创新和教育将更糟。
Claude Fable 5:SWE任务性价比存疑
正如我之前所说,考虑到成本和性能,我认为 Fable 对于很多 SWE 任务来说并不值得。 需要说明的是,我认为 Fable 非常出色,它在设计和创意方面明显表现优异。 等它重新上线后,我会用自己的循环测试它(并衡量前沿效率)。
SAP 与 Google Cloud 部署智能体商务架构
SAP 与 Google Cloud 联合部署智能体商务架构,通过 Universal Commerce Protocol 标准化零售商、支付网关与自主智能体之间的数据交换,实现从搜索、交易到售后的全序列自动化执行。SAP Commerce Cloud 集成 Google Gemini 能力构建 Shopping...
GLM 5.2 辅助开发安卓 App 体验
开发者使用 GLM 5.2 从零开始完成第一个安卓 App 开发,包括安装 Android Studio、编写代码到最终生成 APK。GLM 5.2 在大部分问题上能提供有效指导,但遇到疑难杂症时安卓系统仍难处理。作者指出当前 vibe coding 模式在电脑和 Web 端调试最为方便。
AI情绪转向负面,需加强教育
我们仍有许多工作要做。公众情绪正日益转向反对AI。 现在出现了反对数据中心、乃至整体AI的运动;怨恨情绪正在增长。 虽然其中无疑存在合理的担忧--比如对失业和能源价格上涨的恐惧--但其中很大一部分只是单纯的怨恨,需要通过教育和提高认知来解决。
人形机器人Pemba登顶6200米火山,基于宇树G1改装,目标挑战珠峰
一台由宇树G1改装、名为Pemba的人形机器人成功抵达厄瓜多尔钦博拉索火山海拔6200米顶峰。这是机器人"三冠"探险计划第一站,未来将挑战珠穆朗玛峰。项目初衷为解决自然保护区固定摄像头覆盖有限、成本高的问题;配备摄像头、传感器、卫星通信和机载AI后,Pemba可自主巡查大范围区域。坡度低于30度时独立行走,冲顶阶段陡峭地形需人员协助。下一阶段将用强化学习提升自主能力。团队为高海拔严寒开发了专...
AA-Briefcase 基准测试:最佳 AI 模型仅完全解决 3% 真实知识工作
Artificial Analysis 推出的 AA-Briefcase 基准测试将 AI 模型置于包含数千份 Slack 消息、邮件、会议记录等碎片化源文件的多周知识工作项目中。表现最好的 Claude Fable 5 通过率最高,但仅在 3% 的任务中完全达标;91 个任务中有 31 个没有任何模型达到 50%...
通用智能体必须记住什么?
该论文指出,通用智能体不能仅依赖当前观测,必须记住隐藏环境规则。当两个隐藏域在相同可见状态下要求相反动作时,仅凭观察无法区分当前场景。作者证明,要在两个域都表现良好的智能体,必须为不同域维持不同的内部记忆状态。核心结论:好的通用智能体不是对当前所见做出反应,而是必须携带来自先前经验的隐藏上下文。
Mistral AI向Pro用户发布Code on Vibe桌面应用确认
Mistral AI 向 Pro 用户发布了 Code on Vibe。桌面应用也已确认。 很快 👀
Datasette 发布插件 datasette-apps:在 Datasette 中托管自定义 HTML 应用
Datasette 发布新插件 datasette-apps,允许托管自包含 HTML+JavaScript 应用。应用在严格沙箱中运行(sandbox 属性和 CSP 头),无法访问 cookies、localStorage 或外部 HTTP 请求,防止数据泄露。应用可用 JavaScript 对 Datasette 数据执行只读 SQL 查询,若配置存储查询还可写入。应用与父窗口通过...
新研究:最强LLM也无法完全免疫越狱--Fable 5与Opus 4.8自动化红队攻击分析
新研究对Anthropic Fable 5和Opus 4.8进行自动化红队攻击,持续改写有害提示词直至模型拒绝或生成坏答案。Fable 5最差攻击成功率6.1%,Opus...
医疗保健基准测试的质量取决于其隐含假设
LLM在作为医疗助手时,评估与部署场景下的性能存在显著差距--Bean等人(2025)发现准确率相差61个百分点。这一差距并非源于基准测试设计缺陷,而是因为评估协议中嵌入的隐含假设在部署时不再成立。研究提出将假设分为任务假设和结果假设两类,用以诊断差距成因并明确弥合路径:需将假设显式化、检验哪些假设在部署中成立,并据此更新评估协议。
禁止开源AI将是一个错误
近期行政命令、国会提案及对Anthropic最先进模型的境外访问限制,可能开启新一轮AI监管。开源软件已支撑全球90%以上软件并创造8万亿美元经济价值,在教育、创新和竞争三方面持续赋能。Anthropic与OpenAI的封闭模型加剧市场集中,开源(尤其开放权重)是初创公司、教育机构和企业获得替代方案的唯一平衡力量。开源透明性使其更安全,更多工程师可剔除不需要的模型行为或修复漏洞。以中国竞争为...
禁止开源AI将是一个错误
近期行政命令、国会提案及对Anthropic最先进模型的境外访问限制,可能开启新一轮AI监管。开源软件已支撑全球90%以上软件并创造8万亿美元经济价值,在教育、创新和竞争三方面持续赋能。Anthropic与OpenAI的封闭模型加剧市场集中,开源(尤其开放权重)是初创公司、教育机构和企业获得替代方案的唯一平衡力量。开源透明性使其更安全,更多工程师可剔除不需要的模型行为或修复漏洞。以中国竞争为...
99% AI芯片初创失败因软件难
100%的AI芯片初创公司都有幻灯片/"模拟性能数据"显示它们的芯片好得多,但99%的定制ASIC失败了。为什么?直到你意识到AI芯片是关于软件的,MATH才算是MATH。构建芯片并把数字放到幻灯片上相对容易;构建出色的软件很难。这就是为什么99%的AI芯片初创公司会失败。
社区开发者基于 VoxCPM2 和 ComfyUI 构建 VoiceGate,实现跨语言视频配音
社区开发者基于 VoxCPM2 与 ComfyUI 构建了 VoiceGate,实现自动语音提取(ASR)、大语言模型翻译、多语言语音合成(支持 30 多种语言和 9 种方言,含语音克隆与音色设计)、时间戳对齐音频以及背景音分离混音。核心创新 VoiceBridge 插件首次在 ComfyUI 中引入 SRT 时间戳驱动的 TTS 对齐,实现字幕级精细控制,解决 AI...
Allbirds 转型 AI 后更名为 Smartbird,新 CEO 计划部署托管计算集群
鞋履品牌 Allbirds 4 月宣布转型 AI,以 4300 万美元出售鞋业务并从股市融资 1 亿美元,更名为 Smartbird。前 AWS 高管、工程博士 Nadia Carlsten 昨日起出任 CEO,年薪 70 万美元并获价值约 900 万美元股票。Smartbird 定位 AI...
Cloudflare 为 AI 智能体推出临时账户
Cloudflare 在 Workers 上推出临时账户(Temporary Accounts),允许 AI 智能体直接运行 `wrangler deploy --temporary`,在数秒内获取一个可用的实时 Worker,无需绕开面向人类设计的部署流程。该功能旨在降低智能体部署门槛。
Cloudflare 为 AI 智能体推出临时账户
Cloudflare 在 Workers 上推出临时账户(Temporary Accounts),允许 AI 智能体直接运行 `wrangler deploy --temporary`,在数秒内获取一个可用的实时 Worker,无需绕开面向人类设计的部署流程。该功能旨在降低智能体部署门槛。