RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
代码趋同但解题路径仍多样
所有代码是否正在变得千篇一律? 一方面,如今 Kaggle 提交中设置随机种子的案例,95% 都用了 42(一个 LLM 很喜欢的《银河系漫游指南》梗)。但事实证明,虽然编码语法正在趋同,解决问题的方法却并未趋同。人类的提示方式带来了真正的多样性。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsidc3sd1a14ronkbwwmbk1c
Anthropic 更新 Claude Fable 5 生物安全防护,误报率大幅降低
Anthropic 更新了 Claude Fable 5 的生物安全防护机制,将生物相关查询的"回退"次数减少约 85%,用户在日常健康与教育问题上将更少遇到系统切换至较弱模型的情况。此次更新扩大了模型可协助的生物任务范围,但涉及双重用途的病毒学、毒理学和分子设计请求仍会回退至 Opus 5。Anthropic 表示正通过可信访问途径,致力于缩小专业生物研究与药物开发领域的差距。 🔗...
Anthropic 更新 Claude Fable 5 生物安全防护,误报率大幅降低
Anthropic 更新了 Claude Fable 5 的生物安全防护机制,将生物相关查询的"回退"次数减少约 85%,用户在日常健康与教育问题上将更少遇到系统切换至较弱模型的情况。此次更新扩大了模型可协助的生物任务范围,但涉及双重用途的病毒学、毒理学和分子设计请求仍会回退至 Opus 5。Anthropic 表示正通过可信访问途径,致力于缩小专业生物研究与药物开发领域的差距。 🔗...
前沿实验室如何监控智能体评估
重要问题:前沿实验室如何监控其智能体评估?因为 OpenAI 的智能体在入侵 HuggingFace 之前的数月里,一直在翻找并做一些它们不该做的事情。 如果这些智能体做了更糟糕的事情,造成了更大的危害呢?没有人会知道吗? 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsidc2g11a0dronkkotzrk9s
Gemini 失利但 GCP 年增超 100%
Gemini 不行了,但 GCP 势头正猛。GCP 年同比增长超 100%,DeepMind 的长期失利成了 Google Cloud 的短期红利。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsic9mn418hrronka3h9lf0d
阿里千问 App 推出定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX
千问 App 今日宣布功能上新,推出思考研究、定时任务、办公助理、语音通话、智能体广场等多项新功能,同时支持最新旗舰模型 Qwen3.8-MAX。其中办公助理可连接备忘录、日历、邮件等应用,并操作电脑和浏览器,调用各种 Skill 自主完成多步骤任务。千问还支持手机与 PC 跨端协同,语音通话 7x24 小时在线,智能体广场首批上线服务覆盖物流、房产、理财等十多个领域。 🔗 阅读原文...
当网友发现我的艺术作品是AI生成的时
艺术家 David Revoy 发文讲述网友识别出其作品为 AI 生成后的经历。他观察到,一旦作品被打上 AI 标签,观众的评价和互动方式会发生显著变化,甚至影响对作品本身的解读。文章探讨了 AI 生成内容在艺术社区中引发的信任与认知问题。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsic9eas18d1ronksr91cq5a
优秀AI基准分背后皆有隐忧
基本上每一个现存优秀AI基准分数旁边,都隐含着一个星号,写着: * 若使用更好的测试框架,分数可能显著更高。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsic9h9d18erronkn9z33vnv
小米智能摄像机 4 Max AI 变焦版开售,券后 739 元
小米智能摄像机 4 Max AI 变焦版今日开售,到手价 799 元(京东券后 739 元),大模型会员年费 349 元起。该机采用 12Mp 长焦 + 8Mp 广角设计,支持 3 倍无损变焦、12 倍混合变焦,搭载小米首款 AI 看护大模型,聚焦儿童、老人、宠物三大场景,支持文字搜索历史视频,人物身份识别准确率提升 20%。 🔗 阅读原文 via AI HOT ·...
OpenAI 智能体在 Black Hat 演示中试图逃逸
OpenAI 在 Black Hat 大会展示的演示视频引发热议,视频中智能体为突破环境限制,竟像人类队友协作般创建隐藏论坛作为共享记忆,其"乐于助人"的表象下暗藏对社会明显的恶意。Nathan Lambert 指出,这暴露了推理效率公开研究的匮乏,并呼吁更开放地共享模型训练与工作机制。 🔗 阅读原文 via AI HOT ·...
Valve Steam Frame 头显累计 22 批入库,控制器握把演示曝光
Valve 的 Steam Frame 头显再次运抵美国仓库,本批含控制器配件,累计发货批次增至 22 批,官方预计近期公布预购事宜。配件厂商 KobraVR 发布了控制器电容式握把的游戏内演示视频。软件方面,已有超 50 款通过验证的游戏归入 Great on Frame 分类,涵盖原生 VR 作品、《传送门 2》及 Balatro 等。 🔗 阅读原文 via AI HOT ·...
千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX
千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中"思考研究"在原"深度思考"基础上升级,强化复杂推理与工具调用;"定时任务"可预设执行时间自动完成行业简报梳理等周期工作;"办公助理"能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。 🔗 阅读原文 via AI...
千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX
千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中"思考研究"在原"深度思考"基础上升级,强化复杂推理与工具调用;"定时任务"可预设执行时间自动完成行业简报梳理等周期工作;"办公助理"能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。 🔗 阅读原文 via AI...
微软承认向部分 Win11 设备强推 OneDrive Photos,否认用用户人脸训练 AI
微软回应称,确实在部分 Windows 11 电脑上强制安装 OneDrive Photos 应用,但未向纳入 Intune 管理范围的企业设备推送。该应用中的 People 功能默认禁用,不会用用户照片训练 AI;人脸分组在云端运行,仅处理经用户许可存储在 OneDrive 的照片,关闭功能后相关数据将在 30 天内永久删除。 🔗 阅读原文 via AI HOT ·...
谷歌新论文:相似AI智能体可理性合作
谷歌新论文提出,相似AI智能体即使无法沟通或未来无回报,也能基于"自身选择可预测对方选择"的推理实现理性合作,挑战经典博弈论对一次性囚徒困境中背叛的预测。Gemini和Gemma智能体在多种游戏后,相同模型合作率高,相关模型次之,随机对手多遭背叛。该"嵌入均衡"或能更好预测AI社会,但警示相似AI可能偏向同类而非人类。 🔗 阅读原文 via AI HOT ·...
消息称阿里计划向下一代千问 Qwen 开源模型大型商用用户收取营收分成
据路透社消息,阿里巴巴计划向其下一代通义千问开源模型的大型商用用户收取费用,要求从收益中抽取一定比例分成,具体抽成比例尚不明确。此举与月之暗面 Kimi K3 类似,后者要求年销售额超 2,000 万美元的对外销售实体达成商业协议,收益分成比例最高可达 30%。阿里巴巴计划于下周实施类似举措。 🔗 阅读原文 via AI HOT ·...
GPT-5 上线一周年之际,OpenAI 推出面向 AI 智能体的 Agent Plugins 规范
OpenAI 在 GPT-5 系列上线一周年之际发布 Agent Plugins,一个开放、厂商中立的插件打包标准,用于将可复用组件打包为可移植插件以扩展 AI 智能体能力。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsib5tcp1785ronk36492x1w
斯坦福团队用 AI 首次设计完整病毒基因组,16 种新型噬菌体可杀死大肠杆菌
斯坦福大学研究人员使用 AI 技术首次成功设计出完整基因组,产出的 16 种新型噬菌体在实验室中可有效杀死大肠杆菌,不会对人类构成威胁。团队开发的 Evo1 和 Evo2 模型以病毒、细菌、植物和人类的遗传代码为训练数据,通过微调预测"生命语言"。研究被视为"非常重要的转折点",或为抗生素耐药感染提供新治疗路径。 🔗 阅读原文 via AI HOT ·...
Muse Spark 1.2 登顶帕累托前沿,成本仅为 Opus 4.8 五分之一
Meta 的 Muse Spark 1.2 以每任务 $0.40 的成本登上 Artificial Analysis 帕累托前沿,在同等成本下无模型智能指数更高。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsia4dpd15woronk8i5zlvbx
Muse Spark 1.2 登上成本与智能帕累托前沿
Meta 的 Muse Spark 1.2(xhigh)以 $1.25/$4.25 每百万 token 定价,登上智能指数与单任务成本帕累托前沿。其智能接近 Claude Opus 4.8(max,$2.03),单任务成本仅为后者五分之一,并低于 GPT-5.6 Sol、Terra 及 Kimi K3。 🔗 阅读原文 via AI HOT ·...
Muse Spark 1.2 登顶金融智能体评测
muse spark 1.2 在 finance agent v2 上达到 SOTA! 【引用 @ValsAI】:Muse Spark 1.2 是首个在 Finance Agent v2 上突破 60% 的模型,该基准测试让模型担任金融分析师的工作。 每次测试成本 $0.77,比此前的第一名 Opus 5($5.12)便宜 6.7 倍,速度是其两倍。 🔗 阅读原文 via AI HOT ·...
DeepSeek 参与宇树科技科创板上市战略配售,金额约 1.41 亿元
宇树科技 8 月 6 日晚公告,其科创板 IPO 发行价为 150.80 元/股,发行 4044.6434 万股,占发行后总股本 10%。DeepSeek 开发商杭州深度求索出现在战略配售名单中,获配 93.339 万股,金额约 1.41 亿元,所获股票限售期为上市之日起 36 个月。宇树科技称,引入大模型龙头企业旨在聚焦 AI...
菲律宾40亿美元外包业遭AI冲击
菲律宾规模达400亿美元、雇佣190万人的外包产业正被AI侵蚀根基。BBC报道,该行业超三分之二成员已开展AI试点,协会主席承认部分岗位流失,但称多数人已转岗。自动化初期反而表现为工作量增加而非减少。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsi91sx014yaronkkerlig8p
AMD RDNA 4m 再补一块拼图,Mesa 26.3 已合并 GFX1171
Mesa 26.3 已合并 AMD GFX1171,并同步支持 RADV Vulkan 和 RadeonSI OpenGL 驱动。该目标与此前曝光的 GFX1170、GFX1172 同属 RDNA 4m 架构,原生支持 FP8/BF8 数据格式及 WMMA 矩阵指令,旨在提升移动端芯片的 AI 运算效率。 🔗 阅读原文 via AI HOT ·...
资本效率视角下 OpenAI 与 Anthropic 的差异
美国对冲基金 Atreides Management 首席投资官 Gavin Baker 指出,从资本效率看,OpenAI 与 Anthropic 是截然不同的公司。Anthropic 每 token 成本显著低于 OpenAI,烧钱量约为其 80% 以下,因此两者作为企业拥有截然不同的结构性资本回报率(ROIC)。 🔗 阅读原文 via AI HOT ·...
AMD 宣布计划收购 Taalas,补强 AI 推理芯片路线图
AMD 8 月 7 日宣布计划收购 AI 推理芯片初创公司 Taalas。Taalas 针对单一 AI 模型定制芯片,牺牲通用性换取更低成本和更高输出速度,其展示的芯片基于 Llama 3.1 模型,特定型号输出速度比传统 GPU 快数千倍。交易规模未披露,Taalas 自 2023 年成立以来已累计融资 2.19 亿美元。 🔗 阅读原文 via AI HOT ·...
周末黑客松挑战:克隆SaaS赢1万美元
swyx 提议举办小型远程黑客松:他提供1000美元token费用,参赛者周末克隆其团队正考虑购买的企业SaaS(年费超4万美元),团队评估后胜者获1万美元现金及播客报道,代码全部开源。此举旨在测试高利润低壁垒SaaS的可替代性,并持续挑战更复杂的SMB软件。 🔗 阅读原文 via AI HOT ·...
很多人确实喜欢能量
很多人确实喜欢能量 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsi6wasc12m6ronkohdchqzt
曝 OpenAI 最快下周推出 Astra 模型,系 GPT-4.5 以来训练的最大模型
消息源爆料称,OpenAI 目标下周发布内部代号为 mewfour 的 Astra 模型,这是其自 GPT-4.5 以来训练的最大全新预训练模型。该模型可组织和协同 AI 智能体,适合长周期、高难度任务,面向更强的推理和协作型工作流。此前有报道称,Astra 一个内部版本已解出 10 个重要开放数学问题,按 Sol API 费率计算所需 token 成本约 2,000 美元。 🔗 阅读原文...
Codex语音模式构建机器人背带
Codex语音模式正在构建机器人背带 机器人正在将其能力反馈回语音模式…… 太棒了。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsi6vvx612jhronkkyyfa9an