RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
DeepSWE 基准测试发布,GLM-5.2 与 Kimi-K2.7-Code 分别成为国产编程 SOTA 与性价比 SOTA
DeepSWE 基准测试发布榜单,GLM-5.2 为国产编程大模型 SOTA,Kimi-K2.7-Code 为性价比 SOTA。该榜单与 SWE-Bench-verified 不同:问题由人工针对开源项目制造,可避免数据泄露;每个问题需修改上百行代码,考验模型规划能力,且不提供工具指引,更贴近真实工程场景。覆盖 TypeScript、Go、Python、JavaScript、Rust...
PINE64 推出 PineVoice 智能音箱:基于 RISC-V 处理器,支持本地唤醒词检测
开源硬件制造商 PINE64 于本月 19 日推出 PineVoice 智能音箱,售价 49.99 美元(约 339.4 元人民币),可加购 14.99 美元的 Zigbee 加密狗。该音箱集成双麦克风阵列、音量控制和硬件麦克风静音按钮,基于博流智能 BL606P 无线多模网关芯片(含玄铁 C906 和 E907 内核),拥有 788KB SRAM、32MiB pSRAM 和 16MiB...
华为笔记 App 完成鸿蒙 PC 版适配,正式上线电脑端 App Gallery
华为笔记 App 已完成鸿蒙 PC 版本适配,正式上线鸿蒙电脑的华为应用市场 App Gallery。该应用是华为自研笔记软件,搭载专业笔刷引擎,内置多款笔刷和编排工具,支持实时 AI 字迹调整、无界笔记、自由作图、多人语音转写、手写公式 AI 识别、圈选小艺解题、智能摘要等功能。华为终端平板与 PC 产品线总裁朱懂东在 HDC 2026...
Nature研究:AI或削弱专业人士硬技能
一项发表于《自然》的研究指出,AI虽能节省时间,但可能削弱专业人士依赖的硬技能。波兰结肠镜研究显示,引入AI工作流后,有经验内镜医师独立操作的腺瘤检出率从28.4%降至22.4%。AI并非让人瞬间疏忽,而是改变了技能培养的"摩擦"机制--从主动搜索变为被动确认。类似现象也出现在软件开发中:一项2026年随机研究发现,AI辅助虽帮开发者完成任务,但过度委派削弱了概念理解、代码阅读和调试能力。...
郭明錤:谷歌开发 TPU v9 芯片推理优化升级款,联发科接单
郭明錤6月22日称,谷歌将在TPU v9基础上升级推理优化版,代号或为"Triggerfish",由联发科独家接单。该芯片旨在缓解"CPU墙"与"内存墙",片内SRAM缓存为原版2~3倍,片外DRAM升级至HBM4E。预计2027年底投产、2028年底放量,生命周期出货100~200万颗,单价高出约三成。此外引入"simulation die",可能用于本地TPU管理、训推切换等。 🔗...
海立开源第三本Agent书籍《Deep Agents in Action》
海立老师写书速度真快,开源了第三本书《Deep Agents in Action》。 如果你对Agent开发感兴趣,可收藏学习,很好的资料。 🔗 阅读原文:https://x.com/vista8/status/2068935883575754913
AI末日论被指为行业高估值提供依据,GLM-5.2等实际技术进展被忽略
作者在Berkeley观察到AI圈陷入"末日论"狂热,认为Anthropic等公司通过渲染AI急速发展、递归自我改进可能提前到来等恐慌来支撑估值,而非聚焦实际技术。相比之下,GLM-5.2博客展示了渐进改进的技术进步,该模型与Opus...
AI HOT 日报 · 2026-06-22 — 美团tabbit国际版免费接入GPT-5.5/Claude Opus 4.8等旗舰模型
美团tabbit国际版免费接入GPT-5.5/Claude Opus 4.8等旗舰模型 — 点击查看完整日报
Grok Build 推出 /goal 模式,支持长时间自主任务执行
xAI 在 Grok Build 中引入 `/goal` 新模式。用户只需用一行命令设定目标,agent 便会自动规划方案、分解任务为进度清单并持续执行,直至目标完成且通过验证,期间可额外下达指令。该模式支持监控与引导命令,任务完成时清单全部勾选。即日起可用,用户可通过 `curl -fsSL | bash` 安装 CLI 并登录账号即可使用。 🔗...
HAKARI-Bench:统一条件下比较检索架构与效率设置的轻量级基准
HAKARI-Bench 是一个轻量级检索基准,将现有检索套件重建为小型数据集(Nano-sets),涵盖 35 个基准、551 个任务和 43 种语言,采用统一格式实现模型无关比较。它支持 BM25、稠密、稀疏、晚交互和重排序五种检索家族及其效率变体(降维、量化等)在同一条件下对比。在 55 个模型上,整体排名与 MTEB retrieval v2、MMTEB v2 retrieval...
我们用免费本地模型对 OpenClaw 仓库进行实时分类
Hugging Face 在 OpenClaw 仓库上测试用 Gemma 和 Qwen 等本地模型实时分类 issue 和 PR。他们使用 Pi agent harness 驱动模型,配合 reposhell 只允许读操作防止提示词注入。测试的模型包括 gemma-4-26b-a4b 和 qwen3.6-35b-a3b,经性能优化后均可在本地生成数百 token/s。该方案运行在...
能力强但粗心:计算机使用智能体是否遵循情境完整性?
AgentCIBench评估计算机使用智能体(CUA)是否遵循情境完整性。它针对三种常见失败模式:视觉共置(智能体拉取任务目标旁边被禁止的项目)、任务模糊性过度分享(在提示不明确时泄露个人状态)以及收件人错配(向不适当的收件人发送内容)。对15个前沿CUA的评测显示平均泄漏率67.9%,其中11个在超过50%的场景中泄漏,这些失败在端到端任务中同样存在。AgentCIBench已发布,旨在推...
NSA局长:Mythos数小时内攻破其几乎所有机密系统
美国NSA局长称,Mythos在数小时内攻破了其几乎所有机密系统。此前Mythos已在5天内破解MacOS。而顶级漏洞团队Google Project...
美团tabbit国际版免费接入GPT-5.5/Claude Opus 4.8等旗舰模型
美团近期上线tabbit国际版应用,免费集成多家顶级AI模型的最新旗舰版,包括GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash,以及国内Kimi-2.6、GLM-5.1、MiniMax-M3。用户无需单独订阅即可使用这些模型。需注意:只有国际版包含海外模型,国内版仅提供国内模型。该应用旨在抢占AI入口,目前处于免费推广阶段。 🔗...
腾讯元宝父亲节活动:上传照片生成与年轻爸爸的合影
腾讯元宝推出父亲节主题活动,用户可选择爸爸年轻时照片与自己的照片,输入提示词(如"帮我生成一张和爸爸的合影,将图2的我融合到图1爸爸的照片中,我想穿越回__年前,和他一起_____;保留爸爸照片的背景、动作及五官;人物姿态自然协调,整体光线与色调保持一致"),元宝即可生成合影。活动旨在让用户"回到过去"看到爸爸的青春模样。 🔗...
AI HOT 日报 · 2026-06-21 — 微软双向转售GPT与DeepSeek成全球最大AI中间商
微软双向转售GPT与DeepSeek成全球最大AI中间商 — 点击查看完整日报
Anthropic IPO或延迟,OpenAI抢跑融资
在这一点上,我很容易看到围绕Anthropic的戏剧性事件会迫使其推迟IPO,而OpenAI则竭尽全力抢先上市并在此过程中筹集更多资金。
从PGP到Mythos:出口管制未能阻止任何人的简史
美国白宫以国家安全为由,命令Anthropic限制AI模型Fable 5和Mythos出口,导致两款模型暂停向美国境外用户及境内外国公民提供服务。此前Anthropic仅向约150家受审查企业和政府机构开放Mythos。触发禁令的两个事件:Anthropic向一家被怀疑与中国有关联的韩国电信公司(普遍报道为SK电信)提供Mythos访问权限;亚马逊CEO称其研究人员找到了绕过Fable...
特斯拉AI工程师:ML训练仅占2%,数据质量定上限
特斯拉AI高级工程师(从事自动驾驶与机器人ML)揭露ML项目真实时间分配:50%评估、40%数据清洗、8%集成、2%训练。前两项共同设定学习的噪声底限,模型无法降低--这是数据的香农最优界。他每天思考本体论(ontology),旧标签必须持续审查,因为生产系统中分布漂移与边缘用例不断暴露标签缺陷。核心结论:训练不是瓶颈,清理现实数据的能力才是关键。
欧洲零售协会要求欧盟豁免非欺骗性AI广告的"深度伪造"标注义务
欧洲零售协会Eurocommerce(成员包括Amazon、H&M、Inditex、Ikea)致信欧盟科技专员Henna Virkkunen,要求对非欺骗性AI生成广告图像豁免EU AI...
AlphaFold 之父 John Jumper 离开 Google DeepMind,加入 Anthropic
诺贝尔化学奖得主、AlphaFold 团队负责人 John Jumper 宣布离开 Google DeepMind,加入 Anthropic(休息一段时间后)。他在 GDM 工作近 9 年,博士毕业仅 6 个月便被 Demis Hassabis 委以重任领导 AlphaFold,实现了蛋白质结构预测突破。此前已有大批 OpenAI 核心研究员流入 Anthropic,Jeff Dean...
Claude Mythos出口管制后约200家美国机构仍保留顶级AI访问权限
美国对Anthropic最强模型Claude Mythos实施出口管制后,仍有约200家早期用户(包括部分银行、Cisco、Dragos等)保留访问权限,普通用户和大多数组织已被挡在门外。据Bloomberg报道,这200家机构手握外界无法触及的顶级AI能力,形成"永久底层阶级"式的AI鸿沟。差距不是简单API购买能力能弥补,普通用户甚至见不到这些模型。
GLM-5.2 与 Fable 5 测评:五十分之一价格实现九成效果,开源模型跨过"够好且便宜"线
同一任务、同一 prompt、同一参考图下,GLM-5.2(价格 <$0.10)效果接近 Fable 5(约 $5)的九成,价格仅为后者五十分之一。作为最强开源模型,GLM-5.2 体积从 1.5TB 压缩 84% 至 238GB,可在 256GB Mac 本地运行,保留 82% 能力。当开源模型跨过"够好且便宜到随便用"的线,设计探索第一步的默认选项可能从 Fable 转向 GLM-5.2。
GLM-5.2势头猛,开源LLM或胜闭源
Fable 仍未回归(遗憾)。与此同时,GLM-5.2 变得非常出色。 如果 Fable 或 GPT-5.6 因安全风险无法发布,而 Kimi K3 或 GLM-5.3 率先推出,那么开源大语言模型或许有机会击败公开的闭源模型。
DeepMind内部爆料:实验室陷入焦虑,前沿模型落后至第五位
Google DeepMind内部员工爆料,实验室已陷入严重焦虑与不满。当前DeepMind在Artificial Analysis智能指数仅列第五,落后Anthropic、OpenAI及智谱AI。上一次重大模型更新是4个月前的Gemini 3.5 Flash,实际表现大多未超越2月的Gemini 3.1 Pro。原定6月30日发布的Gemini 3.5...
Codex 实现本地远程线程无缝切换
现在 Codex 能将代码线程从笔记本无缝 handoff 到远程服务器,再随时接回。过程自动打包 Git 状态、未提交变更、分支、工作树等全部上下文,无需手动 sync 或重建环境。该功能消除了本地开发与远程重型计算之间的摩擦,让 agent 自动管理状态流动,用户可根据需要自由切换场景。
诺贝尔奖得主John Jumper离开DeepMind加入竞争对手Anthropic
诺贝尔化学奖得主John Jumper宣布离开Google DeepMind,加入竞争对手Anthropic。他在DeepMind工作近9年,曾领导AlphaFold团队,该团队因蛋白质结构预测模型获2024年诺贝尔奖。据Bloomberg报道,Jumper还参与谷歌编程工具开发。此外,Character AI联合创始人Noam Shazeer本周也离开DeepMind,转而加入OpenAI。
Steam Controller 可完成此操作
可以用 Steam Controller 完成此操作。主推文呼吁有人将此事与 codex 联系起来 @Dimillian。
Kim 发布微软 Build 大会 Vlog
我做了一个微软 Build 大会的 Vlog。来看看吧!:) https://www.youtube.com/watch?v=HxSbcXuPAnI