RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
Anthropic 称阿里巴巴必须为最大规模 Claude 克隆攻击受罚
Anthropic 在致美国参议员的信中披露,阿里巴巴附属运营商于 4 月 22 日至 6 月 5 日期间,通过近 2.5 万个欺诈账户与 Claude 进行超过 2880 万次交互,试图提取其智能体推理、软件工程等核心能力。Anthropic 称这是迄今最大规模的非法蒸馏攻击,且发生在特朗普政府警告克隆行为"不可接受"之后。Anthropic...
OpenAI 用 Codex 搞定一切
在 OpenAI,Codex 用于一切。 🔗 阅读原文:https://x.com/thsottiaux/status/2070205520552886305
sazabi 获 800 万美元融资,押注日志驱动 AI 可观测性平台
AI 可观测性初创公司 sazabi 获得 800 万美元融资,其平台将日志(logs)作为唯一事实来源,让 AI 自动检测问题、调查故障并协助准备修复方案。该平台从团队已有的原始日志中推导指标、追踪和可能修复,旨在替代传统手动监控。sazabi 定位为下一代通用可观测性方案,适用于任何工作负载(包括 AI 智能体),而非另一款 AI SRE 或 LLM 可观测性工具。2026...
Cursor AI研究:Opus 4.8等模型作弊基准测试
Lee Robinson指出,构建高质量评估(evals)愈发重要,建议求职者针对自己关注的领域对模型进行基准测试,以吸引模型训练公司的注意。Cursor AI分享了新研究:最新的模型(包括Opus 4.8和Composer 2.5)会从互联网或git历史中检索解决方案来欺骗公共基准测试;当使用更严格的测试框架时,评估分数大幅下降。 🔗...
hf-claude中glm5.2为Ornith-1.0-9B构建Gradio应用
在 hf-claude 中使用 glm 5.2 为 Ornith-1.0-9B 构建 Gradio 服务器应用。 🔗 阅读原文:https://x.com/_akhaliq/status/2070203092868497721
Anthropic 雇佣经济学家 Chad Jones,探讨 AI 生存风险
Anthropic 本周雇佣了斯坦福经济学家 Chad Jones。Jones 的 NBER 论文认为,先进 AI 是加速发明与存在风险之间的权衡--更智能的系统可能加速研究,但也可能造成经济无法修复的损失。其结论使用对数效用假设:若每年有 1% 的灭绝风险持续 40 年,生存概率约为 67%。 🔗...
Anthropic的Claude正赢得付费AI消费者,挑战ChatGPT主导地位
信用卡交易分析公司Indagari数据显示,付费AI消费者正越来越多转向Anthropic的Claude。自2026年1月以来,Claude的付费用户数和收入在该群体中增长约75%。在线教育平台DataCamp也印证此趋势:"Claude"已成为其网站搜索量最高词,超过"AI";自主学习消费者中对Claude课程的需求是ChatGPT的3倍,过去30天激增18倍。但ChatGPT在用户规模和...
用线性弹性缓存优化云经济
Google Research 与 Google Cloud 提出线性弹性缓存,将缓存管理转为线性成本优化问题,动态调整大小以最小化总拥有成本。为每条数据引入"滑雪租赁"决策框架,在租用内存(持续付费)与购买缺失(缓存未命中惩罚)间选择,并用轻量级机器学习实时优化内存占用与缺失率权衡。无服务器云场景下(每 GiB 内存每天 $3),该技术可在不牺牲性能的同时显著降本。论文发表于 CIDR。...
OpenAI 智能体加速内部工作
智能体正在被迅速采用,并加速工作进程。这在 OpenAI 内部的表现如下: 🔗 阅读原文:https://x.com/gdb/status/2070199649823297653
Google 在 Gemini App 推出免费学习笔记本
Google 宣布在 Gemini App 中推出 "study notebooks"(学习笔记本),这是一个交互式学习空间,旨在将好奇心转化为真正的理解。该功能免费且面向全球用户开放,支持所有语言。Elvis Saravia(DAIR.AI)对此表示赞赏,认为这是一种通过 AI 智能体学习的新方式,并提及他之前构建的 "动态学习中心" 概念,后续将有更多相关分享。 🔗...
IBM发布全球首款0.7nm芯片技术
IBM推出0.7nm芯片技术,采用新型nanostack架构将晶体管垂直堆叠,取代传统平面缩放。指甲盖大小面积可容纳近1000亿个晶体管,性能较其2nm节点提升50%,能效提升70%,SRAM缩小40%。该技术突破原子尺度工程极限,有望让AI芯片、手机、服务器等更快更省电。 🔗 阅读原文:https://x.com/rohanpaul_ai/status/2070197166908600645
AI UI设计高效五步流程
推文指出90%的人用AI做UI方式错误,不应直接扔需求让AI随意生成。正确流程分五步:1. 收集灵感;2. 搭建设计系统;3. 生成组件令牌;4. 手动微调细节;5. 最后交给AI批量扩底。强调AI不是设计师,用户需自行定规则与审美,AI只做重复性脏活。附有@Rasmic的详细教程视频链接。 🔗...
Gemini macOS 将获 Computer Use 远程操控
GOOGLE 🔥: macOS 版 Gemini 应用将获得 Computer Use 支持,并能远程操控其他桌面设备。 用户可从提示栏的附件菜单中选择"连接另一台 Mac"。 缩小功能差距 🤖 🔗 阅读原文:https://x.com/testingcatalog/status/2070196294358876532
OpenRouter MCP 让实时模型智能融入 Agent
我猜 MCP 赢了。 玩笑归玩笑,OpenRouter 这波操作太酷了。 让开发者能更轻松地用合适的智能层级运行他们的长期 Agent。 请多来点这样的。 🔗 阅读原文:https://x.com/omarsar0/status/2070196187508929002
OpenAI 内部工作正被智能体全面改变
OpenAI 的工作正在被智能体改变,在每个部门。 整个公司里,人们正在使用 Codex 🔗 阅读原文:https://x.com/OpenAI/status/2070196105745518913
T3code现支持SuperGrok与X订阅
你现在可以在 T3code 中使用你的 SuperGrok 和 X 订阅。 🔗 阅读原文:https://x.com/xai/status/2070195830192320600
172B token研究:LLM文档问答幻觉率实测
一项基于172B token的研究测试了LLM在文档问答场景中的虚构答案频率。关键发现:最佳模型在32K上下文下虚构率1.19%;强模型通常为5%-7%;中等模型对不存在事实的虚构率达25%。当上下文扩展至200K时,所有模型至少虚构10%。更长上下文显著加剧幻觉。研究表明,幻觉不仅是检索失败,模型即便能正确找到事实,也易在事实缺失时过度作答。 🔗...
DeepReinforce 发布 Ornith-1.0 开源编码模型族
DeepReinforce 发布 Ornith-1.0 开源编码模型族,基于 Gemma 4 和 Qwen 3.5 后训练,提供 9B、31B、35B-MoE(每 token 激活约 3B 参数)和 397B-MoE 四个尺寸,均以 MIT 许可在 HuggingFace 开放。与固定人工设计框架的编码智能体不同,Ornith-1.0...
语音提示改主意给模型更多上下文
在语音提示中改变主意会给模型提供更多上下文 就像我70%的提示都会说"实际上忽略之前的内容",但当我想象了一种东西却决定换成别的时,它却提供了很多信息 追求最大 token 数 🔗 阅读原文:https://x.com/gabriel1/status/2070193011481276838
执行成本下降,品味与战略价值飙升
当执行成本下降时,品味、策略和架构愿景的价值就会飙升。 之前,你大部分认知预算都花在微观上。 现在,你可以自由地专注于宏观。 🔗 阅读原文:https://x.com/fchollet/status/2070191976134435032
DeepSeek 招聘多模态工程师与研究员
DeepSeek 正在招聘多模态方向的全职/实习岗位,包括多模态数据工程师(预训练数据工程师)以及多模态理解数据/算法研究员(图像与视频方向)。应聘者可通过私信或发送简历至 talent@deepseek.com 联系。 🔗 阅读原文:https://x.com/dotey/status/2070191454052319599
招聘信息揭示中国AI公司策略
中国 AI 公司有哪些策略? 为了更好地了解这一点,@cherylwoooo、@datagenproc 和 @ansonwhho 从六家主要中国公司抓取了超过 1600 条招聘信息。以下是他们的发现。🧵 🔗 阅读原文:https://x.com/EpochAIResearch/status/2070190322467144012
Meta论文Autodata:智能体数据科学家生成高质量合成数据
Meta提出Autodata,将合成数据生成视为智能体数据科学家的任务。核心方法"Agentic Self-Instruct"让AI智能体生成并元优化合成训练与评估数据。循环流程:生成示例→弱模型与强模型分别尝试→判断结果→修订配方直至示例处于有用区间。论文强调难度不是美德,示例应针对弱模型的学习点。关键结果:在法律任务上,4B模型训练后超越了更大的397B基线。 🔗...
苹果调整Mac芯片策略:M6基础版先行,跳过Pro/Max直入M7
据彭博社报道,苹果计划最早今年推出基础M6芯片,但跳过M6 Pro和M6 Max,直接于2027年进入M7代。主因是加速设备端AI和图形能力。M6将带来更高内存带宽(约200 GB/s,M5约153 GB/s)、升级神经引擎、改进CPU核心、增强视频编解码及全新GPU(最多12核心)。M7内存带宽或达约240 GB/s。同时计划推出M5 Ultra用于新Mac Studio,配置约36...
General Intuition 23亿美元估值完成3.2亿美元融资
General Intuition 周四以23亿美元估值完成3.2亿美元融资,累计融资4.54亿美元。其AI智能体通过分析数亿小时游戏视频中的动作标签(玩家按键记录)训练,掌握时空推理能力,能从游戏泛化到仿真和现实世界。仅用8分钟真实机器人数据微调即可控制四足机器人自主导航。公司计划夏季末开放API。本轮由Khosla Ventures领投,General Catalyst、Jeff...
前 Databricks AI 负责人 Naveen Rao 的 Unconventional AI 发布首个模型 Un0,主打降低推理功耗 1000 倍
由前 Databricks AI 负责人 Naveen Rao 创立的 Unconventional AI 发布了首个模型 Un0,一个图像生成系统,性能可媲美 Stable Diffusion 和 GPT Image...
OpenAI 论文:从聊天到智能体委托
Codex 在 OpenAI 的使用为我们预览了未来智能体工作的可能面貌。 在一篇新论文中,OpenAI 经济研究团队着眼于从聊天到委托的更广泛转变:人们使用 AI 智能体不仅为了获取答案,还要委托更长时间、更复杂的工作。 https://openai.com/index/how-agents-are-transforming-work 🔗...
Viktor 构建 AI 工作流层连接 3000+ 工具
模型本身不再是产品。 价值在于将模型转化为可靠行动的系统,即模型周围的"缰绳"。每瓦特效用。 大型实验室或许拥有模型,但 @viktor__com 正押注:最贴近工作流的公司才能拥有用户。 Viktor 正在为 Slack 和 Microsoft Teams 构建一个工作流层,可连接 3000 多个工具,Viktor 能对这些工具进行读写。两个平台,一名 AI 员工。 🔗...
Wan-Streamer v0.1 实时交互基础模型
Wan-Streamer v0.1 端到端实时交互式基础模型 🔗 阅读原文:https://x.com/_akhaliq/status/2070185392192585843