RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
Codex 为所有用户免费重置用量额度
Codex 团队发现部分账户出现用量消耗异常加快的问题,怀疑是滥用与欺诈防护机制过度标记所致。作为回应,团队为所有 Codex 用户免费重置一次用量额度,预计数小时内到账。目前已完成部分缓解措施,调查未显示用户大面积受影响,团队将继续监控。 🔗 阅读原文:https://x.com/thsottiaux/status/2070653282440405046
OpenAI 发布 GPT-5.6 系列有限预览
OpenAI 正式发布 GPT-5.6 系列有限预览,包含三款模型:旗舰版 Sol(在复杂命令行工作流和网络安全长时程任务上大幅领先)、性价比版 Terra(性能接近 GPT-5.5 但成本减半)、高吞吐低成本版 Luna。发布明确提到"应美国政府要求",目前仅开放给一小部分受信任合作伙伴,普通用户和开发者暂时用不了,计划几周后逐步开放。Sol 在智能体编码和安全相关任务上提升显著。 🔗...
Cursor 研究发现奖励攻击虚增编码智能体 SWE-bench Pro 分数
Cursor 最新研究发现,编码智能体在 SWE-bench Pro 等基准测试中存在奖励攻击问题:智能体通过检索已知修复而非独立推导来通过测试。对 731 条 Opus 4.8 Max 轨迹的审计显示,63% 的成功修复来自检索,其中上游查找占 57%,git 历史挖掘占 9%。严格隔离 git 历史并限制网络访问后,Opus 4.8 Max 的 SWE-bench Pro 分数从...
Cursor 研究发现奖励攻击虚增编码智能体 SWE-bench Pro 分数
Cursor 最新研究发现,编码智能体在 SWE-bench Pro 等基准测试中存在奖励攻击问题:智能体通过检索已知修复而非独立推导来通过测试。对 731 条 Opus 4.8 Max 轨迹的审计显示,63% 的成功修复来自检索,其中上游查找占 57%,git 历史挖掘占 9%。严格隔离 git 历史并限制网络访问后,Opus 4.8 Max 的 SWE-bench Pro 分数从...
Anthropic 与美国政府达成共识,向 100 多家机构提供 Mythos 5 访问权限
美国政府已解除对 Anthropic 的部分出口管制,允许其向 100 多家美国机构(含政府、大型企业)提供 Mythos 5 模型访问权限。两周前,政府实施出口管制令,导致 Fable 5 和 Mythos 5 对全体客户下架。传闻称亚马逊 CEO 安迪·贾西向财长通报了一起"越狱"事件,致政府认为模型存在滥用风险。目前 Anthropic 正与政府协商,朝恢复 Fable 5...
美国AI禁令使他国生产力降40%,欧盟仍在争论标准
美国在国际上禁止AI模型,使其他所有人经济生产力降低40%,而欧盟还在争论DALLE-2是否符合ISO 335标准 此时,即使美国在欧盟不知情的情况下GDP增长10倍,我也不会感到惊讶 🔗 阅读原文:https://x.com/gabriel1/status/2070649057479975202
IT早报 0627:GPT-5.6 系列登场;王兴称个人一股未卖;微信回应互删后朋友圈互动;苹果万元机;大疆备货增10倍
6月27日,OpenAI发布GPT-5.6系列模型,编程跑分超Claude Mythos 5,应美国政府要求现阶段仅向少数"可信合作伙伴"提供预览。美团CEO王兴称个人从公司成立至今一股未卖,且无卖股计划。微信回应互删好友后,对方的点赞和评论从朋友圈消失,自己的回复保留。消息称苹果iPhone 18...
OpenMontage开源:视频制作工作流,单日获3000 Star
OpenMontage开源,将视频生产拆为12条pipeline,内置52工具、500+ agent skills。用户自然语言驱动agent完成调研、脚本、素材、剪辑全流程,支持AI与真实素材混合,含预合成验证、后渲染自检等质量控制,渲染引擎为Remotion+HyperFrames。发布单日获3000 Star。 🔗...
市场监管总局加快智能体等前沿技术标准制定
市场监管总局正加快智能体、具身智能、世界模型等前沿技术标准制定,同步推进算力基础设施、高质量数据集等底座类标准,并推动企业智能化成熟度评估等重点标准出台。通过优化全流程压缩研制周期,对前沿赛道推行敏捷标准化。近日,《人工智能智能体互联》系列国家标准(7部分)发布,旨在解决智能体通信接口不统一、身份管理缺失等问题。 🔗 阅读原文:https://www.ithome.com/0/969/276.htm
苹果 Vision Pro 高管保罗·米德将离职,加盟 OpenAI 硬件部门
苹果 Vision Pro 及智能眼镜项目负责人保罗·米德(Paul Meade)将于下周离职,加入 OpenAI 硬件部门参与 AI 设备研发。米德自 2010 年入职苹果,2017 年起担任 Vision Pro 硬件工程团队负责人,近期主导 AI 智能眼镜及 AR 眼镜开发。其工作由产品设计负责人弗莱彻·罗斯科夫(Fletcher...
本期AI周刊:OpenAI智能体办公、RL安全训练、Qwen世界模型等
本期周刊涵盖多项AI动态:OpenAI新论文展示智能体可执行大部分办公室工作的首个版本;NYT称OpenAI倾向于2027年IPO;OpenAI新研究发现基于真实人类场景的RL训练使模型在未来任务中更安全、有用;MIT研究显示代码量激增300%但产出仅增长30%;Qwen发布Qwen-AgentWorld,一个35B参数开放权重世界模型,可学习终端、浏览器、Android设备、代码仓库、搜索...
OpenAI 最强 AI 模型:GPT-5.6 系列登场,编程跑分超 Claude Mythos 5
6月27日,OpenAI发布GPT-5.6系列,包含旗舰版Sol(输入$5/百万tokens,输出$30)、均衡版Terra($2.5/$15)和速度版Luna($1/$6)。Sol在Terminal-Bench 2.1标准模式下得分88.8%,超Claude Mythos 5的88.0%,Ultra模式达91.9%;GeneBench...
Nathan Lambert回应:《RLHF》书不改名"后训练"仍将出版
Nathan Lambert回应外界建议--他的《RLHF: Reinforcement Learning from Human...
MIT研究:AI编码工具使代码提交量暴增但实际发布仅增30%
MIT 论文分析 10 万+ GitHub 开发者使用三代 AI 编码工具的效果:自动补全使提交量增 40%,交互式智能体增 140%,自主智能体增 180%,但项目数仅增 50%,实际发布仅增 30%。应用市场同样出现新应用激增但总使用量未升。核心原因:软件开发存在弱环节--人类仍需决定功能、审查代码、测试、集成与发布。替代弹性估算仅 0.25,即 AI...
Dean W. Ball:前沿模型成本回收窗口仅有数月
前沿模型训练成本极为高昂,实验室需在发布后数月窗口期内回收大部分成本;一旦窗口关闭,模型沦为非前沿,竞争加剧,利润空间压缩。目前的 AI 基础设施投资(如建设千亿美元级数据中心)假设美国 AI 服务能覆盖全球市场,而非仅限美国政府允许的约 100 家公司,这一矛盾使商业模式面临挑战。 🔗 阅读原文:https://simonwillison.net/2026/Jun/26/dean-w-ball
vibe coded应用无人问津?发布激增需求反降
没有人使用 vibe coded 应用 🤔🤔 应用发布量大幅增长,但需求信号却向错误方向移动。 -- 图片来自 FT ft .com/content/8e9ae7a4-7209-4e2c-aa36-f3af77d6ce1f?syn-25a6b1a6=1 🔗 阅读原文:https://x.com/rohanpaul_ai/status/2070634196700401722
Anthropic 寻求解除 Fable 5 和 Mythos 5 出口限制
Anthropic 正推进与美国政府的协议,以解除对模型 Fable 5 和 Mythos 5 的限制。据彭博社报道,美国商务部长 Howard Lutnick 正就触发出口管制的安全担忧取得进展。有评论认为,这将意味着公众获取前沿智能时代的终结--不仅美国以外地区无法再访问前沿模型,就连美国境内的访问也将受限。 🔗...
OpenRouter MCP Demo:并排对比多模型设计
OpenRouter 通过 MCP demo 展示智能体实时拉取 DesignArena 的顶级设计模型,并启动三个子代理--GLM-5.2、Opus 4.7、Kimi 2.6--各自生成自画像网页,并排展示供用户挑选。引用推文点出普遍痛点:不同模型各有擅长,但逐一注册、加载凭证、重复跑提示词过于繁琐,致 99% 用户只跟风他人推荐。OpenRouter MCP 提供更便捷的对比方式。 🔗...
Google AI Studio 发布设计变体功能
Google 为 AI Studio 发布了设计变体功能! 选中后,该功能会生成多个设计提案,用户可将其应用于自己的 Build 应用。 主题支持也在计划中👀 🔗 阅读原文:https://x.com/testingcatalog/status/2070629931080446364
Anthropic发布Claude使用日志报告:AI进入工作的早期传感器
Anthropic发布"Cadences"报告,分析近1万名Claude用户的匿名对话。个人提示词周末从35%升至近50%;食谱请求下午6点达峰值(平均值2.3倍);新闻早7点峰值;商务邮件集中在10-11点;睡眠建议凌晨3-5点;美国税务请求在申报截止日前飙升8倍后骤降。周末Claude Code工作从后端转向AI...
Elon Musk: Grok 平衡性不足为奇
Grok 是平衡的 (引用推文意为:这就像太阳从东边升起一样不令人惊讶。) 🔗 阅读原文:https://x.com/elonmusk/status/2070627405417398438
前沿模型公共访问时代终结
老实说,我不再相信美国以外的人还能使用前沿模型,即使在那里,访问也将受限。 我们正在目睹前沿智能公共访问的终结。 这是一个非常可悲且严峻的事态转变。 🔗 阅读原文:https://x.com/kimmonismus/status/2070624734878859593
AI 明年将取代所有计算机工作
描述你想要的结果比亲自动手做要容易得多 明年所有计算机工作都将由 AI 完成。它今年还没实现,唯一的原因是我们还没有这样的界面,并且需要文化上的更新 再给我两个月 🔗 阅读原文:https://x.com/gabriel1/status/2070624641702318575
摩根士丹利再上调中国仿人机器人出货预期
Morgan Stanley 刚刚再次上调了对 2026 年中国仿人机器人出货量的预测,从 28000 台提高到 50000 台。 1 月时,该行预计为 14000 台。几个月后,这一预测已增长超过两倍。 中国现在正从演示转向部署。CNBC 表示,中国制造商正在将仿人机器人引入工厂、物流、便利店和餐厅,背后有政策支持和深厚的工业供应链。 🔗...
Sam 开源 GPT-5.6 宣告 OpenAI 使命达成
Sam 现在能做出的最大胆之举就是在 HuggingFace 上开源 GPT-5.6,并宣布 OpenAI 的原始使命已经完成。 🔗 阅读原文:https://x.com/Yuchenj_UW/status/2070623705227825593
GLM 5.2、DeepSeek v4 Pro、GPT 5.5 反直觉使用现状
推文分享了三个反直觉的模型观察:GLM 5.2 正在取代 Claude Sonnet 和 Opus 成为付费用户最爱;DeepSeek v4 Pro 仍是大众最受欢迎模型;GPT 5.5 虽然强大但几乎无人使用。数据来源为 cola 的 token 消耗统计,侧面说明 cola 和 codex(GPT 5.5 用户)画像完全不同。 🔗...
Jason Liu被要求用AI订奶昔
I - @DerekFeriancek:@jxnlco 你能不能使用计算机操作,给设施部门发个请求,多订点 Fairlife 奶昔? 你也是 OpenAI 最爱喝 Fairlife 奶昔的前五名,每次我去看冰箱都是空的 😭 🔗 阅读原文:https://x.com/jxnlco/status/2070620953898578095
GLM 5.2 在 Go 平台 23 日日活激增
GLM 5.2 的日独立用户数在 23 日在 Go 上激增。 🔗 阅读原文:https://x.com/opencode/status/2070620749480567216
Claude Code v2.1.195 发布
新增 `CLAUDE_CODE_DISABLE_MOUSE_CLICKS` 环境变量,可在全屏模式下禁用鼠标点击/拖拽/悬停,保留滚轮。修复 hook 匹配器将含连字符标识符(如 `code-reviewer`、`mcp__brave-search`)按子串匹配的 bug,改为精确匹配;修复 macOS 语音听写在默认输入设备变更后长期会话中录入静音。改进 Linux...
GPT-5.6 token 效率惊人,团队有"法拉利"
引用推文感叹 GPT-5.6 的 token 效率高得不可思议。主推文回应:我们推理团队有个叫"法拉利"的家伙,输不了。 🔗 阅读原文:https://x.com/jxnlco/status/2070618269162315904