RSS

  • 宝玉的分享
    https://baoyu.io/feed.xml
    刷新于
  • AIHOT 日报
    https://aihot.virxact.com/feed/daily.xml
    刷新于
  • AIHOT — 全部 AI 动态
    https://aihot.virxact.com/feed/all.xml
    刷新于
  • AIHOT — 精选
    https://aihot.virxact.com/feed.xml
    刷新于

SkillComposer:将代码Agent技能组合视为联合决策的论文

论文提出SkillComposer,将代码Agent的技能选择与组合视为一次联合决策,用约束自回归解码器一次生成完整技能计划(包括技能、数量与顺序),自然处理技能间依赖。在SkillsBench上,使用GPT-5.2-Codex和Gemini-3-Pro-Preview,pass rate分别提升+23.1和+18.2个百分点,超过top-3检索,并以更低prompt...

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

Fable 5重置5小时与周速率限制

由于 Fable 5 已准备好(再次)构建,我们重置了每个人的 5 小时和每周速率限制。 🔗 阅读原文:https://x.com/ClaudeDevs/status/2072429181565288665

noreply@aihot.virxact.com (X:Claude Devs (@ClaudeDevs))

OpenAI从GPT-5教训:预分类路由易致糟糕结果

Ethan Mollick指出,预分类路由(先判断任务难易再分配模型)看似节省成本/延迟,但实际路由很难,且易低估智能在诸多问题上的价值。OpenAI在GPT-5上已吸取此教训,如今这类思路再次流行。@MParakhin补充:要可靠运行预分类器必须先解决任务本身,唯一正确方式是采用顾问模型(advisory model)方法。 🔗...

noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))

使用 Lift 将研究 PDF 转换为结构化 JSON:受控的、模式引导的字段级评估

Lift 是一个 PDF 到结构化数据的提取工具,本教程构建了完整的受控评估工作流。通过 4-bit NF4 量化,约 10B 参数模型可在 16 GB GPU(如 T4/L4)上运行。教程生成含干扰项的合成多页研究论文,测试模型在真实文档布局中恢复标题、作者、数据集、指标、超参数、局限性和仓库链接的能力,并输出结构化 JSON,实现模式引导的字段级评估。 🔗...

noreply@aihot.virxact.com (MarkTechPost(RSS))

Claude Sonnet 5在AA-Briefcase基准上仅次于Fable 5

Anthropic发布Claude Sonnet 5。在AA-Briefcase(智能体知识工作基准,测试模型处理数千文件并产出表格、演示和UI原型)上,Sonnet 5 (max)得1391 Elo,较Sonnet 4.6 (max)提升312分,排第二,仅次于Fable 5。提升来自rubric评分与分析质量,呈现仍落后Opus...

noreply@aihot.virxact.com (X:Artificial Analysis (@ArtificialAnlys))

OpenCode Zen 现已可用

现已在 OpenCode Zen 中上线。 🔗 阅读原文:https://x.com/opencode/status/2072427314709737490

noreply@aihot.virxact.com (X:opencode (@opencode))

模型组合使用优于直接比较

没有如果。你可以直接将最新的OpenAI模型(甚至GPT-5.5)与Opus-4.8 / GLM-5.2等其他模型组合,就足够了。GPT-5.6或下一个前沿模型只会进一步提升。直接比较模型是未来错误的思考方式。 🔗 阅读原文:https://x.com/omarsar0/status/2072421976279269884

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

Ethan Mollick:预分类路由易低估智能价值

Ethan Mollick 指出预分类路由器(pre-classifying routers)会导致糟糕结果,因为路由本身很难,且常低估智能的价值。OpenAI 在 GPT-5 上已吃过亏,如今这类思路又热起来。引用的 @MParakhin 也认为,用预分类器先判断任务是否简单再调用小模型看似省钱省延迟,但可靠执行必须先解决任务本身,唯一可行的是 advisory model...

noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))

Claude Code v2.1.198 发布

Claude Code v2.1.198 更新。Claude in Chrome 现已全面可用。为 claude agents 新增后台智能体通知(agent_needs_input / agent_completed)。新增 /dataviz 技能,提供图表与仪表盘设计指导及配色验证器。Gateway 增加 AWS 上的 Claude Platform 作为上游提供商。后台智能体在...

noreply@aihot.virxact.com (Claude Code:GitHub Releases(RSS))

Claude Code v2.1.198 发布

Claude Code v2.1.198 更新。Claude in Chrome 现已全面可用。为 claude agents 新增后台智能体通知(agent_needs_input / agent_completed)。新增 /dataviz 技能,提供图表与仪表盘设计指导及配色验证器。Gateway 增加 AWS 上的 Claude Platform 作为上游提供商。后台智能体在...

noreply@aihot.virxact.com (Claude Code:GitHub Releases(RSS))

Fable 5 回归,用户原谅 Sonnet 5 发布不佳

Fable 5 回归。 用户表示:原谅 Anthropic 糟糕的 Sonnet 5 发布,Fable 5 太有趣了。 🔗 阅读原文:https://x.com/kimmonismus/status/2072421118833557786

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

Anthropic 恢复部署 Claude Fable 5,新增安全分类器

Anthropic 于 7 月 1 日面向全球用户恢复部署 Claude Fable 5。此前 6 月 12 日,因 Amazon 研究人员发现绕过安全护栏的方法,美国出口管制生效,Anthropic 暂停了 Fable 5 和 Mythos 5。6 月 30 日管制解除。Anthropic 新增安全分类器,对该技术的阻止率超 99%,被拦截请求将路由至 Claude Opus 4.8...

noreply@aihot.virxact.com (MarkTechPost(RSS))

反帕兰提尔宣言

哲学家CEO Harry Halpin发表15条宣言,批判Palantir等公司将互联网监视技术用于国家暴力,形成科技法西斯主义。指出外部安全威胁驱动的监控最终会转向内部移民、异见者乃至全体民众;呼吁程序员承担全球道德责任,用去中心化代码保护隐私、对抗监控;反对全面自动战争与核战争,认为程序员应建设赋能个人自由的工具,而非为腐败统治者服务。 🔗...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

Meta 研究:量化推理模型因自我怀疑导致过度思考,小幅惩罚可缓解

Meta 新论文发现,后训练量化虽能缩小推理模型、降低部署成本,但会导致模型在已得出正确答案后反复自我怀疑,浪费 token。量化在不确定的词选择上引入噪声,使模型更倾向使用"wait""but""alternatively"等词重新开启推理。在 5 个推理模型(1.5B-32B)的数学、编程和科学任务上,激进量化使过度思考失败率最高达 52%。通过给 50 个犹豫词施以小惩罚,可剪掉...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

Fable 5热度消退预测:组合AI模型更优

作者预测Fable 5的兴奋感将迅速消退,并提醒用户注意token限制和功能局限。建议通过组合多个AI模型(如Opus 4.8用于规划、GPT-5.5用于执行)获得相同或更好效果,也可混合前沿开放权重模型。此外,将任务分解为更小子步骤以提升质量的方法常被低估,这正是动态工作流的重要性所在。 🔗 阅读原文:https://x.com/omarsar0/status/2072417588630503487

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

SemiAnalysis:推理不断被切分,每次切分都让智能更便宜

SemiAnalysis 指出推理正被多轮"切分"以降低成本。第一步按阶段拆分:prefill 与 decode 用不同芯片;第二步按层拆分:attention 用 HBM 富裕的 GPU,前馈网络用 SRAM 基芯片;第三步按时间拆分:工作负载切片为执行窗口,在集群中交错调度。每次切分回收闲置利用率,从而降低每 token 成本。更便宜的 token 不会压缩需求,反而刺激增长--这是...

noreply@aihot.virxact.com (X:SemiAnalysis (@SemiAnalysis_))

Kimi K2.7 登陆 Cursor 可试用

You can now try Kimi K2.7 in Cursor! 我们的评测结果如下 ↓ 与 GLM 5.2 的对比很有意思。 🔗 阅读原文:https://x.com/leerob/status/2072416355836740059

noreply@aihot.virxact.com (X:Lee Robinson (@leerob))

Nathan Lambert 发布 RL 推导修正 Q&A 视频

我在课程中陆续制作 Q&A 视频。这是下一期,涵盖 on-policy 蒸馏和奖励模型推导中的细微修正、做这类数学时常见的符号陷阱,以及更多深入资料(例如 @johnschulman2 的 KL 估计博客)。 Q&A 2 来了! 00:00 推导修正 06:10 代码示例与额外资源 08:08 更多 RL 符号与注释 继续在 YouTube、GitHub 和 Discord...

noreply@aihot.virxact.com (X:Nathan Lambert (@natolambert))

Seedance 2.0 4K短片 用CapCut制作

Seedance 2.0 4K做的短片,用的 CapCut Video Studio 🔗 阅读原文:https://x.com/dotey/status/2072416133462765806

noreply@aihot.virxact.com (X:宝玉 (@dotey))

Claude Fable 5 在 Cursor 中恢复使用

Claude Fable 5 已在 Cursor 中重新可用。它在 CursorBench 上领先所有模型,但每次任务成本最高。 🔗 阅读原文:https://x.com/ericzakariasson/status/2072414998999994572

noreply@aihot.virxact.com (X:Eric Zakariasson (@ericzakariasson))

ZCode:来自GLM开发团队的Claude Code

一个浏览器五子棋游戏在 index.html、styles.css 和 app.js 中实现,渲染 15x15 棋盘,支持四个方向胜负判断并高亮连成五子的路径。AI 采用启发式评分,搜索附近候选点,综合进攻棋型、防守阻挡和中心区域偏好选择最优落子,同时提供可选的"AI 关注区域"覆盖层。 🔗 阅读原文:https://zcode.z.ai/cn

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

正式组织结构助力AI智能体思考

正式组织结构是思考智能体挑战的有用方式。它们为思考工作如何在聪明的昂贵的智能体与更便宜的弱智能体之间,以及在狭窄的专家与通才之间上下委派提供了模板。 🔗 阅读原文:https://x.com/emollick/status/2072410869426733211

noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))

OpenAI Codex重置按钮现场展示

如果你在@aiDotEngineer大会现场,现在就去OpenAI展台!下午1点,你将看到Codex重置按钮的实际操作。传闻今天之后它将被放回绝密地下保险库。它来了。 🔗 阅读原文:https://x.com/thsottiaux/status/2072410623380468190

noreply@aihot.virxact.com (X:Tibo (@thsottiaux))

Fable 5削弱限制令人失望

对这个被削弱且受限的Fable 5实在提不起兴趣。 史上最令人困惑的AI发布之一。 但我们继续前行。 🔗 阅读原文:https://x.com/omarsar0/status/2072409343819923668

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

Anthropic 更新安全防护,生物化学仍回退 Opus 4.8

Anthropic 在与美国政府沟通后更新网络安全防护。新防护短期内会标记略多的无害请求,被标记的请求将回退至 Opus 4.8,官方表示正在优化。生物和化学分类器与初始发布相同,仍过于宽泛,基础生物学相关问题也会触发 Opus 4.8 回退,改进即将推出。主推文评论认为这一变化在意料之中,但生物/化学领域护栏仍过于严苛,并关注其在编码任务上的表现。 🔗...

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

SpaceX向投资者展示xAI驱动的超薄AI智能手机原型

据《华尔街日报》报道,SpaceX向投资者展示了一款超薄AI智能手机原型,集成xAI技术,比iPhone更薄,运行自有操作系统并采用高通骁龙芯片。项目仍处于早期阶段,量产不确定。马斯克正寻求打造对标微信的"超级应用",该设备也有望减少对苹果和谷歌的依赖。与此同时,OpenAI也在研发AI设备,当前重点是一款由AI智能体接管所有手机任务的AI智能手机,同时还在测试别针、智能音箱和数字录音机等不...

noreply@aihot.virxact.com (The Decoder:AI News(RSS))

Claude Fable 5 一周订阅试用,50% 使用上限

Claude Fable 5 回归,面向 Pro、Max、Team 及高级 Enterprise 用户推出一周订阅试用,但严格限制使用量:用户可用每周订阅限额的 50% 免费使用 Fable 5,不能超出;若此前已用掉部分订阅限额,则 Fable 5 可用量相应减少。免费额度用尽后,用户可选择使用积分支付或切回其他 Claude 模型。API 用户不参与此优惠,仍按标准独立计费。 🔗...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

Claude Fable 5 回归 OpenRouter

来自 @Anthropic 的 Claude Fable 5 已回归 OpenRouter! Anthropic 正在全球重新部署它,并针对网络安全滥用增加了新的保护措施。一些编码和调试请求可能会暂时回退到 Opus 4.8,同时分类器正在优化。 🔗 阅读原文:https://x.com/OpenRouter/status/2072405997289877846

noreply@aihot.virxact.com (X:OpenRouter (@OpenRouter))

Meta员工30天消耗超60万亿token,AI使用转向重度用户

Meta员工30天内消耗超60万亿模型token,单用户最高达2800亿,人均年token成本约5万美元。多数公司设月额度上限250-4000美元,重度用户数天用尽。编程工具贡献OpenAI和Anthropic超70%的ARR。Perplexity CEO指出,AI使用正转向重度用户:单个工程师年花费可达1000万美元于编码工具,Perplexity...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

DAIR.AI创始人Elvis Saravia:微调革命前夜,PorTAL解决基座过时困境

DAIR.AI 创始人 Elvis Saravia 认为微调问题仍未被充分探索,当前正处于微调革命前夜,智能体微调将大幅改变 AI 格局。@rahulgs 进一步指出,微调或 RL 定制模型本质上是对模型进步的押注,在开源发布速度极快的当下,容易导致基座模型迅速过时(如 Kimi 2.6 仅数月就已落后)。为此他们推出...

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))
上一页 第 503 / 964 页 下一页

添加 Feed

导入 OPML