RSS

  • 宝玉的分享
    https://baoyu.io/feed.xml
    刷新于
  • AIHOT 日报
    https://aihot.virxact.com/feed/daily.xml
    刷新于
  • AIHOT — 全部 AI 动态
    https://aihot.virxact.com/feed/all.xml
    刷新于
  • AIHOT — 精选
    https://aihot.virxact.com/feed.xml
    刷新于

AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求

AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。 🔗 阅读原文 via...

noreply@aihot.virxact.com (GitHub Blog)

Replit 新增工作区托管区域选择

想要降低 Replit 中的延迟,并控制项目预览的托管位置? Pro 和企业版客户现在可以选择新 Replit 工作区的托管位置。 可在北美、欧洲或亚洲之间选择。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqf96b2016lroxvy4gju01z

noreply@aihot.virxact.com (X:Replit (@Replit))

空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。 🔗 阅读原文 via...

noreply@aihot.virxact.com (Google Research:Blog(网页))

空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。 🔗 阅读原文 via...

noreply@aihot.virxact.com (Google Research:Blog(网页))

Grok 4.6 以更低价格逼近 Fable 5 智能指数

Grok 4.6 在 Fable 5 的 Intelligence Index 上取得 98.4% 的分数,输入 token 价格便宜 5 倍、输出 token 便宜 8 倍。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqf0f730127roxvfu5wtcec

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

Grok 4.6 登顶 AA-Briefcase,成本远低于竞品

Grok 4.6 在 Artificial Analysis 的 AA-Briefcase 智能体知识工作基准上取得大幅提升,与 Claude Fable 5 并列领先(置信区间重叠)。其单任务成本仅 $4.42,远低于 Claude Fable 5 的 $22.30、Claude Opus 5 的 $17.79 和 Kimi K3 的 $6.73。该测试集为私有,可防止数据污染。 🔗...

noreply@aihot.virxact.com (X:Artificial Analysis (@ArtificialAnlys))

Grok 4.6 发布:价格不变、智能跃升第一梯队

Grok 4.6 今日上线,价格与 4.5 完全一致($2/M input、$6/M output),约为其他前沿模型一半,但智能大幅跃升。AA智能指数达61,与GPT-5.6 Sol Max持平,仅比Fable 5低1分;GDPVal、AA-Briefcase均拿第一,法律基准15.8%断层领先。 🔗 阅读原文 via AIHOT ·...

noreply@aihot.virxact.com (X:阿易 AI Notes (@AYi_AInotes))

Higgsfield 插件上线 ChatGPT 应用

Higgsfield 插件正式上线 ChatGPT 应用,用户可直接在聊天中生成与编辑图像,无需 API key,使用现有 Higgsfield 积分即可。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqeu3h7001oroxvupy2ooyy

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

AI安全担忧升温,三位先驱为何主张保持开放

在拉斯维加斯Ai4大会上,Geoffrey Hinton、李飞飞和吴恩达一致主张AI应保持开放,反对少数大公司垄断技术进程。吴恩达强调"不希望有守门人",并担忧美国开源AI难以与中国开源权重模型竞争;Hinton虽曾反对开放权重,但承认"这场战斗已经输了";李飞飞则主张分层开放。三人均认同需要一定程度的监管。 🔗 阅读原文 via AIHOT ·...

noreply@aihot.virxact.com (TechCrunch:AI(RSS))

我看有说max有问题high没问题的,我再把high也跑一下一起对比

我看有说max有问题high没问题的,我再把high也跑一下一起对比 【引用 @MistymoonR】:@karminski3 这模型最大特点是不思考就直接干活🧐 就像是已经知道标准答案呢 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxxj1006arolii7eb7357

noreply@aihot.virxact.com (X:karminski (@karminski3))

Grok 4.6登顶ARI Bench超越Claude与GPT

Grok 4.6 在 ARI Bench 上夺得第一--该基准用于评测 AI 的递归式自我改进能力。🥇 它显著超越 Grok 4.5,同时排名也领先于 Claude Opus 5 和 GPT-5.6。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxt06002krolifay8izxv

noreply@aihot.virxact.com (X:cb_doge (@cb_doge))

OpenAI 参股的 Thrive Holdings 融资 20 亿美元,将 AI 引入企业

Thrive Holdings 以 120 亿美元估值完成 20 亿美元融资,投资方包括 SoftBank、D1 Capital Partners 和 Altimeter Capital。该公司类似 AI 私募股权公司,收购会计等传统企业并部署 AI,其 TaxAI 代理已处理超 7,000 份纳税申报表,准确率 98%,并将报税时间缩短逾...

noreply@aihot.virxact.com (TechCrunch:AI(RSS))

Grok 4.6 基准测试大幅超越 4.5

Grok 4.6 相比 Grok 4.5 是巨大提升 🚀 Mercor 的 APEX 基准测试显示,在每个专业领域都有显著进步: 🏛️ 公司法:49.6% → 62.5% 💰 投行:39.2% → 50.2% 📊 管理咨询:51.0% → 59.8% 🧮 会计:40.8% → 50.9% 试试 @Grok 4.6 🔗 阅读原文 via AIHOT ·...

noreply@aihot.virxact.com (X:cb_doge (@cb_doge))

Grok 4.6 发布:智能体任务领先 GPT-5.6 Sol Max

Grok 4.6 发布,主打专业智能体任务,在 GDPVal-AA v2 和 AA-Briefcase 上分别取得 1753 和 1577 分,均领先 GPT-5.6 Sol Max 与 Fable 5 Max。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxtrn003arolisg48jvat

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

Grok 4.6 实测登顶 GDPVal 基准

试试用 Grok 4.6 应对棘手的现实世界任务吧! 【引用 @EMostaque】:在我看来,GDPVal 可能是最重要的基准测试,它衡量模型在现实世界任务上的表现。 性能大幅跃升,以极佳的价格登顶该基准,祝贺 @SpaceXAI 团队,期待接下来更重磅的发布! 🔗 阅读原文 via AIHOT ·...

noreply@aihot.virxact.com (X:Elon Musk (@elonmusk, xAI))

Gboard 与 Live Transcribe 新增手语转文字功能

今天 Made by Google 发布的最重要更新之一,是我们在 Gboard 和 Live Transcribe 中新增的手语转文字功能。 该功能与聋人社区合作开发,可帮助使用 ASL 手语的人更顺畅地通过手机或与不懂手语的人交流,如这段 Live Transcribe 演示所示: 🔗 阅读原文 via AIHOT ·...

noreply@aihot.virxact.com (X:Sundar Pichai (@sundarpichai))

AllenAI 教程:用 SFT、DPO、RLVR、GRPO 与验证器评估构建 Tulu 3 后训练流程

本教程基于 AllenAI 的 Open Instruct 框架,构建了一个端到端的后训练流程,涵盖监督微调、直接偏好优化和基于 GRPO 的可验证奖励强化学习三个阶段。该流程将原多 GPU 的 Tulu 3 栈适配至 16 GB 运行时,用轻量级 Hugging Face 和 PyTorch 实现替换 vLLM、Ray、DeepSpeed 等分布式组件,并利用确定性验证器评估数学答案。...

noreply@aihot.virxact.com (MarkTechPost(RSS))

Odyssey 新推文暗示模型进展

开始变得眼熟了。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxvr5004wroliuib28uyi

noreply@aihot.virxact.com (X:Odyssey (@odysseyml))

研究人员实现从输出文本近乎完美逆向还原 LLM 提示词

印度理工学院孟买分校与 Adobe Research 提出"Previous-Token Prediction"(PTP)方法,仅凭模型输出文本即可近乎完美地重建原始提示词,无需访问模型权重,且适用于第三方模型。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxw310054rolif6l8rfo1

noreply@aihot.virxact.com (The Decoder:AI News(RSS))

模型不可用即无用,能力回归引争议

Dex Horthy 反驳"模型只是比你聪明"的说法,认为前沿模型没有"智能"只有"能力",且其服务能力已出现回退。他批评 Altimor 将模型晦涩表达视为更高智能的观点,强调人类不可用的模型没有价值。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdrczo01kxroc5d0qefvoq

noreply@aihot.virxact.com (X:Dex Horthy(HumanLayer)(@dexhorthy))

Twitch 主播现可选择退出,不让内容用于训练亚马逊生成式 AI

Twitch 用户现可关闭"生成式 AI 训练"开关,选择退出后其直播、VOD、剪辑、聊天及频道图文将不再用于亚马逊生成式 AI 模型的"未来训练"。关闭该开关不影响字幕、安全工具等"AI 辅助"功能,但若在他人直播间参与聊天,是否可用于训练由该主播的选择决定。该开关位于设置的安全与隐私选项卡下,被发现时默认为开启状态。 🔗 阅读原文 via AIHOT ·...

noreply@aihot.virxact.com (The Verge:AI(RSS))

BDH-CQ 循环潜在推理实现上下文学习

BDH-CQ 基于循环潜在推理的上下文学习 论文:https://huggingface.co/papers/2608.09888 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxtvs003krolishsii61g

noreply@aihot.virxact.com (X:AK (@_akhaliq))

大规模漏洞扫描冒充ClaudeBot等AI机器人,5,000+网站流量分析揭示异常

一项覆盖5,000多个网站的持续更新分析发现,有人正冒充ClaudeBot等AI机器人进行大规模漏洞扫描。该分析追踪了机器人流量、AI抓取、搜索索引、robots.txt合规性及AI聊天推荐等行为,揭示出伪装成合法AI爬虫的恶意扫描活动。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdrhvh01lqroc5rt0jvc4b

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

LangSmith BYOC 在 AWS 上正式全面可用

LangSmith Bring Your Own Cloud 现已在 AWS 上正式全面可用,让企业团队能在自己的 VPC 内获得托管的可观测性、评估和部署能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdbbjg01dbroc5jhxkonbt

noreply@aihot.virxact.com (LangChain:Blog(RSS))

韩国Upstage发布Solar Pro 4,智能指数42分

韩国AI实验室Upstage发布旗舰推理模型Solar Pro 4,Artificial Analysis智能指数达42分,较Solar Pro 3的14分大幅提升27分,与Inkling(xhigh,42分)持平。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxs6r001uroliepj1zk50

noreply@aihot.virxact.com (X:Artificial Analysis (@ArtificialAnlys))

Anthropic 联合独立研究者发布工人再培训项目证据综述

Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs2m402xzroosy1xpgvm0

noreply@aihot.virxact.com (Anthropic:Research(发表成果 · 网页))

DeepSeek V4 Pro 发布引担忧

咋感觉要拉啊………别啊…. 😇 #deepseekv4pro0813 #deepseekv4pro正式版 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs77p0305roosbhiu5hga

noreply@aihot.virxact.com (X:karminski (@karminski3))

Grok 4.6 实现帕累托最优

Grok 4.6 的帕累托黄金。 即使 OpenAI 降价后,Grok 和 Cursor 仍实现绝对帕累托支配。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs0t002wxroosfp5l9g9b

noreply@aihot.virxact.com (X:Elon Musk (@elonmusk, xAI))

Grok 4.6 现已登陆 Grok Build

你现在可以在 Grok Build 中使用 Grok 4.6。 下载 Grok Build:http://x.ai/build 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcrzvv02whrooszl0faiuy

noreply@aihot.virxact.com (X:cb_doge (@cb_doge))

Grok 称最高效高智能AI,性价比关键

Grok 是最高效的高智能 AI。 【引用 @ArthurMacwaters】:Grok 4.6 可以说是每美元智能最高的模型。 这是一个极其重要的指标。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs0t002wyroos2sjo6k2z

noreply@aihot.virxact.com (X:Elon Musk (@elonmusk, xAI))
上一页 第 6 / 851 页 下一页

添加 Feed

导入 OPML