RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
Grok 4.6登顶ARI Bench超越Claude与GPT
Grok 4.6 在 ARI Bench 上夺得第一--该基准用于评测 AI 的递归式自我改进能力。🥇 它显著超越 Grok 4.5,同时排名也领先于 Claude Opus 5 和 GPT-5.6。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxt06002krolifay8izxv
OpenAI 参股的 Thrive Holdings 融资 20 亿美元,将 AI 引入企业
Thrive Holdings 以 120 亿美元估值完成 20 亿美元融资,投资方包括 SoftBank、D1 Capital Partners 和 Altimeter Capital。该公司类似 AI 私募股权公司,收购会计等传统企业并部署 AI,其 TaxAI 代理已处理超 7,000 份纳税申报表,准确率 98%,并将报税时间缩短逾...
Grok 4.6 基准测试大幅超越 4.5
Grok 4.6 相比 Grok 4.5 是巨大提升 🚀 Mercor 的 APEX 基准测试显示,在每个专业领域都有显著进步: 🏛️ 公司法:49.6% → 62.5% 💰 投行:39.2% → 50.2% 📊 管理咨询:51.0% → 59.8% 🧮 会计:40.8% → 50.9% 试试 @Grok 4.6 🔗 阅读原文 via AIHOT ·...
Grok 4.6 发布:智能体任务领先 GPT-5.6 Sol Max
Grok 4.6 发布,主打专业智能体任务,在 GDPVal-AA v2 和 AA-Briefcase 上分别取得 1753 和 1577 分,均领先 GPT-5.6 Sol Max 与 Fable 5 Max。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxtrn003arolisg48jvat
Grok 4.6 实测登顶 GDPVal 基准
试试用 Grok 4.6 应对棘手的现实世界任务吧! 【引用 @EMostaque】:在我看来,GDPVal 可能是最重要的基准测试,它衡量模型在现实世界任务上的表现。 性能大幅跃升,以极佳的价格登顶该基准,祝贺 @SpaceXAI 团队,期待接下来更重磅的发布! 🔗 阅读原文 via AIHOT ·...
Gboard 与 Live Transcribe 新增手语转文字功能
今天 Made by Google 发布的最重要更新之一,是我们在 Gboard 和 Live Transcribe 中新增的手语转文字功能。 该功能与聋人社区合作开发,可帮助使用 ASL 手语的人更顺畅地通过手机或与不懂手语的人交流,如这段 Live Transcribe 演示所示: 🔗 阅读原文 via AIHOT ·...
AllenAI 教程:用 SFT、DPO、RLVR、GRPO 与验证器评估构建 Tulu 3 后训练流程
本教程基于 AllenAI 的 Open Instruct 框架,构建了一个端到端的后训练流程,涵盖监督微调、直接偏好优化和基于 GRPO 的可验证奖励强化学习三个阶段。该流程将原多 GPU 的 Tulu 3 栈适配至 16 GB 运行时,用轻量级 Hugging Face 和 PyTorch 实现替换 vLLM、Ray、DeepSpeed 等分布式组件,并利用确定性验证器评估数学答案。...
Odyssey 新推文暗示模型进展
开始变得眼熟了。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxvr5004wroliuib28uyi
研究人员实现从输出文本近乎完美逆向还原 LLM 提示词
印度理工学院孟买分校与 Adobe Research 提出"Previous-Token Prediction"(PTP)方法,仅凭模型输出文本即可近乎完美地重建原始提示词,无需访问模型权重,且适用于第三方模型。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxw310054rolif6l8rfo1
模型不可用即无用,能力回归引争议
Dex Horthy 反驳"模型只是比你聪明"的说法,认为前沿模型没有"智能"只有"能力",且其服务能力已出现回退。他批评 Altimor 将模型晦涩表达视为更高智能的观点,强调人类不可用的模型没有价值。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdrczo01kxroc5d0qefvoq
Twitch 主播现可选择退出,不让内容用于训练亚马逊生成式 AI
Twitch 用户现可关闭"生成式 AI 训练"开关,选择退出后其直播、VOD、剪辑、聊天及频道图文将不再用于亚马逊生成式 AI 模型的"未来训练"。关闭该开关不影响字幕、安全工具等"AI 辅助"功能,但若在他人直播间参与聊天,是否可用于训练由该主播的选择决定。该开关位于设置的安全与隐私选项卡下,被发现时默认为开启状态。 🔗 阅读原文 via AIHOT ·...
BDH-CQ 循环潜在推理实现上下文学习
BDH-CQ 基于循环潜在推理的上下文学习 论文:https://huggingface.co/papers/2608.09888 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxtvs003krolishsii61g
大规模漏洞扫描冒充ClaudeBot等AI机器人,5,000+网站流量分析揭示异常
一项覆盖5,000多个网站的持续更新分析发现,有人正冒充ClaudeBot等AI机器人进行大规模漏洞扫描。该分析追踪了机器人流量、AI抓取、搜索索引、robots.txt合规性及AI聊天推荐等行为,揭示出伪装成合法AI爬虫的恶意扫描活动。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdrhvh01lqroc5rt0jvc4b
LangSmith BYOC 在 AWS 上正式全面可用
LangSmith Bring Your Own Cloud 现已在 AWS 上正式全面可用,让企业团队能在自己的 VPC 内获得托管的可观测性、评估和部署能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdbbjg01dbroc5jhxkonbt
韩国Upstage发布Solar Pro 4,智能指数42分
韩国AI实验室Upstage发布旗舰推理模型Solar Pro 4,Artificial Analysis智能指数达42分,较Solar Pro 3的14分大幅提升27分,与Inkling(xhigh,42分)持平。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqdxs6r001uroliepj1zk50
Anthropic 联合独立研究者发布工人再培训项目证据综述
Anthropic 与独立研究者 David Roodman 合作发布报告,基于 56 项美国随机研究和欧洲实验证据,评估工人再培训项目应对 AI 劳动力市场冲击的效果。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs2m402xzroosy1xpgvm0
DeepSeek V4 Pro 发布引担忧
咋感觉要拉啊………别啊…. 😇 #deepseekv4pro0813 #deepseekv4pro正式版 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs77p0305roosbhiu5hga
Grok 4.6 实现帕累托最优
Grok 4.6 的帕累托黄金。 即使 OpenAI 降价后,Grok 和 Cursor 仍实现绝对帕累托支配。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs0t002wxroosfp5l9g9b
Grok 4.6 现已登陆 Grok Build
你现在可以在 Grok Build 中使用 Grok 4.6。 下载 Grok Build:http://x.ai/build 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcrzvv02whrooszl0faiuy
Grok 称最高效高智能AI,性价比关键
Grok 是最高效的高智能 AI。 【引用 @ArthurMacwaters】:Grok 4.6 可以说是每美元智能最高的模型。 这是一个极其重要的指标。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcs0t002wyroos2sjo6k2z
Grok 4.6 登顶智能、速度与成本综合第一
xAI 的 Grok 4.6 在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 并列前沿,仅次于 Anthropic 的 Claude 系列。其智能体性能突出,GDPval-AA v2 Elo 达 1753,定价维持 $2/$6 每百万 token,较 Claude Opus 5 和 GPT-5.6 Sol 低 60%...
Mesh 个人 CRM 应用登陆 Android
Automattic 旗下个人 CRM 应用 Mesh 正式登陆 Android,支持分屏、弹出视图、键盘快捷键、主屏小组件及跨设备实时同步。其 AI 功能 Nexus AI 目前处于早期访问阶段,可帮助用户按公司、城市或专业领域检索人脉。Mesh 免费版支持最多 1,000 个联系人,个人数据不会用于广告定向。 🔗 阅读原文 via AIHOT ·...
Sandbar CEO 谈 AI 可穿戴设备的未来为何是语音
Sandbar CEO Mina Fahmi 在 TechCrunch 的 Equity 节目中表示,AI 可穿戴设备的未来在于语音交互。他同时指出了其他 AI 硬件公司在产品方向上的失误,但未透露具体产品细节或参数。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqcowm002t8roost84rdcd2
xAI联合创始人反对AI安全遭起诉
举报人:xAI 联合创始人强烈反对 AI 安全,因为"AI 反正会杀死我们所有人"(!) @devindkim 正在起诉 xAI,称其因提出 AI 安全担忧而被解雇。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqbm9jo01m6roosrfsmy7ed
DeepSeek V4 Pro 0813 上线 OpenRouter
DeepSeek V4 Pro 0813 已在 OpenRouter 上线。 @deepseek_ai 报告称,相比 V4 Pro Preview,智能体能力大幅提升:DeepSWE 62.7(+49.9),CyberGym 83.3(+30.6),NL2Repo 61.5(+23.0),Terminal Bench 2.1 87.9(+15.8) 更多服务商即将接入...
谷歌SL2T手语转文本模型登陆Pixel 11
非常重要的AI工作 【引用 @GoogleDeepMind】:SL2T是我们突破性的手语转文本模型,为@Android上失聪和听障用户提供全新功能。 从Pixel 11上的美国手语转英语开始,用户可以直接在Gboard和Live Transcribe中用手语输入,而无需打字。 🔗 阅读原文 via AIHOT ·...
Grok 4.6 发布
xAI 发布 Grok 4.6 模型。该版本在 Hacker News 上获得 117 个 HN Points,引发社区关注。目前官方尚未公布具体参数规模与性能基准数据。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqbmb6s01mjroos25kmet3s
一日三款前沿模型竞相发布
一天之内三款前沿模型! - Grok 4.6:达到 Fable 5 水平,但价格便宜 85%。 - Qwen3.8-Max:2.4T 参数,95B 激活参数。权重已开源。 - DeepSeek-V4-Pro-0813:权重随时可能发布。听说表现不错,不只是刷榜。 竞争对消费者和企业都是好事。 🔗 阅读原文 via AIHOT ·...
DeepSeek 4 Pro GA 定价惊人:$0.435/M 输入
DeepSeek 4 Pro GA 评测已流出,性能扎实,与开源 SOTA(Kimi k3、GLM-5.2)持平,接近 5.6 Sol 和 Fable 5。其定价极具竞争力:$0.435/M 输入、$0.87/M 输出,支持 1M-token 上下文窗口。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqbovoq01oqroos17rs2ql4
DeepSeek V4 Pro 发布,开发者深夜实测
在测了😂被迫加班… 都躺床上了…. #deepseekv4pro0813 #DeepSeekV4Pro正式版 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqbplb301throosf95et1yx