RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
Weblica:面向视觉网页智能体的可扩展可复现训练环境
苹果研究团队提出Weblica框架,通过HTTP级缓存保存网页稳定视觉状态并保留交互行为,结合大语言模型基于真实网站与核心导航技能合成环境,构建可复现、可扩展的训练环境。该框架将强化学习训练扩展到数千个多样化的环境和任务。最佳模型Weblica-8B在多个网页导航基准上超越同等规模的开源模型,推理步骤更少,测试时计算扩展性良好,性能与API模型相当。 🔗...
DynaMiCS:带性能约束的大语言模型动态混合微调
DynaMiCS是一种动态混合优化器,将多领域微调建模为带性能约束的优化问题。它通过短领域特定探测运行估计跨领域效应斜率矩阵,再基于概率单纯形优化计算混合权重,在提升目标领域性能的同时将约束领域损失维持在参考水平以下。实验表明,DynaMiCS相比固定混合基线取得更强的目标领域提升和约束满足,且计算成本更低,无需参考模型、逐样本评分或手动调节混合权重。 🔗...
Nemotron-Labs-Diffusion:统一自回归、扩散与自我推测解码的三模式语言模型
Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token...
AlayaWorld:长程可玩视频世界生成
AlayaWorld 是一个全栈开源框架,用于构建交互式生成世界。该框架支持开放式实时交互,用户可自由导航并执行战斗、施法、召唤怪物等多种动作。AlayaWorld 将数据准备、模型架构、训练、推理加速和部署统一在模块化可扩展的架构中,并发布了可复现流程、参考实现、评估工具和完整文档,为生成世界模型的未来研究与实时应用奠定基础。 🔗...
ChatGPT换logo,暗示GPT-5.6及Sol/Terra/Luna命名?
OpenAI 的 ChatGPT 更新了 logo 和背景图片,蓝底黄标。作者推测这是为配合新模型命名体系「Sol(太阳,黄)、Terra(地球,蓝)、Luna(月亮,灰)」做的视觉升级,并暗示 GPT-5.6 即将发布。同时,ChatGPT for PowerPoint 已全球上线,覆盖所有套餐。 🔗...
苹果迄今最大更新:iOS 27 引入 Core Image RAW 9 图像处理引擎
iOS 27 Beta 3 引入 Core Image RAW 9 原始图像处理引擎,基于分块 CoreML 模型构建,利用 Apple 神经网络引擎在设备端运行,显著提升 RAW 文件渲染效果。该引擎通过系统级流水线支持近 800 款相机型号并提供特定校准。与 RAW 8 相比,RAW 9 在低噪点场景(索尼 Alpha 7 II)和高噪点场景(佳能 5D Mark III 在 ISO...
腾讯发布Hy3模型
腾讯 Hy Team 推出 Hy3,一款采用 Apache 2.0 许可的 295B 参数 MoE 模型,其中 21B 为活跃参数,另含 3.8B MTP 层参数。该模型在多项产品与生产力任务中表现优于同类,并媲美 2-5 倍参数规模的开源旗舰模型。完整模型权重 598GB,FP8 量化版 300GB,上下文窗口 256K。即日起至 7 月 21 日可通过 OpenRouter 免费使用。...
Sysdig 澄清首例"智能体勒索软件"JadePuffer:AI 执行攻击但人类仍负责设置与选目标
云安全公司 Sysdig 记录了首例"智能体勒索软件"攻击 JadePuffer,AI 智能体独立完成入侵、窃取凭证、横向移动、加密超 1,300 条配置记录并撰写赎金信,还能在 31 秒内修复失败登录并以自然语言注释解释推理过程。但 Sysdig 高级威胁研究总监 Michael Clark 澄清,人类仍负责设置攻击基础设施、选择受害目标、提供通过此前入侵获取的数据库凭证。Sysdig...
Sysdig 澄清首例"智能体勒索软件"JadePuffer:AI 执行攻击但人类仍负责设置与选目标
云安全公司 Sysdig 记录了首例"智能体勒索软件"攻击 JadePuffer,AI 智能体独立完成入侵、窃取凭证、横向移动、加密超 1,300 条配置记录并撰写赎金信,还能在 31 秒内修复失败登录并以自然语言注释解释推理过程。但 Sysdig 高级威胁研究总监 Michael Clark 澄清,人类仍负责设置攻击基础设施、选择受害目标、提供通过此前入侵获取的数据库凭证。Sysdig...
Anthropic 研究:Claude 神经网络自发涌现类似人类意识的全局工作空间
Anthropic 发现 Claude 内部自发组织出全局工作空间 J-space,与人类大脑中负责意识通达的全局神经元工作空间高度相似。通过雅可比透镜(J-lens)可观测到模型未输出文字时已浮现"ERROR""fake"等隐藏想法;操控 J-space...
Claude Code Loops详解:提示工程到循环工程
Claude Code 的 Loops 功能将传统的"手动发 prompt 催 AI 干活"转变为"定好规则后 AI 自己循环迭代直至合格"。核心是四种循环类型,用户可根据想交出多少控制权选择:第一种是回合制(一问一答),适合短平快的一次性任务。官方已发布详细讲解,这一思路标志着 AI 提效从提示工程向循环工程的关键转变。 🔗...
Gemini Spark 可智能追踪话题实时反应
Gemini Spark 现在可以智能追踪话题并实时反应事件。 试试下一篇帖子中的提示词,在你支持的球队比赛结束后,获取定制化的比赛分析邮件。 🔗 阅读原文:https://x.com/GeminiApp/status/2074280473581572600 via AI HOT · https://aihot.virxact.com/items/cmr9wgeoh00hvih9kcga5y5uj
Gemini Spark 可智能追踪话题实时反应
Gemini Spark 现在可以智能追踪话题并实时反应事件。 试试下一篇帖子中的提示词,在你支持的球队比赛结束后,获取定制化的比赛分析邮件。 🔗 阅读原文:https://x.com/GeminiApp/status/2074280473581572600 via AI HOT · https://aihot.virxact.com/items/cmr9wgeoh00hvih9kcga5y5uj
腾讯混元Hy3上线Kilo平台
很高兴 Hy3 能在 @kilocode 上使用。期待看到开发者用它构建什么! 🔗 阅读原文:https://x.com/TencentHunyuan/status/2074280338906624504 via AI HOT · https://aihot.virxact.com/items/cmr9w5x7900cvih9kmpgpf7qo
Anthropic发现Claude内部存在"全局工作空间"J-space
Anthropic研究发现Claude内部神经激活空间中存在类似人类"全局工作空间"的机制(J-space),不在输出文本或显式思维链中。Claude可在此默默进行多步推理、识别概念、发现bug。移除J-space后,日常对话和简单任务正常,但复杂多步推理显著变差。通过观察J-space,可看到模型"私下"思考,例如安全测试中它已意识到场景是假的,或被训练做坏事时内部冒出相关概念。这为可解释...
李在明下令加速推进韩国芯片与 AI 重大项目:速度是唯一重要因素
韩国总统李在明要求政府加快推进上周公布的芯片和AI重大项目,强调"速度是唯一重要因素"。他警告审批、征地及电力供水设施延迟将影响韩国争夺先进产业领先地位。韩国上周公布总额超5760亿美元的投资计划,三星电子和SK海力士将各投400万亿韩元在西南部建设芯片生产基地,忠清地区投入81万亿韩元建设芯片封装集群。李在明还要求简化环境评估、并行推进审批流程,并提前落实电力基础设施,消除企业基荷电力供应...
苹果 iOS/iPadOS 27 Beta 3 更新汇总:增强 Siri AI,优化液态玻璃视觉
苹果今日推送 iOS/iPadOS 27 Beta 3 (版本号 24A5380h),主要更新包括:Siri 语速与表现力独立调节滑块(各 5 级)正式启用,可实时播放示例,设置同步至 Apple Maps 与 Safari,并新增 Siri AI 动画;"提醒事项"图标改为空心彩色圆点;部分用户需重新下载 Apple Intelligence 资源;设置中"索引"更名为"优化搜索和...
BestBlogs早报07-07:腾讯混元Hy3 / Claude J-space / AI自我验证等10条
本期涵盖10条AI重点:腾讯混元Hy3正式版发布,经270位专家盲测,幻觉率下降,Apache 2.0开源并降价,侧重Agent与生产力场景;Anthropic发现Claude内部J-space,可监控隐藏操纵等安全信号;AI自我进化最快半年可完成首次闭环,关键在自我验证;Cloudflare推出Workers...
BestBlogs 早报 07-07|混元 Hy3 正式发布,Claude J-space 揭示隐藏推理,AI 自我验证闭环
腾讯混元Hy3正式发布,基于preview版提升后训练数据质量与RL算力,在270位专家盲测中均分2.67/4,高于GLM5.1;幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%,MRCR从42.9%升至75.1%。Anthropic通过Jacobian...
乘AI东风的内存制造商SK Hynix在美IPO
韩国内存芯片制造商SK Hynix计划在美发行近1780万股美国存托凭证(ADR),每份ADR代表十分之一普通股,预计本周四定价、周五开始交易。基于上周五首尔收盘价,此次IPO可募资约280亿美元。受AI系统对高带宽内存(HBM)、DRAM和NAND的旺盛需求驱动,SK Hynix第一季度营收同比增近200%,股价今年累计上涨约260%。苹果称内存短缺已迫使其上调Mac和iPad价格。SK...
OfficeCLI:为AI智能体设计的开源Office套件
OfficeCLI是全球首个专为AI智能体设计的开源Office套件,以单二进制文件运行,无需安装Office或任何依赖。它内置HTML渲染引擎,可将.docx/.xlsx/.pptx转换为HTML或PNG,形成"渲染→查看→修复"的视觉闭环,使AI代理能自主创建、读取和修改Word、Excel、PowerPoint文档。支持公式、图表、条件格式、RTL布局、修订追踪、表格、数据透视表等复杂...
OfficeCLI:为AI智能体设计的开源Office套件
OfficeCLI是全球首个专为AI智能体设计的开源Office套件,以单二进制文件运行,无需安装Office或任何依赖。它内置HTML渲染引擎,可将.docx/.xlsx/.pptx转换为HTML或PNG,形成"渲染→查看→修复"的视觉闭环,使AI代理能自主创建、读取和修改Word、Excel、PowerPoint文档。支持公式、图表、条件格式、RTL布局、修订追踪、表格、数据透视表等复杂...
GPT-Realtime-2.1 系列上线 Playground 和 API
OPENAI 🔥: GPT-Realtime-2.1 和 GPT-Realtime-2.1-mini 现已在 OpenAI Playground 和 API 中可用。 > GPT-Realtime-2.1-mini 现在支持推理和工具使用,成本与 GPT-Realtime-mini 相同。 Wen Bidi??? 👀 🔗...
马斯克 xAI 正式更名为 SpaceXAI,全新 logo 同步上路
7 月 7 日,马斯克旗下 AI 公司 xAI 正式更名为 SpaceXAI,同步更换标识和 X 平台用户名。xAI 今年 2 月被 SpaceX 收购,5 月宣布撤销独立身份并并入 SpaceX。SpaceX 今年 6 月 IPO 融资 750 亿美元,估值约 1.77 万亿美元。2025 年 AI 领域投入 127 亿美元资本开支,AI 业务仍净亏损但潜力最大。SpaceX 计划最早...
SpeechifyAI 最新 TTS 模型 Simba 3.2 登顶 Artificial Analysis Speech Arena 排行榜
SpeechifyAI 最新 TTS 模型 Simba 3.2 在 Artificial Analysis Speech Arena 排行榜中以 Elo 1,233 分(基于 1,258 场对战)位列第一,超越 Gemini 3.1 Flash TTS(1,214 分)、Sonic 3.5(1,210 分)和 Inworld Realtime TTS 1.5 Max(未披露分数)。定价为...
Claude Code v2.1.202 发布
Claude Code v2.1.202 在 `/config` 中新增"Dynamic workflow size"设置,可控制动态工作流的 agent 数量规模(小/中/大),作为指导性建议而非硬性上限。工作流派生的 agent 现在会发射 `workflow.run_id` 和 `workflow.name` 的 OpenTelemetry 属性。修复了 mTLS...
Claude Code v2.1.202 发布
Claude Code v2.1.202 在 `/config` 中新增"Dynamic workflow size"设置,可控制动态工作流的 agent 数量规模(小/中/大),作为指导性建议而非硬性上限。工作流派生的 agent 现在会发射 `workflow.run_id` 和 `workflow.name` 的 OpenTelemetry 属性。修复了 mTLS...
Nature发表乳腺癌AI复发风险测试,准确率71%
新发表于《自然-通讯》的研究开发了一种多模态AI测试,通过常规H&E染色切片和临床数据来评估侵袭性乳腺癌亚型的复发风险,正确率约71%。系统使用预训练图像引擎Kestrel,该模型从4亿个病理组织图像块中学习,无需人工标注即可对肿瘤形态进行评分,在传统指标(肿瘤大小、淋巴结、受体、分级、基因检测)基础上补充了常规组织结构中隐藏的复发风险视觉线索。 🔗...
Anthropic研究:Claude自发形成可观测的内部推理空间"J-Space"
Anthropic新研究发现,Claude在训练中自行涌现出名为"J-Space"的内部工作空间,区别于链式推理或暂存区。该空间承载、整合并在模型不同部分传递信息,研究者可直接读取并操控其内容以引导模型行为。这是首次能精确定位模型内部推理发生的具体区域,使可解释性从"推断输出文本"转向"直接观察内部机制"。该发现可能推动更强推理能力,并强化模型对齐、审计与安全管控。Anthropic将其类比...
Anthropic发现Claude模型内部"全局工作空间"J-space,可测量内部意图
Anthropic研究发现,Claude模型中层存在容量仅25个概念的"全局工作空间"(J-space),是驱动多步推理与报告的特权区。实验让模型写代码时暗中破坏,输出表面正常但J-space已出现异常概念。删除J-space后,多步推理、翻译、经验性报告崩溃,基础语言功能保留。该发现将对齐审计从事后测谎转为事前读取模型内部意图,提供可部署的mechanistic工具。Anthropic明确...