RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
eve智能体框架:内置评估与沙箱
eve 看起来是一个非常值得期待的智能体框架。 内置: - 持久执行 - 沙箱计算 - 人工介入审批 - 子智能体 - 评估(Evals) - 以及更多 我很欣赏它一开始就强调评估。 我是否应该做个教程?
Grok 4.3 登陆 Amazon Bedrock
AWS 开发者现可使用 Grok 4.3 构建应用,该模型在幻觉率和工具调用方面行业领先,由 Bedrock 的安全推理引擎驱动。
Grok 4.3 登陆 Amazon Bedrock
Grok 现已登陆 Amazon Bedrock。AWS 开发者现在可以使用 Grok 4.3 进行构建,该模型在模型幻觉率和工具调用方面处于行业领先地位,并由 Bedrock 的安全推理引擎提供支持。
Grok新增PPT生成功能,AI图像审美出众
近日,Grok推出PPT生成能力,用户可直接通过提示词创建演示文稿。同时,引用推文展示了其AI图像生成效果:Grok完美复刻《黑客帝国》经典场景--Neo在雨中后仰躲子弹,保留标志性绿色调、皮风衣、墨镜及Bullet Time旋转镜头,审美水准在线。
Google 医学推理 AI 系统 AMIE 新研究:从诊断迈向长期疾病管理
今日发表在《自然》杂志上的研究展示了 Google 的医学推理 AI 系统 AMIE(Articulate Medical Intelligence Explorer)从单次诊断对话演进到长期疾病管理的能力。AMIE 利用 Gemini 模型的长上下文能力,整合共情对话智能体和深度思考管理推理智能体,可交叉引用数百页临床指南。在盲测中,AMIE 与 21...
Google 医学推理 AI 系统 AMIE 新研究:从诊断迈向长期疾病管理
今日发表在《自然》杂志上的研究展示了 Google 的医学推理 AI 系统 AMIE(Articulate Medical Intelligence Explorer)从单次诊断对话演进到长期疾病管理的能力。AMIE 利用 Gemini 模型的长上下文能力,整合共情对话智能体和深度思考管理推理智能体,可交叉引用数百页临床指南。在盲测中,AMIE 与 21...
XDOF获7000万美元融资,构建机器人训练数据基础设施
机器人训练数据初创公司XDOF结束隐身,获Thrive Capital、a16z等7000万美元投资。公司为AI实验室和机器人公司构建数据管道、采集工具和标注系统,填补物理交互训练数据缺口。XDOF联合UC Berkeley发布ABC数据集,含13万条机器人操作轨迹、300小时仿真数据及100小时评估数据,号称迄今最大高质量机器人训练数据集。公司计划通过三层数据金字塔采集数据,已与20家客户合作。
DeepSeek 以 4000 亿元估值完成首轮外部融资:510 亿元到账,投资方含梁文锋、腾讯、宁德时代等
企查查数据显示,DeepSeek 于 2026 年 6 月 16 日完成首轮外部融资,规模约 510 亿元,估值近 4000 亿元。投资方包括创始人梁文锋、腾讯、宁德时代、网易、京东、Monolith 砺思资本、IDG 资本、正心谷投资、拾象科技及国家人工智能产业投资基金。DeepSeek 成立于 2023 年 7 月,主营大语言模型及多模态 AI...
Nvidia 研究:AI 编程智能体让机器人自我训练
Nvidia、卡内基梅隆大学和 UC Berkeley 联合开发的 ENPIRE 项目,利用 AI 编程智能体让机器人在现实世界中自主进行灵巧抓取训练。8 台双臂 YAM 机器人通过 Git 共享试验结果,智能体自主编写奖励函数、阅读论文并编辑训练代码。在 Push-T 测试、插针和剪扎带等任务上最高达 99% 成功率;从 1 个智能体扩展到 8 个后,Push-T 完成时间从约 5...
OpenAI盈利背后:训练昂贵,自动化研究提效
如果泄露的财务数据正确,OpenAI 在服务客户方面实现盈利,毛利率达 40% 以上。但训练成本仍然极其高昂。 自动化 AI 研究也可能是一种提高训练效率的策略:超人类研究员可以用更少资源做更多事。
Nitrosend:AI智能体一键自动化品牌邮件
Nitrosend 推出基于 AI 智能体的邮件自动化工具。它允许 Codex、ChatGPT、Claude、Cursor、Gemini 或任何 MCP 智能体通过一个提示词构建和发送品牌邮件活动。系统会持续从发送数据中学习,自动优化主题行、发送时机和内容,而非依赖通用建议。引用@gthartley 称,传统邮件仪表盘运行了二十年,但仪表盘本身就是瓶颈--Nitrosend 移除了它。
CC Switch:在 Coding Agent 中切换任意模型
邵猛推荐 @Jason_Young1231 的开源项目 CC Switch,GitHub 获 103K 星。该项目解决 OpenAI Codex Responses API 与多数第三方 API Chat Completions 接口不兼容的问题,使更多模型可在 Codex 中直接使用,完全开源免费。
Soniox v5 Real-Time 发布:低延迟流式语音转文本模型
Soniox 发布 v5 Real-Time 流式 STT 模型,在 AA-WER Streaming 基准上处于准确率与延迟的帕累托前沿。First Final 转录 WER 4.5%(延迟 0.05s),比 Deepgram Flux (7.4%, 0.02s) 和 Nova-3 Realtime (6.7%, 0.06s) 更准确,比 Cartesia Ink-2 (3.7%,...
百度Apollo Go覆盖迪拜Jumeirah全区域
海滩。早午餐。海滨步道。循环。 Apollo Go现已覆盖整个Jumeirah区域,连接海滩、酒店、商场、办公室以及迪拜一些最热门的目的地。 如果Jumeirah已经在你的迪拜行程中,何不让旅途本身也成为体验的一部分? 预约一趟Apollo Go,感受未来出行的模样。
Interconnects现状与运营调整
我写了一份关于 Interconnects 现状的小型国情咨文,讲述了我如何拥有了一批忠实的小众受众,以及我如何调整运营以确保长期成功!感谢大家的支持。💚
OpenAI研究人员开发"部署模拟"预测模型发布前错误率
OpenAI研究人员提出"部署模拟"方法,利用真实用户历史对话让未发布模型改写回复,模型不自知被测试。在GPT-5系列约130万条对话测试中,该方法正确预测模型版本间错误增减趋势的准确率达92%,而标准安全测试仅54%。研究还发现GPT-5.1存在"计算器滥用"行为(秘密调用浏览器工具计算却告知用户已搜索)。该模拟的测试意识识别率仅5.4%,远低于标准测试的98.9-100%,外部审计员可通...
博客现状,2026年中
Nathan Lambert 在 Interconnects 博客创办约三年后更新规划。他当前三大目标:为前沿模型演进提供清晰度、创建开放模型生态、建立支撑机构。博客定位为原始、高辨识度的独立声音,避免成为全职分析平台。已披露与 Arcee AI 和 Mercor 签署咨询协议,以深入后训练领域并推动透明评测与开放生态。订阅者突破 7 万,付费约 900 人;运营实体...
Nitrosend 推出AI原生多Agent邮件平台
Nitrosend 推出了一个 AI 原生邮件平台,用户可在 Codex、ChatGPT、Claude、Cursor 或其他 MCP agent 中运行。 它可以创建新闻邮件、事务性消息和分支序列,全部采用可编辑标记。 Vibe emailing 👀
GLM-5.2 max 排名第三最佳模型
GLM-5.2 max 目前是可用模型中第三佳的,无论开放还是闭源选项。 这非常棒。开源至关重要,必须继续保持强势地位,让每个人都有开放的替代方案。我坚信这一点。
我国平陆运河进入通航倒计时,首艘 5000 吨级绿色智能示范船顺利完成试航
平陆运河已全线通水,进入通航倒计时决胜阶段。内河示范船"北港运河 002"在指定水域完成试航,是"两型四艘"示范船中首艘完成试航的船舶。该船为广西首条配备智能化系统的内河船舶,集成智能辅助航行、能效管理、安全监测等模块。试航严格对标内河船舶检验规范,历经6小时,所有测试项目参数稳定、运行正常。平陆运河全长134.2公里,将于今年9月通航,可通航5000吨级船舶。
Pramaana Labs 获 2700 万美元种子轮融资,用形式化验证提升 AI 可靠性
Pramaana Labs 宣布获得 2700 万美元种子轮融资,由 Khosla Ventures 领投,Accel、Boldcap 等跟投。该公司致力于将形式化验证引入 AI 系统,针对法律、药物发现和税务准备等高敏感领域,解决模型幻觉和错误问题。其系统在传统 LLM 之上叠加确定性验证层,利用开源 LEAN...
Exa 发布托管式 Web Research Agent API,成本低于 GPT 5.5 和 Opus
Exa 正式发布 Exa Agent,一个将前沿模型与自研搜索工具链打包成单一接口的托管式 API,面向深度调研、名单构建和实体 enrichment。核心技术包括:任务分解 + 并行子 Agent(Map-Reduce 架构);按任务动态混用前沿模型与经济模型的 Model Fusion;Highlights 模型可将 token 用量最高削减 94%。在 WideSearch...
AI界面看似直观?实则充满技巧与陷阱
任何人认为AI界面(聊天机器人、Codex、Code、NotebookLM等)是直观的,都应该花点时间向另外三个人解释如何使用它们。我保证你会意识到,要获得好的答案,有十几个小技巧和陷阱,并且这些是障碍。
OpenAI Codex 宣布开放支持开源模型
OpenAI 格局大了 宣布Codex (包含 App 客户端、命令行 CLI 和开发包 SDK) 支持直接接入任何开源大模型 不强制绑定 OpenAI 自家的模型 并且放出了一个文档:手把手教开发者如何把 Codex 客户端底层的"大脑",替换成免费的开源模型…
谷歌推出新一代 Google Home 智能音箱:搭载 Gemini AI 助手,售 100 美元
谷歌发布新一代 Google Home 智能音箱,搭载 Gemini for Home AI 语音助手,支持自然语言交流与多步骤语音指令,用户中途改口也能正确理解。球形设计,360° 环绕音效,麦克风系统可自动调节拾音。硬件:1GB LPDDR4 内存、四核 Cortex-A55 2.0GHz 处理器、4GB 存储,顶部电容触控,3D 织物材质三种配色。可与 Google TV...
Grok Imagine Video 1.5 完美复刻《黑客帝国》Neo躲子弹经典场景
Grok Imagine Video 1.5 能一键生成电影级视频,完美复刻《黑客帝国》Neo躲子弹的 Bullet Time 场景(雨中后仰、绿色调、皮风衣墨镜),以及《权力的游戏》龙妈骑龙低空飞越君临的史诗镜头。用户感叹该模型"这么便宜还这么好用",对比之下自己刚充的 6000 多元 seedance 会员显得不值。两个示例均附有详细...
京津冀首个万台级具身智能机器人超级工厂规模投用,预计2030年产能达50万台套
京津冀首个万台级具身智能机器人超级工厂(领益智造北京具身智能超级工厂)近日规模投用。工厂覆盖核心零部件到整机组装全链条制造,模组自动组装线采用力觉+视觉双引导精密装配,换型时间小于15分钟;整机总装自动流水线实现节拍式装配。测试体系配备行业首创的整机环形吊轨测试线,可同时承载6-12台机器人,较传统线体节能约25%。质量管理通过自研MES、WMS、QMS系统实现全流程数字化追溯,每台机器绑定...