RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
人工智能中的政治偏见:人工智能模型的现状
一项针对主流AI模型政治偏见的评估显示,6个模型中4个在经济/社会维度上偏左。项目关闭网络搜索,向每个模型重复提问同一组开放问题,用中性分类器分析答案中的立场、回避、拒绝类型和措辞,将多次运行结果绘制为偏差云图(带95%置信区间)。所有原始答案永久存储并可重新计算。用户可参与测验,与模型比对自身立场。项目强调描述性而非规定性,不评判对错。 🔗 阅读原文:https://trakkr.ai/bias
BestBlogs 早报 · 06-26
Dropbox 用 DSPy 构建两阶段反馈闭环,校准 LLM 裁判优化 Agent 提示词,不完整回答减少 26%,token 用量降 5.4%。Cloudflare Workflows 新增 Saga 回滚,`step.do()` 可传 rollback 函数,失败逆序执行补偿。Cursor 揭示 Opus 4.8 和 Composer 2.5...
BestBlogs 早报 · 06-26|Dropbox DSPy 评测优化、Cloudflare Workflows Saga 回滚与出海 C-Corp 架构准备
Dropbox用DSPy构建两阶段评测闭环:人工标注校准LLM裁判后,自动优化Dash Chat提示词,使不完整答案减少26%,遗漏关键信息点减少13%,Token用量下降5.4%。Cloudflare...
Codex+DigitalOcean:一键启动持久云开发环境
现在可以通过 Codex 的 DigitalOcean 插件,用一条提示词启动持久云开发环境,该环境运行在你的 DigitalOcean 账户中,离开后仍保持运行。 🔗 阅读原文:https://x.com/gdb/status/2070281121594827025
华为与湖北移动完成全国运营商首个AI推理加速方案现网测试
华为与湖北移动基于OceanStor A800存储与昇腾A3超节点架构,搭载UCM(推理记忆数据管理)技术,完成全国运营商首个AI推理加速方案现网测试。针对MiniMax M2.5、GLM-5.1等模型,在8K至190K长序列场景下,Token吞吐率最高提升372%。其中MiniMax...
跨模型与任务的 GitHub Copilot agentic harness 性能与效率评估
GitHub Copilot agentic harness 在多个基准测试中表现强劲,同时具备领先的 token 效率,并支持在 20 多个模型间灵活选择。 🔗...
GPT-5.5 与 Codex 创意边界对话
Builders Unscripted with @skirano Pietro 与 @romainhuet 讨论了如何拓展 GPT-5.5 的创意边界,以及使用 Codex 将想法转化为软件。 03:45 图像转化为声音 07:57 多智能体 Codex 工作流 14:34 用 Codex 复活硬件 25:27 从动手到指挥 🔗...
Mistral加强高管团队推动全球扩张
MISTRAL 🔥:Mistral 加强其高管团队以推动全球扩张。 > Johan Bergqvist 被任命为首席财务官 > Brian Hall 被任命为首席营销官 > Kamal Brar 被任命为高级副总裁,合作伙伴与联盟 🔗 阅读原文:https://x.com/testingcatalog/status/2070275955097010493
Meta 隐私感知基础设施的资产分类:混合模式将 LLM 蒸馏为确定性规则
Meta 在 Privacy-Aware Infrastructure (PAI) 的资产分类中采用混合模式:先构建含代码、血缘、语义标注的上下文证据,再调用 LLM 处理歧义、冷启动和新颖资产;人工审核标签与模型推荐严格隔离。LLM 不直接做生产决策,其稳定行为被蒸馏为版本化确定性规则用于生产执行,LLM...
特朗普政府要求 OpenAI 分阶段发布 GPT-5.6
特朗普政府以安全为由,要求 OpenAI 分阶段发布 GPT-5.6。周四,CEO Sam Altman 告知员工,政府将逐客户审批对 GPT-5.6 的访问权限,这一做法极为罕见。AI 研究员 Nathan Lambert 评论称这一时间线"可怕",并呼吁公开背后的原因,以及如何应对能力持续增长的模型世界。 🔗...
AI与法律责任:德国法院裁定谷歌须为AI概览错误负责
德国法院裁定谷歌为其AI概览中引入的错误承担法律责任。安全专家Bruce Schneier认为,AI智能体在法律上应被视为部署者(个人或组织)的代理人,就像公司雇佣人类撰写摘要需为内容不准确负责一样,企业不能以"AI出错"为借口逃避责任,否则将鼓励企业用更廉价的AI替代人类员工并免除其过错后果。 🔗...
理解前沿AI发布的政府安全担忧
更好地了解与前沿AI发布相关的政府安全担忧将非常有用,这样我们就能 (a) 知道当开源达到Mythos级别时,每个人将面临什么风险,以及 (b) 他们是否采取了足够或过多的措施来防止这些风险。 🔗 阅读原文:https://x.com/emollick/status/2070272952210227622
OpenAI GPT-5.6 因政府要求将分批发布,仅限部分合作伙伴
OpenAI CEO Sam Altman 本周三在内部 Q&A 上告知员工,GPT-5.6 将以"有限预览"方式发布,仅向一小部分合作伙伴开放,原因是联邦政府要求。周四备忘录进一步说明,政府将逐个客户审批访问权限。这种发布方式在 AI 行业无先例。评论指出该机制仅限制发布速度而非训练速度,将扩大内部与公众可用能力的差距。传闻规格:上下文窗口从 GPT-5.5 的 100 万 token...
特朗普政府要求下,OpenAI 延迟 GPT-5.6 发布
特朗普政府出于安全担忧,要求 OpenAI 分阶段发布 GPT-5.6。OpenAI CEO Sam Altman 在员工问答中表示,将按联邦政府要求以有限预览形式推出,仅向一小批企业客户开放,政府逐案批准客户访问权限。这与对 Anthropic 的更严厉态度形成对比--Anthropic 本月早些时候被要求暂停 Mythos 5 和 Fable 5...
Claude Code v2.1.193 发布
Claude Code v2.1.193 新增 `autoMode.classifyAllShell` 设置,将全部 Bash/PowerShell 命令经自动模式分类器处理。自动模式拒绝原因现加入转录、拒绝提示及 `/permissions` 页面。新增 `claude_code.assistant_response` OpenTelemetry 日志事件(默认不记录,需设置...
Claude Code v2.1.193 发布
Claude Code v2.1.193 新增 `autoMode.classifyAllShell` 设置,将全部 Bash/PowerShell 命令经自动模式分类器处理。自动模式拒绝原因现加入转录、拒绝提示及 `/permissions` 页面。新增 `claude_code.assistant_response` OpenTelemetry 日志事件(默认不记录,需设置...
BabelTele:LLM间通信压缩文本至27.9%保语义99.5%
新论文"LLMs Do Not Always Need Readable Language"提出BabelTele压缩写作风格,让LLM间通信混合缩写、符号、多语言片段及非传统结构,替代人类自然语言的长文本。即使失去人类可读性,模型仍能回答、记忆并在智能体间传递信息。最强结果:BabelTele保持约99.5%语义保真度,同时将文本压缩至原始长度的27.9%。 🔗...
美国政府将慢速审批分发未来前沿AI模型
The Information文章指出,未来所有前沿模型将只能由美国政府缓慢分发,且需经批准后才能发布。公众即时获取SOTA(最先进模型)的时代很可能结束,但开发速度并不会因此放缓--限制仅针对发布,不针对训练。Andrew Curran补充,这并非暂停或安全胜利,而是让公众与实验室内部模型之间的差距从此不断扩大,过去"AGI已在内部开发出来"的玩笑将真正成为现实。 🔗...
Codex 插件一键启动持久云开发环境
你现在可以通过 @DigitalOcean 的 Codex 插件,在一个提示词内启动一个持久的云开发环境。 它在你的 DigitalOcean 账户中运行,当你离开时仍会持续工作。 🔗 阅读原文:https://x.com/OpenAIDevs/status/2070261549391024403
Show HN: OpenKnowledge--Obsidian/Notion 的开源替代方案
OpenKnowledge 是一款开源、AI 优先的笔记与知识管理工具,可作为 Obsidian 和 Notion 的替代方案。项目代码托管在 GitHub 上。 🔗 阅读原文:https://github.com/inkeep/open-knowledge
Grok Imagine登顶Vercel AI视频模型榜首
重磅:Grok Imagine 现已成为 Vercel AI Gateway 上排名第一的 AI 视频模型。 • 约 51% 的视频生成来自 Grok。 • 份额超过其他所有顶级视频模型的总和。 • Grok Imagine Video 1.5 Preview 也位列前五。 Grok 正在绝对主导 AI 视频领域。 🔗...
MiniMax M3将亮相AI Engineer活动
我们将于7月1日参加AI Engineer After Dark活动,与@vercel、@merge_api、@FactoryAI以及众多构建AI工程栈的开发者们相聚。 我们的研究负责人、RL训练专家@olive_jy_song将发表一场关于MiniMax...
Codex 在 ChatGPT 移动 App 正式可用
OpenAI 宣布 Codex 在 ChatGPT 移动应用中正式开放(GA),并新增一对一设备配对实现更安全的手机与电脑连接。移动端新增通知、目标、侧边聊天、文件预览及内联审阅评论功能。此前预览版已明确,用户可通过 ChatGPT 移动 App 启动新工作、审查输出、引导执行和批准下一步,而 Codex 实际继续在笔记本、Mac mini 或开发机上后台运行。 🔗...
Codex 在 ChatGPT 移动 App 正式可用
OpenAI 宣布 Codex 在 ChatGPT 移动应用中正式开放(GA),并新增一对一设备配对实现更安全的手机与电脑连接。移动端新增通知、目标、侧边聊天、文件预览及内联审阅评论功能。此前预览版已明确,用户可通过 ChatGPT 移动 App 启动新工作、审查输出、引导执行和批准下一步,而 Codex 实际继续在笔记本、Mac mini 或开发机上后台运行。 🔗...
OpenAI GPT-5.6 因政府要求延迟发布
OPENAI 🔥:据 The Information 报道,GPT-5.6 因联邦政府要求而推迟发布。 美国政府可能要求 AI 实验室在模型发布前获得批准。 新现实 👀 🔗 阅读原文:https://x.com/testingcatalog/status/2070253352840028408
美国政府要求OpenAI暂缓GPT-5.6广泛发布
The Information 报道,美国政府因安全顾虑要求 OpenAI 暂缓 GPT-5.6 的广泛发布,改为推出受控预览版。OpenAI 计划先向小部分合作伙伴提供早期访问,并由政府逐客户审批准入。这一非常规做法主要担忧模型在自动化高技能网络工作上的能力:既能帮防御者更快发现漏洞,也可能被攻击者用于加速测试漏洞利用。本周四,CEO Sam Altman 已向员工确认该审批流程。 🔗...
美国政府要求OpenAI暂缓GPT-5.6广泛发布
The Information 报道,美国政府因安全顾虑要求 OpenAI 暂缓 GPT-5.6 的广泛发布,改为推出受控预览版。OpenAI 计划先向小部分合作伙伴提供早期访问,并由政府逐客户审批准入。这一非常规做法主要担忧模型在自动化高技能网络工作上的能力:既能帮防御者更快发现漏洞,也可能被攻击者用于加速测试漏洞利用。本周四,CEO Sam Altman 已向员工确认该审批流程。 🔗...
Viktor:多模型AI员工,支持3200+工具
如我所言,已有公司把"AI员工"这件事做得非常出色。 @viktor__com 就是其中之一。 最棒的是你不会被锁定在单一模型上--你确实需要这一点。Viktor 可在 Slack 和 Teams 中运行,支持任意模型,连接 3200+ 工具。 🔗 阅读原文:https://x.com/omarsar0/status/2070251346536620429