RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
美国AI实验室蒸馏争议:API与监管之困
归根结底,如果美国实验室不想被蒸馏,他们就不该提供API。看起来他们最终会对某些模型这么做,这是他们的选择。 更严格的监管实际上不会奏效,反而会伤害美国的初创公司。
开源AI禁令有损美国价值观
禁止任何形式的开源AI将是错误。与@kevinsxu共同发布的一则面向公众的公告,阐述为何开源维护美国价值观。 管理前沿风险是困难的,但通过削弱开放前沿来减少透明度、创新和教育将更糟。
Claude Fable 5:SWE任务性价比存疑
正如我之前所说,考虑到成本和性能,我认为 Fable 对于很多 SWE 任务来说并不值得。 需要说明的是,我认为 Fable 非常出色,它在设计和创意方面明显表现优异。 等它重新上线后,我会用自己的循环测试它(并衡量前沿效率)。
SAP 与 Google Cloud 部署智能体商务架构
SAP 与 Google Cloud 联合部署智能体商务架构,通过 Universal Commerce Protocol 标准化零售商、支付网关与自主智能体之间的数据交换,实现从搜索、交易到售后的全序列自动化执行。SAP Commerce Cloud 集成 Google Gemini 能力构建 Shopping...
GLM 5.2 辅助开发安卓 App 体验
开发者使用 GLM 5.2 从零开始完成第一个安卓 App 开发,包括安装 Android Studio、编写代码到最终生成 APK。GLM 5.2 在大部分问题上能提供有效指导,但遇到疑难杂症时安卓系统仍难处理。作者指出当前 vibe coding 模式在电脑和 Web 端调试最为方便。
AI情绪转向负面,需加强教育
我们仍有许多工作要做。公众情绪正日益转向反对AI。 现在出现了反对数据中心、乃至整体AI的运动;怨恨情绪正在增长。 虽然其中无疑存在合理的担忧--比如对失业和能源价格上涨的恐惧--但其中很大一部分只是单纯的怨恨,需要通过教育和提高认知来解决。
人形机器人Pemba登顶6200米火山,基于宇树G1改装,目标挑战珠峰
一台由宇树G1改装、名为Pemba的人形机器人成功抵达厄瓜多尔钦博拉索火山海拔6200米顶峰。这是机器人"三冠"探险计划第一站,未来将挑战珠穆朗玛峰。项目初衷为解决自然保护区固定摄像头覆盖有限、成本高的问题;配备摄像头、传感器、卫星通信和机载AI后,Pemba可自主巡查大范围区域。坡度低于30度时独立行走,冲顶阶段陡峭地形需人员协助。下一阶段将用强化学习提升自主能力。团队为高海拔严寒开发了专...
AA-Briefcase 基准测试:最佳 AI 模型仅完全解决 3% 真实知识工作
Artificial Analysis 推出的 AA-Briefcase 基准测试将 AI 模型置于包含数千份 Slack 消息、邮件、会议记录等碎片化源文件的多周知识工作项目中。表现最好的 Claude Fable 5 通过率最高,但仅在 3% 的任务中完全达标;91 个任务中有 31 个没有任何模型达到 50%...
通用智能体必须记住什么?
该论文指出,通用智能体不能仅依赖当前观测,必须记住隐藏环境规则。当两个隐藏域在相同可见状态下要求相反动作时,仅凭观察无法区分当前场景。作者证明,要在两个域都表现良好的智能体,必须为不同域维持不同的内部记忆状态。核心结论:好的通用智能体不是对当前所见做出反应,而是必须携带来自先前经验的隐藏上下文。
Mistral AI向Pro用户发布Code on Vibe桌面应用确认
Mistral AI 向 Pro 用户发布了 Code on Vibe。桌面应用也已确认。 很快 👀
Datasette 发布插件 datasette-apps:在 Datasette 中托管自定义 HTML 应用
Datasette 发布新插件 datasette-apps,允许托管自包含 HTML+JavaScript 应用。应用在严格沙箱中运行(sandbox 属性和 CSP 头),无法访问 cookies、localStorage 或外部 HTTP 请求,防止数据泄露。应用可用 JavaScript 对 Datasette 数据执行只读 SQL 查询,若配置存储查询还可写入。应用与父窗口通过...
新研究:最强LLM也无法完全免疫越狱--Fable 5与Opus 4.8自动化红队攻击分析
新研究对Anthropic Fable 5和Opus 4.8进行自动化红队攻击,持续改写有害提示词直至模型拒绝或生成坏答案。Fable 5最差攻击成功率6.1%,Opus...
医疗保健基准测试的质量取决于其隐含假设
LLM在作为医疗助手时,评估与部署场景下的性能存在显著差距--Bean等人(2025)发现准确率相差61个百分点。这一差距并非源于基准测试设计缺陷,而是因为评估协议中嵌入的隐含假设在部署时不再成立。研究提出将假设分为任务假设和结果假设两类,用以诊断差距成因并明确弥合路径:需将假设显式化、检验哪些假设在部署中成立,并据此更新评估协议。
禁止开源AI将是一个错误
近期行政命令、国会提案及对Anthropic最先进模型的境外访问限制,可能开启新一轮AI监管。开源软件已支撑全球90%以上软件并创造8万亿美元经济价值,在教育、创新和竞争三方面持续赋能。Anthropic与OpenAI的封闭模型加剧市场集中,开源(尤其开放权重)是初创公司、教育机构和企业获得替代方案的唯一平衡力量。开源透明性使其更安全,更多工程师可剔除不需要的模型行为或修复漏洞。以中国竞争为...
禁止开源AI将是一个错误
近期行政命令、国会提案及对Anthropic最先进模型的境外访问限制,可能开启新一轮AI监管。开源软件已支撑全球90%以上软件并创造8万亿美元经济价值,在教育、创新和竞争三方面持续赋能。Anthropic与OpenAI的封闭模型加剧市场集中,开源(尤其开放权重)是初创公司、教育机构和企业获得替代方案的唯一平衡力量。开源透明性使其更安全,更多工程师可剔除不需要的模型行为或修复漏洞。以中国竞争为...
99% AI芯片初创失败因软件难
100%的AI芯片初创公司都有幻灯片/"模拟性能数据"显示它们的芯片好得多,但99%的定制ASIC失败了。为什么?直到你意识到AI芯片是关于软件的,MATH才算是MATH。构建芯片并把数字放到幻灯片上相对容易;构建出色的软件很难。这就是为什么99%的AI芯片初创公司会失败。
社区开发者基于 VoxCPM2 和 ComfyUI 构建 VoiceGate,实现跨语言视频配音
社区开发者基于 VoxCPM2 与 ComfyUI 构建了 VoiceGate,实现自动语音提取(ASR)、大语言模型翻译、多语言语音合成(支持 30 多种语言和 9 种方言,含语音克隆与音色设计)、时间戳对齐音频以及背景音分离混音。核心创新 VoiceBridge 插件首次在 ComfyUI 中引入 SRT 时间戳驱动的 TTS 对齐,实现字幕级精细控制,解决 AI...
Allbirds 转型 AI 后更名为 Smartbird,新 CEO 计划部署托管计算集群
鞋履品牌 Allbirds 4 月宣布转型 AI,以 4300 万美元出售鞋业务并从股市融资 1 亿美元,更名为 Smartbird。前 AWS 高管、工程博士 Nadia Carlsten 昨日起出任 CEO,年薪 70 万美元并获价值约 900 万美元股票。Smartbird 定位 AI...
Cloudflare 为 AI 智能体推出临时账户
Cloudflare 在 Workers 上推出临时账户(Temporary Accounts),允许 AI 智能体直接运行 `wrangler deploy --temporary`,在数秒内获取一个可用的实时 Worker,无需绕开面向人类设计的部署流程。该功能旨在降低智能体部署门槛。
Cloudflare 为 AI 智能体推出临时账户
Cloudflare 在 Workers 上推出临时账户(Temporary Accounts),允许 AI 智能体直接运行 `wrangler deploy --temporary`,在数秒内获取一个可用的实时 Worker,无需绕开面向人类设计的部署流程。该功能旨在降低智能体部署门槛。
中国若获ASML级EUV技术的潜在影响
EUV光刻机依赖德国ZEISS光学、ASML整机及台积电组装构成的工业生态系统,中国被禁多年。华为Ascend芯片在部分负载中达H100级60%-80%性能,但软件、内存和训练基建仍落后。近期路透社报道前ASML工程师助中国在深圳逆向建造EUV原型,美政府担忧中国已接触ASML敏感技术,ASML否认。若中国真正掌握EUV,虽不能立即量产,但可能缩短芯片追赶周期、加速华为路线图,削弱西方在AI...
/youtube-notetaker:YT 视频转 Artifacts
YT 视频 -> Artifacts 看看我如何使用新的 /youtube-notetaker 技能从 YT 视频生成 Artifacts。 捕获幻灯片、笔记、转录内容…… 快去试试 ↓
/youtube-notetaker:YT 视频转 Artifacts
YT 视频 -> Artifacts 看看我如何使用新的 /youtube-notetaker 技能从 YT 视频生成 Artifacts。 捕获幻灯片、笔记、转录内容…… 快去试试 ↓
国家邮政局:加快推进无人车、无人机在邮政快递行业试点应用
国家邮政局召开党组会议审议《邮政业发展"十五五"规划》,强调强化企业科技创新主体地位,深化科教与产教融合。会议提出推动大数据、互联网、人工智能等新技术与邮政快递业深度融合,加快推进无人车、无人机行业试点应用,并加快智能派件、智能路由等先进技术落地。此前今年1月全国邮政工作会议已明确将出台加快推广应用无人配送技术的政策文件。同时推广智能分拣、智能云仓、智能安检等自动化设施,以及循环包装、新能源...
黄仁勋威胁新云:不买全套就削减芯片配额
Bessemer 合伙人 Adam Fisher 称,一些新云公司担心若未购买英伟达全套硬件,可能被"关进 Jensen 监狱"--即失去芯片配额。黄仁勋似乎在暗示,若不买全套就会削减配额。主推文称正在出售,有意者私信询价。
智谱GLM体验获赞:能力国产第一档
用户@justinleei分享从年初至今的智谱GLM使用体验:订阅GLM完成两个项目(1个商用上线),认为其多种文档格式解析综合能力优于竞品,与Claude Code体验无明显差距。期间算力紧缺时出现过降智,响应慢但结果可接受。近期使用的zcode比第三方agent更快。主推文@berryxia赞同此评价,认为智谱能力当前为国产模型第一档,甚至优于DeepSeek。
白宫与Anthropic合作制定AI模型越狱评估框架
白宫与Anthropic正合作制定正式技术评估框架,用于量化AI模型越狱攻击的严重性,并建立标准化评估方法论。框架将开发通用基准,评估防护被绕过程度、暴露的能力、攻击可重复性及实际运营后果。双方认识到完全免疫越狱并非可行目标。近期红队研究表明,强化后的前沿模型Fable 5比Opus 4.8更鲁棒,但在持续自动化攻击下仍产生有害输出。新框架每次以相同问题衡量风险,被视为更务实的监管路径。
麻省理工学院新研究:过度依赖聊天机器人或削弱批判思维
麻省理工学院一项为期4周、67人参与的研究发现,过度依赖AI助手可能削弱批判性思维。实验使用基于GPT-4o并接入谷歌搜索的聊天机器人,参与者借助AI判断新闻标题和图片真伪时,正确概率提高21%,但在无AI帮助时独自识别错误信息的表现下降15.3%。研究指出,AI直接给出答案而非引导思考,短期内提升准确率,长期却削弱独立判断力,约四分之一参与者误以为能力提升,实际表现已变差。