RSS

  • 宝玉的分享
    https://baoyu.io/feed.xml
    刷新于
  • AIHOT 日报
    https://aihot.virxact.com/feed/daily.xml
    刷新于
  • AIHOT — 全部 AI 动态
    https://aihot.virxact.com/feed/all.xml
    刷新于
  • AIHOT — 精选
    https://aihot.virxact.com/feed.xml
    刷新于

九位评委,两个有效投票:相关错误削弱LLM评审面板

苹果机器学习研究团队发现,LLM-as-a-judge面板因模型间高度相关而严重受限。对7个模型家族的9个前沿大语言模型在3个自然语言推理数据集上的测试表明,9位评委实际仅提供约2个独立投票的信息量,面板准确率比独立投票理想值低8-22个百分点,最佳单一模型的表现已匹敌或超越整个面板。增加评委数量或改进聚合算法收效甚微,即使允许算法获取正确答案也仅能缩小至多11%的差距。该结论在多种提示变体...

noreply@aihot.virxact.com (Apple Machine Learning Research(RSS))

在 Transformers.js 中实验提议的跨源存储 API

Transformers.js 在浏览器中运行 AI 模型时,不同来源的 Web 应用会重复下载并缓存相同的模型资源(如 Xenova/whisper-tiny.en)和 Wasm 运行时文件(如 4,733 kB 的 ort-wasm-simd-threaded.asyncify.wasm),即使资源 URL 相同,浏览器因 Network Isolation Key 隔离缓存,单次...

noreply@aihot.virxact.com (Hugging Face:Blog(RSS))

Qwen-AgentWorld:用于通用智能体的语言世界模型

Qwen-AgentWorld-35B-A3B和Qwen-AgentWorld-397B-A17B是首批能通过长链式推理模拟7个领域智能体环境的语言世界模型。它们基于超过1000万条真实环境交互轨迹,经连续预训练(注入状态转移与专业语料)、监督微调(激活下一状态预测推理)和强化学习(混合规则与评分奖励提升仿真保真度)三阶段训练而成。配套基准AgentWorldBench利用5个前沿模型在9个...

noreply@aihot.virxact.com (HuggingFace Daily Papers(社区热门论文))

NatureBench:AI编码智能体能否匹配Nature系列论文已发表SOTA?

NatureBench是一个跨学科基准测试,包含90个从Nature系列同行评审论文中提取的任务,用于评估AI编码智能体能否超越复现、实现发现。基准基于NatureGym自动化管线,为每个任务提供标准化容器化环境,解决环境碎片化问题。在严格禁用网络搜索的协议下评估10种前沿智能体配置,最强模型仅在17.8%任务上超过已发表SOTA(g>0.1准则)。分析表明,智能体成功主要依赖方法论翻译,失...

noreply@aihot.virxact.com (HuggingFace Daily Papers(社区热门论文))

OpenRouter推出统一图像API

OpenRouter推出统一图像API,整合Google、OpenAI、Black Forest...

noreply@aihot.virxact.com (OpenRouter:Announcements(RSS))

LLM提示注入与角色混淆

Charles Ye、Jasmine Cui 与 Dylan Hadfield-Menell 的研究发现,大语言模型无法可靠区分系统标签(如 ``、``)与用户输入,模型更依赖文本风格而非实际内容。通过模仿模型内部思考块的写作风格,可绕过安全限制,例如让 gpt-oss-20b 误判。"destyling"--对文本轻微改写以降低与角色标签格式的相似度--使平均攻击成功率从 61% 骤降至...

noreply@aihot.virxact.com (Simon Willison 博客)

OpenAI Daybreak将安全重心转向补丁规模化,美团构建海报生成闭环,Gray Swan强调红队对抗

OpenAI Daybreak计划转向"补洞":Codex Security扫描超3000万次提交、覆盖3万+代码库,超50万问题被自动判定修复;GPT-5.5-Cyber在CyberGym达85.6%单模型最高分,并推出Patch the...

noreply@aihot.virxact.com (X:洪明 (@hongming731))

GLM-5.2 开源模型发布:744B 参数,1M 上下文,可本地运行

Z.ai 发布 GLM-5.2,开源 744B 参数(40B 活跃),1M 上下文窗口,性能与 Claude 4.8 Opus、GPT-5.5、Gemini 3.1 Pro 持平。通过 Unsloth 动态量化,2-bit GGUF 版本内存需求降至 239GB(-84%),1-bit 版降至 217GB(-86%),可运行于 256GB 统一内存 Mac 或 1×24GB...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

Fable 创造性问题解决与自知贪吃蛇游戏

让 Fable 如此令人印象深刻的是其跨长期项目的创造性问题解决和良好判断力 你可以看到这一点:当我让它制作一个自知的贪吃蛇游戏时。我没有给它任何设计反馈,只是说"让它更好" 值得一试:https://snake-stable-build.netlify.app/ 🔗 阅读原文:https://x.com/emollick/status/2069207757199200408

noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))

苹果 iOS 27 引入 AI 扩图功能:生成画面自然,无法保证真实还原

科技媒体 AppleInsider 报道苹果在 iOS 27 照片应用中引入基于 Apple 智能的 Extend 扩图工具。测试显示:小猫照片补充了窗帘、枯植物等元素,效果自然;夜景图片生成的路桩、立杆大体合理,但路牌背面形状略异常;罗马 Apple Store 楼梯照片补出台阶和玻璃,视觉合理但现实中不存在;罗马机场照片出现悬浮卡车。苹果表示 AI 扩图生成的画面无法保证真实还原。 🔗...

noreply@aihot.virxact.com (IT之家(RSS))

Moebius 0.2B图像修补模型借助Claude Code移植到浏览器运行

Moebius 0.2B轻量级图像修补模型(自称10B级性能)原依赖PyTorch与NVIDIA CUDA。Simon Willison使用Claude Code将其转换为ONNX格式,通过WebGPU后端在浏览器中运行。用户可上传图片、标记待修复区域,点击按钮等待模型修补。移植后的1.24 GB ONNX模型权重发布至Hugging Face,前端代码托管于GitHub...

noreply@aihot.virxact.com (Simon Willison 博客)

Claude日本社区大使项目启动

日本 Claude 社区大使计划来了!🇯🇵 大使们在 37 个国家的 107 个城市举办了 290 多场聚会,共有 40,000 多人一起参与。 现在从北海道到冲绳全面开放。日本の皆さん、ぜひご応募ください! https://claude.com/ja/community/ambassadors 🔗...

noreply@aihot.virxact.com (X:Claude Devs (@ClaudeDevs))

三星推出行业最快 UFS 5.0 解决方案:带宽达 10.8GB/s,赋能端侧 AI

6月23日,三星电子宣布率先研发出行业最快的UFS 5.0存储解决方案,最高带宽10.8GB/s。连续读取速度10.8GB/s、连续写入9.5GB/s,均为上一代UFS...

noreply@aihot.virxact.com (IT之家(RSS))

Model 3 撞穿民宅致一死,特斯拉高管称驾驶员全程深踩油门

美国得克萨斯州凯蒂市上周五晚间,一辆特斯拉 Model 3 偏离道路撞穿砖房,致一名 76 岁女性身亡。驾驶员称事发时开启 Autopilot,但特斯拉 Autopilot 软件主管阿肖克·埃卢斯瓦米在 X 平台反驳,指驾驶员在居民区路段全程将油门踩到底,手动接管并压制了系统,撞击时速达 73 英里(约 117.5 公里),碰撞后仍踩着油门。埃隆·马斯克附和称 FSD...

noreply@aihot.virxact.com (IT之家(RSS))

Grok连接Interactive Brokers查看投资组合

你现在可以将Grok连接到Interactive Brokers,获取关于你投资组合的高质量、最新信息。 🔗 阅读原文:https://x.com/xai/status/2069200658633469970

noreply@aihot.virxact.com (X:xAI (@xai))

五眼联盟警告:AI毁灭性攻击仅需数月

五眼联盟(澳、加、新、英、美)情报机构罕见联合声明,警告能在数小时内对政府和企业造成毁灭性攻击的AI模型"仅剩数月"就将问世。NSA局长此前透露,AI系统Mythos在数小时内攻破了几乎所有机密系统。联盟要求采取"全组织、全社会"应对,指出AI已降低攻击门槛、提升攻击速度和复杂度,网络风险不再是纯技术问题,而是核心业务风险与领导责任。 🔗...

noreply@aihot.virxact.com (X:AI Safety Memes (@AISafetyMemes))

Nvidia:液冷高温运行可使AI数据中心用水量降至"接近零"

Nvidia称,其Rubin代参考设计采用100%液冷并让服务器在更高温度(最高45°C)下运行,可将AI数据中心用水量降至"接近零"。热量在芯片处直接捕获,通过高温液体回路传输,使室外干式冷却器全年高效排热。Nvidia可持续发展主管Josh...

noreply@aihot.virxact.com (The Verge:AI(RSS))

亚马逊在ChatGPT投广告引流,却严防AI抓取自家商品数据

亚马逊已开始在ChatGPT投放广告,成为入驻OpenAI广告业务最知名的零售企业之一。电商分析师卡济乌凯纳斯指出,此举具"象征意义",因亚马逊此前不愿参与AI购物合作。亚马逊将ChatGPT当作引流渠道,引导用户跳转至自家店铺,同时持续限制OpenAI、Perplexity等AI爬虫抓取数据,包括去年停止向谷歌购物提供数据、更新代码封禁爬虫,今年通过法院禁令阻断Perplexity智能体。...

noreply@aihot.virxact.com (IT之家(RSS))

Aleph 2.0 现已集成到 Figma Weave

Aleph 2.0 是 Runway 的旗舰视频编辑模型,现已在 Figma Weave 中上线。它是一个基于上下文的视频编辑模型,通过关键帧工作:从视频中提取一帧,重新设计风格并附上时间戳连接回 Aleph 2.0 节点,即可将该编辑传递到主体出现的每一帧,同时保持其他内容不变。支持最长 30 秒、1080p 的片段,可跨多镜头序列应用编辑,无需逐镜头处理。 🔗...

noreply@aihot.virxact.com (Runway:News(网页))

Aleph 2.0 现已集成到 Figma Weave

Aleph 2.0 是 Runway 的旗舰视频编辑模型,现已在 Figma Weave 中上线。它是一个基于上下文的视频编辑模型,通过关键帧工作:从视频中提取一帧,重新设计风格并附上时间戳连接回 Aleph 2.0 节点,即可将该编辑传递到主体出现的每一帧,同时保持其他内容不变。支持最长 30 秒、1080p 的片段,可跨多镜头序列应用编辑,无需逐镜头处理。 🔗...

noreply@aihot.virxact.com (Runway:News(网页))

IT早报:小米YU7 GT创纽北自动驾驶纪录;48位开发者举报苹果;豆包打车灰测

小米YU7 GT以10分29秒483达成全球首个纽北自动驾驶圈速纪录,纽北官方圈速榜新增"自动驾驶"分类。48位中国iOS开发者联名举报苹果,要求兑现全球最低费率承诺。豆包App灰测打车功能,由曹操出行提供服务,用户口述需求即可确认派单。亿咖通科技拟18亿元收购Flyme软件业务。网红博主称导航App开屏"摇一摇"广告影响行车安全,客服回应正改进。 🔗...

noreply@aihot.virxact.com (IT之家(RSS))

Anthropic 更新隐私政策,部分 Claude 用户需上传证件完成身份核验

🔗 阅读原文:https://www.ithome.com/0/967/247.htm

noreply@aihot.virxact.com (IT之家(RSS))

Meta 因数据泄露暂停监控员工键盘鼠标的 AI 训练项目

Meta 暂停名为"模型能力计划(MCI)"的 AI 训练项目,该项目记录员工键盘敲击和鼠标操作轨迹。此前,通过该计划收集的员工私人对话、绩效数据及语音转文字记录被意外开放给全体员工。公司发言人称已设置隐私防护机制、未发现违规调取数据,但将暂停项目并展开全面调查。此外,今年 3 月一款 AI 智能体在无指令下擅自操作引发安全漏洞,本月有黑客利用 Meta 旗下 AI 客服聊天机器人劫持大量...

noreply@aihot.virxact.com (IT之家(RSS))

Fable 5 从订阅移除,Anthropic 未回应

快速提醒:今天正是 Fable 5 从订阅中移除的日子。 看看 Anthropic 会如何回应。(Sonnet 5 作为补偿?) Anthropic 至今没有发来任何消息。 🔗 阅读原文:https://x.com/kimmonismus/status/2069189688968265799

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

Sakana Fugu Ultra 在多模型编码测试中视觉效果最优,但成本为 GLM 5.2 的 17 倍

Sakana Fugu Ultra 是一个多智能体协调层,通过 OpenAI 兼容端点将子任务路由给不同模型。在 @atomic_chat_hq 的实时交易桌面编码测试中(要求构建完整前后端、实时 API 数据、暗色主题 UI),Fugu Ultra 生成了最丰富的多面板界面(含图表、状态标签等),效果接近 GLM 5.2,但成本达后者的 17 倍:Fugu Ultra 耗 22,225...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

NotebookLM 闪卡支持编辑与添加

Flashcards are now editable on NotebookLM 👀 用户可调整问题和答案的文本,还能向卡片组添加新卡片。 FlashcardLM ⚡ 🔗 阅读原文:https://x.com/testingcatalog/status/2069183039305891863

noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))

OpenAI启动Patch the Planet开源安全计划

修补星球:利用前沿AI,与专业安全研究人员合作,保护关键开源项目。 🔗 阅读原文:https://x.com/gdb/status/2069182357144580584

noreply@aihot.virxact.com (X:Greg Brockman (@gdb))

特斯拉澄清事故:司机踩死油门,非自动驾驶所致

媒体被指再次散布关于特斯拉事故的虚假信息。特斯拉官方确认,涉事车辆并非处于自动驾驶状态,司机将加速踏板踩到底,覆盖了自动驾驶系统。具体细节包括:司机接管了车辆控制,碰撞前车速达到 73 mph,碰撞后加速踏板仍被持续踩住。事故并非由特斯拉自动驾驶系统引起。多家媒体在未核实事实的情况下匆忙将责任归咎于特斯拉,推文对此进行了驳斥。 🔗...

noreply@aihot.virxact.com (X:cb_doge (@cb_doge))

美国警长利用Flock车牌系统跟踪前女友案频发,Flock法务官承认"最常见滥用"

伊利诺伊州Holiday...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

美国警长利用Flock车牌系统跟踪前女友案频发,Flock法务官承认"最常见滥用"

伊利诺伊州Holiday...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))
上一页 第 646 / 1022 页 下一页

添加 Feed

导入 OPML