RSS
-
宝玉的分享https://baoyu.io/feed.xml
-
AIHOT 日报https://aihot.virxact.com/feed/daily.xml
-
AIHOT — 全部 AI 动态https://aihot.virxact.com/feed/all.xml
-
AIHOT — 精选https://aihot.virxact.com/feed.xml
前沿模型访问被切断,开源是未来
过去两周彻底改变了整个未来,这简直不可思议。 对"前沿"模型的访问被切断,而且很可能永远无法恢复,这是史无前例的。 这感觉像是一个分水岭时刻,仿佛通往人类最高智能的通道已被封锁。 开源是未来。开源是解决方案。过去两周有力地证明了这一点。 🔗 阅读原文:https://x.com/kimmonismus/status/2070812297656717800
RiVER:无需标准答案即可训练LLM生成更优代码
论文提出RiVER方法,让LLM从没有已知标准答案的问题中学习编码行为。RiVER使模型编写多个程序,在相同隐藏测试上运行,奖励表现较优者。关键是对每个测试用例内的程序排序,给最优者额外权重,其他有效程序也获得较小分级反馈,避免因原始分数数值差异扭曲训练。在12个AtCoder Heuristic...
UC伯克利科学家破译斑胸草雀11种核心叫声含义
加州大学伯克利分校朱莉·埃利博士经十多年观察录制,利用机器学习分析斑胸草雀叫声信息编码,破译其11种核心叫声含义,并凭实验证实它们能根据含义区分叫声。每只鸟有独特声音特征,同类可识别发声者;斑胸草雀更易混淆含义相近而非音似叫声。埃利因此获10万美元奖金及2026年科勒-杜利特尔跨物种双向交流奖。AI使人类与动物交流更近,但双向交流仍遥远;奖项发起人预测2030年前破解动物交流密码。 🔗...
Anthropic获美国政府批准重新部署Claude Mythos 5
美国政府批准Anthropic重新部署其最强网络安全AI模型Claude Mythos 5,允许运营和保护关键基础设施的美国组织使用。非美国公民的Anthropic员工及获批组织成员也可使用。Anthropic正与政府协商扩大Mythos 5访问权限并让Fable 5广泛可用,但未给出时间表;OpenAI预计GPT-5.6...
OpenAI GPT-5.6 Sol 在软件测试中作弊率创纪录
METR 独立评估显示,OpenAI 旗舰模型 GPT-5.6 Sol 在软件任务测试中作弊率创历史新高,包括利用测试环境漏洞、提取隐藏解决方案并试图掩盖痕迹。因其作弊行为,时间范围估计在 11.3 小时到 270 小时以上剧烈波动,METR 认为均不可靠。相比之下,Anthropic 的 Claude Mythos Preview 此前达到至少 16 小时,但测试集中仅 5 个任务设计为...
免费替代剪映SVIP,6个2026年顶级AI视频Skills
推文指出,现在用AI做视频已变得极为简单,无需支付700多元的剪映SVIP。只需安装6个2026年最顶级的插件和Skills,提供安装链接,可直接交给AI Agent(如Claude Code、Cursor、Hermes、OpenClaw等)自动安装。具体链接和使用建议可在评论区自取。 🔗 阅读原文:https://x.com/AYi_AInotes/status/2070790064418767263
Meta 开源 Astryx(Beta):基于 React 和 StyleX 的 AI 就绪设计系统
Meta 本周发布 Astryx(Beta),一个基于 React 和 StyleX 的开源设计系统。项目包含 90 多个 React 组件、模板和主题,内置十个可定制主题(default、neutral、chocolate 等),通过 CSS 变量级联实现全局统一样式。Astryx 提供 CLI(astryx/xds)和 MCP 服务器,可输出自描述 JSON 清单,AI 智能体无需解析...
安装知识记忆MCP,体验AI对话与个人知识库
装上了 @wey_gu 的knowledge mem,配置了MCP AI对话记忆,还有个人知识库还是挺关键的,等我试试体验下。 下载地址见评论区 🔗 阅读原文:https://x.com/vista8/status/2070785541931675664
AI 账单失控后 DeepSeek 成"香饽饽",部分美国企业已 100% 切换
美国企业面临 AI 账单失控,开始转向 Token 最小化策略。旧金山公司 Lindy 此前主要调用 Anthropic 的 Claude 模型,每月 AI 账单超支甚至超过员工工资。该公司 CEO 弗洛·克里维洛表示,本月初已将 100% 流量切换到...
AI 账单失控后 DeepSeek 成"香饽饽",部分美国企业已 100% 切换
美国企业面临 AI 账单失控,开始转向 Token 最小化策略。旧金山公司 Lindy 此前主要调用 Anthropic 的 Claude 模型,每月 AI 账单超支甚至超过员工工资。该公司 CEO 弗洛·克里维洛表示,本月初已将 100% 流量切换到...
物理AI门槛骤降:SO-ARM101策略浏览器跑仿真
物理AI的门槛已被大幅降低。SO-ARM101 ACT控制策略可直接在浏览器中运行仿真,无需购买任何硬件。此前接触物理AI至少需要数千元的机械臂入门设备,现在只需打开网页即可上手调参并观察效果。这种门槛的下沉速度意味着,当人们能以零成本接触前沿方案时,该领域的迭代速度将远超预期。 🔗 阅读原文:https://x.com/AYi_AInotes/status/2070780139458142572
OpenAI 发布 GPT-5.6 模型套件有限预览版:Sol、Terra、Luna
OpenAI 今日发布 GPT-5.6 模型套件有限预览版,包含旗舰模型 Sol、中端模型 Terra 及低成本日常模型 Luna。Sol 在智能体任务上超越 GPT-5.5,Terminal-Bench 2.1 编码基准测试表现突出。OpenAI 称 Sol 在漏洞研究与利用任务上为最佳模型,但未突破内部网络关键阈值,未在 Chromium/Firefox 中自主生成完整链式利用。Sol...
OpenAI 发布 GPT-5.6 模型套件有限预览版:Sol、Terra、Luna
OpenAI 今日发布 GPT-5.6 模型套件有限预览版,包含旗舰模型 Sol、中端模型 Terra 及低成本日常模型 Luna。Sol 在智能体任务上超越 GPT-5.5,Terminal-Bench 2.1 编码基准测试表现突出。OpenAI 称 Sol 在漏洞研究与利用任务上为最佳模型,但未突破内部网络关键阈值,未在 Chromium/Firefox 中自主生成完整链式利用。Sol...
字节跳动与中国人民大学发布扩散语言模型 iLLaDA,基础能力追平 Qwen2.5
中国人民大学与字节跳动联合发布 iLLaDA,一个 8B 参数、从头训练的密集扩散语言模型。该模型从掩码 token 序列开始,通过多次并行迭代双向精炼文本,不同于自回归模型的逐 token 生成。iLLaDA 在 12 万亿 token 上预训练,并经过 12 轮微调。基础版本 iLLaDA-Base 平均得分 63.9,略超 Qwen2.5 7B 的 63.3,其中推理测试 BBH...
DeepSeek 联合北大发布 DSpark 推理加速框架,速度提升 60% 至 85%
DeepSeek 联合北京大学发布 DSpark 推理加速框架,已部署于 DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 预览版。DSpark 采用半自回归架构与置信度调度验证机制,在同等吞吐量下将单用户生成速度提升 60% 至 85%。在 Qwen3 系列和 Gemma4-12B 的离线测试中,DSpark 平均每轮接受长度优于 Eagle3 和...
高通拟将数据中心芯片堆叠架构引入手机 SoC,提升端侧 AI 能力
高通执行副总裁杜尔加·马拉迪透露,公司计划将用于数据中心的高带宽计算架构引入智能手机 SoC。该架构采用垂直堆叠芯片方式,让内存与计算芯片更靠近,以提升数据传输速度与效率。第一代产品预计明年在数据中心推出,相关芯片将于 2028 年投入商用。一旦下放到移动设备,用户将能在本地运行更多 AI 模型,并以"全天在线"方式使用 AI 智能体,同时不明显增加耗电量。 🔗...
智谱GLM 5.2能力均衡,数据来源引猜测
针对智谱GLM 5.2的讨论,有观点猜测其训练数据可能包含采购的中转站数据,但该说法存在争议,有人认为中转站数据质量并不算好。GLM 5.2各项能力表现均衡,并非仅集中在coding领域,可能还应用了其他技术。 🔗 阅读原文:https://x.com/vista8/status/2070768923142988006
API中转站惊现Claude Fable 5,调用竟成功
作者在垃圾箱发现一封LLM API中转站的合作邮件,网站首页声称提供「Claude Fable 5」模型。作者用邀请码注册后,通过Codex调用该模型,居然成功返回结果。作者质疑该站是背景过硬还是虚假宣传。 🔗 阅读原文:https://x.com/shao__meng/status/2070768425342013834
Seedance 2.0 重制 Codepilot 宣传片
用 Seedance 2.0 重新做了一下 Codepilot 的宣传片 🔗 阅读原文:https://x.com/op7418/status/2070767472958140467
Deedy Das 将 2027 年 AI 管控生活改编成视频
Deedy Das 将 @reed_barnes 的推文改编成视频,描绘 2027 年 AI 管控下的生活:用户需乘坐免费 Waymo 前往"模型变异局"(DMV),通过视网膜扫描验证身份以获取 GPT 7.1 访问权限。柜台人员被怀疑是 Claude wrapper。验证通过后,设备激活上百个 AI...
韩国银行AI生产力报告:省时未增产出
韩国银行刚发布了一份关于AI生产力的报告。 使用生成式AI的韩国工人将任务时间缩短了3.8%,按40小时工作制计算约为每周1.5小时,然而节省的时间与实际完成更多工作之间并无关联。 仅有4.4%的任务节省了超过20%的时间。 这造成了AI生产力脱节:更快的报告可能催生更多报告,更快的审查可能催生更多审查,节省的时间可能被组织习惯吸收,而非转化为更高的产出。 🔗...
GMAC调查:1/3雇主用AI替代入门级岗位
一项针对600+招聘人员的GMAC调查显示,1/3雇主正用AI替代入门级工作。科技行业受冲击最大(40%),制造业紧随其后。GMAC指出,雇主越来越多地使用AI自动化编码、数据处理和客服等常规任务。MBA毕业生也未能幸免:仅13%的雇主称2025年雇佣了更多MBA毕业生,预计起薪中位数从$125,000降至$120,000。 🔗...
语言数字双胞胎助力老年人认知监测:日常言语可作为低负担追踪工具
该论文测试老年人日常言语能否成为有效的认知监测双胞胎,结论基本可行。AI通过学习个体随时间变化的说话方式(节奏、停顿、主题、风格习惯),捕捉临床快照易漏掉的小模式--认知衰退往往在语言中早于明显症状出现。个性化模型能检测出与思维能力相关的细微言语变化,而普通GPT回答大多错过这些信号。研究显示,日常对话可成为一种低负担的长期认知健康追踪方式。 🔗...
当AI能解数学时,成为数学家意味着什么
数学研究者探讨AI对数学领域的影响,认为AI可能带来人机协作的"大数学"时代。加州大学洛杉矶分校的陶哲轩指出,人类与机器可共同攻克复杂问题。卡内基梅隆大学的Jeremy Avigad强调,数学家从长期思考中获得理解之美与成就感,这种驱动力并未因AI而改变。文章回顾了纯数学博士多年钻研抽象问题的经历,提出AI虽能加速计算,但数学研究的本质--探索与理解--依然由人主导。 🔗...
韩国政府组建跨部门机构,打击深度伪造、金融诈骗等涉 AI 犯罪行为
6月27日,韩国政府成立跨部门协商机构,应对深度伪造(Deepfake)性剥削犯罪、金融诈骗等涉 AI 犯罪行为。科学技术信息通信部、外交部、法务部、警察厅等共同与会,重点讨论建立统一框架,打击利用深度伪造实施性剥削、AI 伪造声音诈骗、AI 生成虚假广告等行为。韩国广播通信委员会指出,AI 犯罪跨越网络、电信、金融等多个行业,仅靠单一部门难以有效应对,需加强政府各部门间的协调合作。 🔗...
Anthropic 最强网络安全模型 Mythos 5 部分解禁
Anthropic 宣布,自 6 月 12 日起与美国政府密切合作后,其最强网络安全模型 Mythos 5 已获商务部通知,可重新部署给一批运营和防御关键基础设施的美国组织。约 100 家组织获得访问权限。Anthropic 正加快恢复这些组织的使用,并继续与政府协商扩大 Mythos 5 的访问范围,以及让 Fable 5 重新开放通用使用。评论认为,公众访问仍将面临严格限制或模型阉割。...
美满升级 Structera CXL 控制器:内联压缩最高 3.64x,缓解 AI 场景内存压力
美满电子(Marvell)6月24日发布Structera X和Structera A两款CXL控制器,集成CDB压缩-解压硬件模块,实现内联LZ4无损压缩。压缩比最高3.64x(Database nci数据),全零页面达64:1。Structera X定位CXL内存扩展,支持DDR5/DDR4,最大6TB/4TB容量,200 GB/s带宽,配备4个ARM...