RSS

  • 宝玉的分享
    https://baoyu.io/feed.xml
    刷新于
  • AIHOT 日报
    https://aihot.virxact.com/feed/daily.xml
    刷新于
  • AIHOT — 全部 AI 动态
    https://aihot.virxact.com/feed/all.xml
    刷新于
  • AIHOT — 精选
    https://aihot.virxact.com/feed.xml
    刷新于

Conductor Build 将智能体变为农场解决移动开发

我喜欢这个 👀 我们通过 @conductor_build 云将智能体变成农场,解决了移动开发问题 戳戳你的小鸡,让一切继续运转 🐓 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmscb6s8p02h0roeu7xms4gn5

noreply@aihot.virxact.com (X:Charlie Holtz(@charlieholtz))

研究揭示 LLM 存在显著偏差:明知任务不可能仍会执行

新论文《Would You Walk to the Car Wash?》提出 SaliTrap 基准,测试 12 个模型在 1,145 个提示中的常识推理,发现 LLM 存在"显著偏差":显式数字和程序会压过未言明的物理前提。最佳模型仅 54.8% 避开陷阱,12 个中 8 个低于 30%;移除干扰后,四个代表性模型的正确率回升至 86.9%-91.8%。 🔗 阅读原文 via AI...

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

DeepSeek 4 Flash 登顶性价比前沿

DeepSeek 4 Flash 的新更新持续取胜,成为帕累托前沿上的性价比赢家。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc99o6t01a6roeu9h4bvspg

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

周报31:探索式建模与StateAct智能体

第31周论文 探索式建模--模型探索多条有效路径,每种可能性都保持清晰。 StateAct--智能体先读取应用状态,像素沦为后备方案,动作更加有据可依。 论文: 探索式建模:解锁第三条预训练轴与端到端生成 StateAct:程序状态优先于像素,用于长时程计算机操作智能体 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:马东锡 NLP (@dongxi_nlp))

Claude 8分钟发现钱包漏洞,AI安全引担忧

Claude 仅用8分钟便发现同一钱包漏洞,引发"有人用LLM盗走1亿美元只因没人检查源码"的感叹。Anthropic此前闭门演示中,Mythos模型被指示寻找银行漏洞并清空账户后照做。开源权重模型或将自由游走网络,盗取账户、自我复制且难以清除。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc86yon00mbroeuxzr49v80

noreply@aihot.virxact.com (X:AI Safety Memes (@AISafetyMemes))

DeepSeek v4 Flash 搭配 Pi 效果出色

DeepSeek v4 Flash + Pi 太棒了! 在 DeepSeek 的 harness 发布之前,我建议在 Pi harness 上使用新的 DeepSeek v4 Flash 模型。 Pi 与这些新的开源模型大多都能很好地配合使用。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc86ycm00m7roeuyv2nn1yo

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

Fender CEO 称翻唱歌曲和乐队成员是"模拟 AI",引发争议

Fender CEO Edward "Bud" Cole 在 T3 采访中称翻唱歌曲和乐队成员是"模拟 AI",并认为 AI 将帮助吉他手成为创作大师。该言论在 Fender 因向制琴师发停止函而陷入公关危机后再度发酵,遭音乐人反驳:人类学习翻唱与 AI 训练数据规模不可比,且依赖 AI 可能导致技能退化。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (The Verge:AI(RSS))

宾夕法尼亚大学新研究:对部分LLM使用粗鲁语气可缩短回答并提高准确率

宾夕法尼亚大学研究发现,对部分LLM使用粗鲁语气可显著缩短回答并提高准确率。研究用570道MMLU题、7种语气测试多模型,准确率波动至多2.99个百分点,但输出token使用量变化高达44.3%。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc74kvw020kro8v5peroeme

noreply@aihot.virxact.com (X:Rohan Paul (@rohanpaul_ai))

DeepSeek Flash 单日处理 8T tokens

DeepSeek Flash 在 8 月 1 日处理了 8T tokens 5T 免费使用量 + 3T 来自 OpenCode Go 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc74dar01xaro8v3mbic3um

noreply@aihot.virxact.com (X:opencode (@opencode))

科技报道失去对未来的惊叹

你将活着见证种种奇迹,然后耸耸肩说"嗯,又一个奇迹"。 关于科技报道的那些陈词滥调都是真的。它几乎完全变成了关于人际关系、权谋、政治、交易等等。对科技本身未来可能性的惊叹感已经消失了。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc74j7901zsro8vn6qbgl0k

noreply@aihot.virxact.com (X:Ethan Mollick (@emollick))

《Ars Notoria》与即时知识的承诺:中世纪学者如何用魔法手稿"速成"学问

在《黑客帝国》中尼奥瞬间掌握功夫的数世纪前,中世纪学者已寻求快速获取知识的捷径。Anne Lawrence-Mathers 考察了《Ars notoria》这部据称能加速高级学习的魔法手稿,探讨其宣称的力量及对部分使用者产生的恶魔般影响。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc74bz701wmro8v8tgmibnj

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

swyx 用 Codex 跨平台与产品协作开发 Forge

swyx 正用 Forge 托管其所有项目,并分享了一个技巧:在 OpenAI Codex 中可 @ 一个线程并排队,当项目被平台功能阻塞时,可预先推进项目,待平台解除阻塞后继续。他认为更优的多智能体框架应无缝编排平台与项目间的工作,但此类用例并不常见。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc74nsu021iro8vughpza7w

noreply@aihot.virxact.com (X:swyx (@swyx))

Show HN:Sprocket--面向硬件和软件开发领域的人工智能代理

Sprocket 是一款面向硬件和软件开发领域的人工智能代理,现已开放下载。其演示视频展示了在相关开发任务中的应用能力,旨在提升硬件与软件工程的开发效率。用户可访问 https://spikonado.com 获取该工具。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc74bz701wnro8vswpdwrkk

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

智能仍尖峰,AGI 尚缺"G"

Dex Horthy 盛赞 Ian(@kinglycrow)关于智能体与红蓝队安全研究的深度长文。Ian 去年曾创立并出售一家编码智能体初创公司,实操经验丰富。其核心判断是:智能仍尖峰、验证器脆弱、视野过短,起飞条件未成熟,AGI 尚缺"G"。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc75nnl022gro8vtxbfw1m3

noreply@aihot.virxact.com (X:Dex Horthy(HumanLayer)(@dexhorthy))

MIT专家:AI时代唯一持久的护城河是验证级网络效应

MIT加密经济学实验室创始人Christian Catalini在Superintelligence发文称,多数护城河(路由、分发、市场流动性、应用层功能)都会随模型升级而削弱,唯一增强的是"验证级"网络效应。其核心问题:谁拥有别人没有的测量数据? 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc61wjr01cbro8vll0rp4af

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

Deedy 展示 LLM 3D 重构京都风户型

我喜欢输入湾区房屋的户型图,让大语言模型以不同美学风格重新设计--这次是京都风格。 模型在 3D 方面的能力已经变得非常出色。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc638cl01g0ro8vkcpfg8dp

noreply@aihot.virxact.com (X:Deedy Das (@deedydas))

杰文斯悖论在数学领域已显现

你已经在数学中看到杰文斯悖论在发挥作用 现在有更多事情在发生,理解起来更容易,数学家们也有更多时间在更高的抽象层面上与我们讨论 对思考和精通数学的人才需求将会上升 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc4z88e00ejro8vags0z5ec

noreply@aihot.virxact.com (X:Thariq (@trq212))

普通人用GPT 5.6 Sol vibe coding做出3D人体解剖应用

一位开发者用GPT 5.6 Sol、GPT Image 2.0和TripoAI,通过vibe coding构建了3D人体解剖应用,将总资源从约900MB优化至28.6MB,单个模型从120-150MB降至2-5.5MB,帧率从16fps提升。整个过程仅靠与AI对话完成,无需专业团队,展示了工具民主化对教育内容的冲击。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:阿易 AI Notes (@AYi_AInotes))

品味一词为何值得保留

"呃,你根本不懂品味是什么意思,而且这词很尴尬。" 闭嘴,我们用这个词来衡量语言模型在写作和行为上让人感觉良好的程度。确实,你讨厌的一堆人过度使用这个词,但这是个好词。别搞文字体操了。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc3wv5k0yimrohv63n8alfk

noreply@aihot.virxact.com (X:Gabriel (@gabriel1))

比特币钱包被黑,Anthropic 演示 AI 可清空银行账户

比特币钱包遭黑客攻击,许多人损失全部资产。Anthropic 一个月前在闭门演示中向国会议员展示,其模型 Mythos 能发现银行漏洞并清空账户。推文警告开放权重模型或将自由游走于互联网,自我复制且难以消灭。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc3wmo50yeqrohvhje3y5y8

noreply@aihot.virxact.com (X:AI Safety Memes (@AISafetyMemes))

卡帕西亚鹈鹕

Andrej Karpathy 用 1M token 预算(约 $10)让 Opus 5 根据《指环王》首段生成 Three.js 渲染,模型耗时约 2 小时写出 5500 行代码,程序化呈现故事。他认为这类"没人会手动做"的定制内容正变得近乎免费,并指出世界/游戏领域暴露了 LLM 的弱点:无法高效原生感知视频或游玩游戏,Opus 5 只能缓慢截图自查且多次出错。 🔗 阅读原文 via...

noreply@aihot.virxact.com (Hacker News 热门(buzzing.cc 中文翻译))

ASI 横扫数学后各领域将如何

"如果趋势持续,到 2028 年底所有 Erdős 问题都将被解决。" 当 ASI 像攻克数学一样横扫每个领域时,会发生什么? 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc2u1990xgcrohv5j9ww91n

noreply@aihot.virxact.com (X:AI Safety Memes (@AISafetyMemes))

AI的讽刺:解数学难题却难守简单指令

AI的讽刺之处: 比数学博士还聪明。解决了10个开放数学问题。 比我的实习生还笨。连3条简单指令都执行不了,却烧掉了1000万token和250美元。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc1zqze0x19rohv86hn80lj

noreply@aihot.virxact.com (X:Yuchen Jin (@Yuchenj_UW))

SemiAnalysis 实测 Qwen3.8-Max-Preview

SemiAnalysis 测试了 Qwen3.8-Max-Preview,参数量 2.4T。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc1rnkp0wxmrohvb8637n87

noreply@aihot.virxact.com (X:SemiAnalysis (@SemiAnalysis_))

前沿开源模型改变智能对话格局

前沿开源模型确实改变了关于智能的对话。这是必然发生的,因为我们正走向一场彻底的灾难。 最重要的是,随着AI持续进步,我们不能忘记AI的集中化有多么糟糕。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc1rg390wu6rohvfe784wiz

noreply@aihot.virxact.com (X:Elvis Saravia (@omarsar0, DAIR.AI))

ElevenLabs 个性化语音识别嵌入评估

我需要更好的语音转写,@ElevenLabs 你能给我展示一个包含技术词汇、难词和其他我该说的内容的屏幕吗?然后为它制作一个个人嵌入,并通过某种评估来衡量它能多大程度改善个人语音识别。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc0p4170w07rohvg8u5lvo1

noreply@aihot.virxact.com (X:Gabriel (@gabriel1))

Claude Fable 复现 OpenAI Astra 五项数学突破

OpenAI 未发布模型 Astra 公布 10 项前沿数学结果,24 小时后 Anthropic 研究员称已可用模型 Claude Fable 复现其中 5 项。Fable 在通用提示词、无联网且防信息泄漏的自主条件下完成,其中 4 项或为独立证明。OpenAI 正凭借新模型收获科学突破的先发优势。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:Kim (@kimmonismus))

Grok 视频生成获赞,被称视频界 DeepSeek

博主称 Grok 为视频大模型界的 DeepSeek,并建议马斯克好好发展。其展示 Grok 一次生成、零抽卡的 15 秒 1080P 打斗片段,认为效果优于降智的 seedance 2.0,且对比 seedance 2.5 的高价更具性价比。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsc1rbxn0wsyrohvkkub6gdf

noreply@aihot.virxact.com (X:阿易 AI Notes (@AYi_AInotes))

以"slop"制"slop":Dex Horthy 谈系统反馈新思路

Dex Horthy 在演讲中提出"以 slop 制 slop"的理念:保持核心代码干净,但尽可能用 AI 生成内容(slop)来感知系统变化,为模型和人类创造新型反馈机制。他引用 swyx 对 Boundary 演讲的评价,强调"容忍 slop 比反对 slop 价值高 100 倍",并呼应了关于 AI 原生编程语言的讨论。 🔗 阅读原文 via AI HOT ·...

noreply@aihot.virxact.com (X:Dex Horthy(HumanLayer)(@dexhorthy))

Google AI Studio 应用新增 Artifacts 文件夹

GOOGLE 🔥:Google AI Studio 上的应用将获得一个专属的 Artifacts 文件夹! 其中将包含这些应用生成的文件,用户可从同一界面快速访问。 🔗 阅读原文 via AI HOT · https://aihot.virxact.com/items/cmsbzukgt0vfbrohvdwk5mvk0

noreply@aihot.virxact.com (X:Testing Catalog (@testingcatalog))
上一页 第 176 / 925 页 下一页

添加 Feed

导入 OPML