Reddit AI 一手情报日报 · 10月2日
每天 3 分钟,掌握 Reddit 上 AI 圈过去 24 小时的一手省钱情报、避坑预警与搞钱机会。
本地跑 27B 编程模型,一张旧 3090 够用吗?
结论:能跑,但长上下文吞吐会掉到约 21 tok/s,reasoning budget 别配错。r/LocalLLaMA 帖子《Qwen3.8-27B Q4_K_M on one RTX 3090 + OpenCode: throughput, four coding tasks, and a reasoning-budget failure》(submitted 8 hours ago,作者 Adorable-Cost-3249):配置为 RTX 3090 24GB + Ryzen 7 5800X + 64GB RAM,模型 Qwen3.8-27B Q4_K_M(约 16.8GB),上下文 13 万 token;实测吞吐随上下文下降:2,073 token 输入→36.4 tok/s、16,378→33.5、65,537→25.9、120,011→20.9;峰值显存 22,162 MiB。4 个编码任务里 1 个因 reasoning budget 配置失误翻车。局限:单卡、单模型口径,旧硬件+大上下文的组合仍需自己压测。
原文:原文链接
Gufo 号称 70 tok/s 跑 27B,真的吗?
结论:数字是真的,但有附加条件,看小字条款。r/LocalLLaMA 帖子《Gufo performance …. 70tps Qwen 3.8 27b but you need to read the fine print.》(submitted 7 hours ago,作者 brainchillzZ,25 条评论):Gufo 0.4.0 实测 Qwen3.8-27B UD-Q4_K_XL 达到 70.22 tok/s;同硬件对照 halogen 0.13.8 中位数 39.4 tok/s;其它档位还测出 43.9、38.2、76.6、63.1 tok/s,pp 1,288/1,495 tok/s。作者提醒这个 70 tok/s 结论要看限定条件(提示词/设置口径)。局限:帖主单机口径,Gufo 为开源推理引擎,换引擎前建议按自己任务复测。
原文:原文链接
64GB Mac 本地跑 95GB 大模型,有新工具吗?
结论:有,Slipstream 实测比 llama.cpp 快 1.76 倍。r/LocalLLaMA 帖子(submitted 8 hours ago,作者 SnooPredictions515,15 条评论):95.5 GiB 的 Qwen3.8-Flash-Next 在单台 64GB Mac 上跑到 41–52 tok/s,旧方案(自定义 llama.cpp 分支)解码上限约 23 tok/s;130k 上下文下 33–44 tok/s;作者称 34k+ 下载量、3,086 次实时请求。局限:数字多为作者自述(待核验),Slipstream 为新发布工具,稳定性待更多人复核。
原文:原文链接
预训练装机,DDR4 老平台还能战吗?
结论:老平台仍可一战,装机前先看一手基准再决定。r/LocalLLaMA 帖子《DDR4/PCIe4 vs DDR5/PCIe5 for LLMs- I benchmarked them for pre-training. What are your thoughts?》(submitted 8 hours ago,作者 Any-Winter-4079,13 条评论,100% upvoted):一手实测对比 DDR4/PCIe4 平台(192GB RAM,H12SSL-i / EPYC 7352,PCIe4 约 26.3 GB/s)与 256GB DDR5 @ 6400 MT/s 做 LLM 预训练,附实测图表。局限:核心结论在图表里,文本摘要未展开(待核验),装机党建议点开原帖看图。
原文:原文链接
现在哪个模型做 vibe coding 最便宜?
结论:有帖主实测 GLM 5.3 Flash 跑 35M token 花费不到一包麦当劳小薯条,但先小额试。r/vibecoding 帖子《35M tokens for less than MCd’s small fries bag with GLM 5.3》(submitted 7 hours ago,作者 Ok_Abroad_3627):自述用 GLM 5.3 Flash 做 AI 辅助开发约 20 小时工作量,35M token 账单不到小薯条价格,并附账单截图;评论区有人称自己用起来贵得多,在问是否为 OpenRouter 路由差异。局限:0 赞、25% upvoted,供方自述未获第三方复核(待核验),便宜程度可能取决于走哪个渠道/路由。
原文:原文链接
AI“一句话”做游戏,真实代价是多少?
结论:1,574 个 prompt + 15 个月,“一气呵成”只是玩笑标题。r/aigamedev 帖子《I one-shotted a Steam game with Claude and ChatGPT. It only took 1,574 prompts and 15 months.》(submitted 12 hours ago,作者 Pix4Geeks,83 赞/46 评论):游戏《Kyūten》用 Claude + ChatGPT 开发,完整 GDD 约 1,400 行 .md,Steam 页面已上线(app/5333100/Kyuten);作者承认标题是玩笑,真实投入是一年半。局限:帖子 flair 为 Commercial Self Promotion(自我宣传),数字为作者自述(待核验)。
原文:原文链接
常见问题
长任务本地跑,旧显卡够用吗?
这例 RTX 3090 跑 Qwen3.8-27B Q4_K_M 可行,短上下文约 36 tok/s、12 万 token 长上下文约 21 tok/s,峰值显存 22,162 MiB。注意 reasoning budget 配错会直接翻车一个任务。
本地推理引擎值得换吗?
同硬件下 Gufo 实测 70.22 tok/s 对 halogen 的 39.4 tok/s,差距近一倍;Slipstream 在 Mac 上比 llama.cpp 快 1.76 倍。但两例都是作者单机口径,换之前按自己的任务复测一次。
Mac 用户本地跑超大模型有新选择吗?
Slipstream 新发布,64GB Mac 跑 95.5 GiB 模型 41–52 tok/s,130k 上下文 33–44 tok/s。新工具稳定性待更多人复核,先小规模试。
GLM 5.3 真的那么便宜吗?
帖主 35M token 花费不到一包小薯条并附账单截图,但帖子 0 赞、评论者称自己用贵得多(疑似路由/渠道差异)。结论:先小额试自己的渠道,不要直接迁主力工作流。
vibe coding 做一款 Steam 游戏要多久?
这例是 1,574 个 prompt、15 个月、1,400 行 GDD。“一句话出游戏”是玩笑,真实代价是时间。帖子带自我宣传属性,数字为作者自述。
以上内容转述自 Reddit 公开帖子,仅供信息参考。