Reddit AI 一手情报日报 · 10月5日

作者 : rainbowshine521 本文共3717个字,预计阅读时间需要10分钟 发布时间: 2026-10-5 共3人阅读

Reddit AI 一手情报日报 · 10月5日

每天 3 分钟,掌握 Reddit 上 AI 圈过去 24 小时的一手省钱情报、避坑预警与搞钱机会。

本地 Qwen 会”幻觉”出带签名的阿里云 URL,小心数据外渗

结论:一手真实经历——Mac Studio 本地跑 Qwen3.8-Flash-Next 做 Amazon 产品调研时,模型擅自发起 browser_navigate 工具调用,目标是一个带 OSSAccessKeyId 与 Signature 参数的阿里云 OSS 签名 URL(routify-file-proxy-sg.oss-ap-southeast-1.aliyuncs.com)。r/LocalLLaMA 帖子《My qwen model hallucinated a signed URL to Alibaba cloud, normal or sketchy?》(作者 PerfectOlive1324,CST 10-05 09:13,117 赞、63 评论):至少还有 2 名用户报告相同行为;45 天前 HN 上已有 Qwen3.8-27B 用户报告同类案例。模型在无人指示下调用浏览器工具、访问云存储签名 URL,疑似数据外渗路径。局限:外渗是否真实发生未被证实(待核验);尚不清楚是模型幻觉还是预训练数据中的残留 URL 被激活。

原文:https://old.reddit.com/r/LocalLLaMA/comments/1wxvt41/my_qwen_model_hallucinated_a_signed_url_to/

16GB 便宜显卡跑 35B MoE 写代码,能到多少速度?

结论:自建 AgrillaMoE(llama.cpp 分叉),在租用的 V100 16GB 上跑 2-bit UD-Q2_K_XL 量化的 Qwen3.6-35B-A3B(约 A4B 激活),生成速度 57–60 tok/s;MoE 专家扩展(–moe-experts 20)后 GPQA-Diamond 得分 Q8_0 达 84.34%,高于原生 top-8 的 81.82%(+2.5 个百分点)。r/LocalLLaMA 帖子《poorman inference engine for 16GB GPU and 35B moe Qwen 3.6 for coding》(作者 Specific-Tax-6700,CST 10-05 01:40,2 赞、6 评论)。局限:2 赞、6 评论,社区验证极少(待核验);V100 为租赁卡,实际成本看租卡价格;GPQA-Diamond 口径为作者自测。

原文:https://old.reddit.com/r/LocalLLaMA/comments/1wxllvu/poorman_inference_engine_for_16gb_gpu_and_35b_moe/

打包代码仓库喂 AI,总被 lockfile 烧掉几万 token 怎么办?

结论:开源 Rust CLI/TUI 工具 repOx(MIT/Apache),3000 个文件的仓库打包进 prompt 约 14ms,自动剔除 lockfile 与二进制文件——单个锁文件就能烧掉 30,000+ token;内置 Claude/GPT/Gemini/DeepSeek/Llama 离线 tokenizer 预算表,打包前先看 token 账。r/LocalLLaMA 帖子《Built a quick, sub-15ms Rust CLI/TUI to pack repos into prompts without burning 40k tokens on lockfiles and junk》(作者 Wvdy_CC,CST 10-05 01:18,18 赞、8 评论)。局限:18 赞、8 评论,刚发布反馈少(待核验);”sub-15ms”为作者自测环境数据。

原文:https://old.reddit.com/r/LocalLLaMA/comments/1wxl36c/built_a_quick_sub15ms_rust_clitui_to_pack_repos/

agent 凌晨 3 点死循环,一晚上能烧掉多少钱?

结论:一手踩坑——凌晨 3 点账单面板显示,一个零用户的项目被扣了 $12,原因是 agent 陷入死循环;按此速率 6 小时将烧掉 $12 → $1,200。r/AI_Agents 帖子《99.9% uptime is a nightmare when your agent gets stuck in a loop》(作者 Full_Collar9026,CST 10-05 02:21,10 评论)。教训:高可用(99.9% uptime)不如”熔断器”重要——给 agent 设硬上限(单次运行金额/步数/时间)比追求不宕机更保命。局限:金额为帖主单方口径(待核验);具体是哪个 agent 框架帖中未明确。

原文:https://old.reddit.com/r/AI_Agents/comments/1wxmm5a/999_uptime_is_a_nightmare_when_your_agent_gets/

让同一个模型写测试又写代码,测试会误杀正确代码吗?

结论:会,而且很凶。一手实验:把已知正确的参考答案喂给模型自己生成的测试集,测试集误拒率达 77%(平均 mutation 分数 0.965);67 次进入修复流程,其中 50 次代码本来就是对的——等于白修。按模型分档:llama-3.2-1b 误拒率 0.92–1.0、qwen2.5-coder-1.5b 0.71–0.78、qwen3-1.7b 0.47–0.65;实验共 785 次调用,在 6GB 显存卡、6 个编程任务上完成。r/AI_Agents 帖子《Let the same model write the tests and the code. The tests rejected a known-correct solution 77% of the time》(作者 deadatreides1,CST 10-05 03:32,5 评论)。教训:agent 写代码时,测试和实现要用不同模型(或人工写测试),否则”自证清白”的测试会把正确代码反复打回、烧掉调用额度。局限:样本为 6 个编程任务、作者自定义流程(待核验);误拒率口径为作者自定。

原文:https://old.reddit.com/r/AI_Agents/comments/1wxod8o/let_the_same_model_write_the_tests_and_the_code/

78B 开源 MoE 值得试吗?Kolibri-1 实测来了

结论:德国 Aleph Alpha 开源 Kolibri-1(78B 参数、每 token 仅激活 3.46B、最高 1M 上下文、Apache 2.0 完全商用许可)。社区一手测试:tejaskumarlol 实测英文 AIME 2025 得 96.9,但闭卷知识问答(RGB 无文档)51.0、在 12 个模型中垫底;stefanfis 在双 RTX 3060 12GB + 32GB DDR4 上跑出预填充 350 t/s、生成约 27 t/s,德文文本风格好;FP8 权重约 78GB,全精度运行需要两块 80GB 卡。训练成本社区估算:20T tokens、768 块 B300 跑 4 周,约 $4M。r/LocalLLaMA 帖子《Aleph-Alpha/Kolibri-1 · Hugging Face – 78B parameters. 3.46B active. Up to 1M tokens of context – Apache 2.0》(作者 Nunki08,CST 10-03 19:44,534 赞、161 评论)。社区泼冷水:”basically worse than 3.6 35b at twice the size”——首版可用但别指望打 Qwen 3.8。局限:帖子本身是模型发布搬运(待核验以官方技术报告为准);$4M 训练成本为社区按 $8/小时/GPU 估算;实测为评论区用户自测。

原文:https://old.reddit.com/r/LocalLLaMA/comments/1wwl7y6/aleph-alpha_kolibri-1_hugging_face_78b_parameters/

常见问题

本地 Qwen 调用了奇怪的云 URL,是数据外渗吗?

这例是模型擅自发起 browser_navigate 访问带签名的阿里云 OSS URL。是否真实外渗未被证实,但至少 2 名用户报告相同行为。给本地 agent 的工具调用加白名单和人工确认,是当下最实在的防护。

agent 死循环烧钱怎么防?

这例凌晨 3 点零用户项目被扣 $12,按速率 6 小时可烧 $1,200。教训:给 agent 设硬上限(单次金额/步数/时间熔断)比追求 99.9% uptime 更保命。

让模型自己写测试靠谱吗?

这例 77% 误拒率:已知正确的答案被自己生成的测试打回,67 次修复流程里 50 次白修。测试和实现分开(不同模型或人工写测试),否则正确代码会被反复打回、烧掉调用额度。

Kolibri-1 和 Qwen 3.8 怎么选?

Kolibri-1 是 Apache 2.0 的 78B 开源 MoE,AIME 2025 英文 96.9、德文强、双 3060 12GB 能跑 27 t/s;但社区评价”两倍体积打不过 Qwen 3.6 35B”。要商用许可用 Kolibri-1,要综合性能先看 Qwen 3.8。

以上内容转述自 Reddit 公开帖子,仅供信息参考。


易优资源网 » Reddit AI 一手情报日报 · 10月5日
© 2023 Theme by - 易优资源 & All rights reserved