Aleph Alpha 发布 Kolibri:78.1B 参数英德 MoE 模型,仅激活 3.46B,1M token 上下文,Apache 2.0 许可,FP8 权重可在单张 B200/H200 上运行。
2026-10-05
— 本地大模型跑进消费级显卡,开源 agent 与 KV cache 优化同日刷屏,今天属于工程派。
本地推理再突破:Strata 让 125B 参数模型在 RTX 4090 上跑到 100T/s,FPGA 与 MoE 小模型训练也各有进展。多智能体 LLM 的 KV cache 跨模型迁移有了新方案 HeteroFold,省去重复 prefill。Google 因 AI 提交激增暂停开源漏洞赏金计划,AI 垃圾报告正在冲击安全生态。Rust 构建优化 Headstart 可提速近一倍,DeepSeek Harness v0.2 发布官方桌面应用。
头条
Strata 让 125B 参数 Qwen3.8 Flash Next 在 RTX 4090 上跑到 100T/s
开源项目 Strata 实现 Qwen3.8 Flash Next(125B 参数)在消费级硬件上本地运行,RTX 4090 实测生成速度达 100 tokens/s,仅需 12GB 以上显存的 NVIDIA 或 AMD 显卡,支持 Windows 和 Linux。为什么重要:这意味着大参数模型不再依赖服务器,开发者可在本地 PC 上跑代码生成、图像理解与 coding agent,数据完全不出本机,对隐私敏感场景是实质性替代方案。
本地大模型在消费级硬件上的进展令人振奋,但也有人认为低比特量化(IQ3_S)牺牲了输出质量,长任务可靠性仍存疑。
Google 因 AI 提交激增暂停开源漏洞赏金计划
Google 于 10 月 1 日暂停其开源软件漏洞奖励计划(OSS VRP),原因是 AI 生成的无效报告和幻觉内容激增,工程师与维护者不堪重负,官方承诺 2027 年第一季度给出更新。为什么重要:AI 垃圾报告正在冲击安全研究生态,漏洞赏金计划作为开源安全的重要防线,其暂停意味着真实漏洞可能被淹没,安全团队需要新的过滤机制。
HeteroFold 实现跨模型家族 KV Cache 免 prefill 迁移
论文提出 HeteroFold,一种免 prefill 的跨家族 KV cache 迁移方法,让异构多智能体 LLM 系统中的接收方直接复用发送方的 KV cache,双方模型均保持冻结。为什么重要:多智能体系统中文本通信的重复 prefill 是显著开销,该方法通过对齐模型结构、映射 cache 来消除冗余,对构建高效异构 agent 系统有直接工程价值。
DeepSeek Harness v0.2 发布官方桌面应用
DeepSeek 为其 MIT 许可的开源 agent harness(dsh)发布 v0.2 预览版,新增 macOS(Apple Silicon)和 Windows 官方桌面应用,内置插件管理器、文件与代码变更审查、定时自动化任务,并支持通过 OpenAI 兼容端点接入非 DeepSeek 模型。为什么重要:agent harness 是模型落地为可执行 agent 的关键运行时,官方桌面应用降低了使用门槛,插件机制和跨模型支持让开发者能更灵活地构建自动化工作流。
每天早晨,一份为你精选的科技日报
网页看大盘,订阅拿专属:AI 按你的兴趣为你精选、可汇入你的私有 RSS,附社区观点——每天早晨直达邮箱,永久免费。
已发布 85 期 · 每天筛过 150+ 条只留值得读的 30 条
AI 动态
Google Research 将联邦学习迁移到 TEE,Gboard 的 next-word prediction 已用上可外部验证的差分隐私。
Kaggle 上 ARC-AGI-3 最高分 30 天内从 7% 跃升至 56%,小规模本地模型在 harness 中开始超越平均人类水平。
在 eBay 廉价 FPGA 挖矿硬件上实现 Qwen3.5 架构的 9B/27B INT4 推理,8GB HBM2 的 SQRL FK33 仅需 280 美元。
从零训练 3.87B MoE(1.45B active)模型,仅用 86.5B tokens,每层均为 MoE,上下文 4096,tokenizer 采用 Qwen3。
开发与开源
讨论为何开发者不更积极地使用浏览器原生平台能力,评论区认为平台功能不够好、不灵活,但也有人归因于框架依赖习惯。
评论区普遍认为平台原生功能不够好、难用且不灵活,但也有人认为开发者只是习惯依赖框架和库。
Docker Hub 曝出严重 IAM 漏洞,可能通过 Personal Access Token 冒充其他用户,官方已发布修复建议。
degoog 搜索引擎聚合器发布 v1.0.0 稳定版,面向自托管用户。
浏览器原生的经典 Visual Basic VB6 IDE 项目,在网页中复刻 VB6 开发环境。
社区热议
从 1 张 3090 到 20 台 DGX Spark 的本地 LLM 折腾史,家庭电闸先成了瓶颈,评论区共鸣强烈。
Meta 的 Muse agent 系统提示词声称用户对家庭的控制权无条件高于安全训练,引发 r/LocalLLaMA 热议。
64GB 系统内存的尴尬:跑 Qwen3.8-27B Q6 加 ComfyUI 图像推理时内存捉襟见肘。
Micron CEO 称 2027-2028 年内存供应将比 2026 年紧张得多,本地 LLM 玩家关注硬件成本走势。
GitHub Trending
Star tester-army / e2e Next generation e2e testing framework for web and mobile apps.
Star pbakaus / impeccable The design language that makes your AI harness better at design.
Sponsor Star coreyhaines31 / marketingskills Marketing skills for Claude Code and AI agents. CRO, copywriting, SEO, analytics, and growth engineering.
Sponsor Star DietrichGebert / ponytail Makes your AI agent think like the laziest senior dev in the room. The best code is the code you never wrote.
Star earthtojake / text-to-cad Give your agent CAD superpowers.
Star Panniantong / Agent-Reach Give your AI agent eyes to see the entire internet. Read & search Twitter, Reddit, YouTube, GitHub, Bilibili, XiaoHongShu — one CLI, zero API fees.
Star getsentry / sentry Developer-first error tracking and performance monitoring
Sponsor Star calesthio / OpenMontage World's first open-source, agentic video production system. 12 production pipelines, 100+ tools, 700+ agent skill and production-knowledge files. Turn your AI coding assistant into a full video production studio.
Star caddyserver / caddy Fast and extensible multi-platform HTTP/1-2-3 web server with automatic HTTPS
更多值得一看(内容池 1 条)
How many on the list did you know? Obviously one paper like Attention is All You Need (278k citations) can influence a lot - all the authors are on the list. But still interesting imo. More context: