}

  8 月 14 号,阿里把 Qwen3.8-27B 开源了。270 亿参数,262K 上下文,外推能到 100 万(IT之家[1])。开源两天,下载破百万,登顶 Hugging Face 全球趋势榜(知乎专栏[2])。

  我当天就把它装进了我的主力台式机,两年前买的4090 24G显存一万五,128G ddr5内存七千,加上5k宽屏显示器,总价三万,能跑Q4 量化,跑起来100tokens/秒,相当流畅,智商很高。

  我也把本地Qwen接入了Deepseek harness和claude code,拿来当主力干活的子智能体,跑起来完全ok,非常的哇塞,真的想不到,半年前只能在数据中心运行的全球领先的顶尖智能,现在在个人电脑上就能跑起来了。

  Qwen3.8 27B基本可以认为是一个能在个人电脑上运行跑的 Opus 4.6,也因为每个人都能推理,就不再依靠梁文锋良心发现,给老百姓打折了。Qwen3.8 27B彻底替代了deepseek v4 flash,成为大模型时代真正的定价之锚。

  但是对于本地推理的Qwen来说,价格便宜,并不是核心卖点,最关键的,是让我们能够在3万预算内,提供一个能够满足个人隐私需求的AI助理,而且还能省下不少tokens费用。

  Qwen3.8能干啥

  我最近让Qwen3.8做了两个事,一个是让它查看并总结我的个人微信聊天,我一周大概有500个聊天,我让千问一个一个帮我读取,把需要我响应或者回复的工作,例如「我回头弄」「我看看」,或者这个事情AI读下来,我没有收工的,都捞出来列成清单。

  结果我发现我有很多意念回复的消息,比如有朋友说抽时间聚聚,比如有评奖单位通知我报奖,比如业务部门领导跟我提了一个AI需求等等,我发现我全忘了,靠Qwen3.8,终于把这个事情解决了。这活我根本不敢让云端模型干,这次终于完成了,真心快乐啊。

  另一个是我之前的答辩助手,里面也是大量的个人信息。在答辩的时候,我如果用外部大模型查答案的话,响应速度就要4-5秒,其实是来不及的。我必须要用独享模型才能保证0.3秒的反应速度,所以上次答辩我是临时云上租了个5090,推理的Qwen3.6-27B,现在我可以在本地推理Qwen3.8,保证模型随叫随到了。

  我把20 万字素材变成llm wiki,也就成了索引小抄,评委提问的时候,我按住 Caps 录音转文字,关掉思考模式,一秒之内,成体系的答案就刷新在悬浮框里,显得我张口就来,如数家珍,表现极好。对了,我的语音转文字模型,也是阿里开源的funasr。

  我用Qwen3.8驱动我自己写的Easybrowser(已经开源),自己翻了知乎和微博上的用例,算是自己做了详细的调研,挺有意思。

  有人把它接进 DeepSeek Harness,干 WorldQuant 量化研究的活。读脚本、调 PowerShell 跑 Python、生成候选配置、启动后台批量模拟,一口气跑了三十多分钟、近四十步。

  中间撞上结果文件并发写入的 bug,它自己翻日志、改成读 JSONL,把活干完了,说明这个本地模型的智能能力和长程任务是足够的 (知乎专栏[3])。

  还有个更离谱的用例。丢给它一句话:「农村 20×15 的地,盖栋简约不张扬的自建房,要网页能预览」。它先反问你几个需求,然后一次性交出一个能旋转查看的别墅 3D 模型(知乎[4])。

  拿它当 coding agent,29 道 bug 修好 27 道,175 次工具调用零格式错误。让它写俄罗斯方块,一个 400 行的单文件 HTML,语法、功能、截图验证全过(知乎专栏[5])。

  读代码库、答问题、把会话记录写成文档,会议纪要、拆长文档、搭企业知识库,全都干得动(知乎专栏[6])。我现在正在让qwen3.8帮我编织我自己的LLM wiki,我的个人项目材料终于能够变成体系了,实在太不容易了。

  便宜是个伪命题

  从我一直研究的Token经济学来看,本地部署,真的不是为了省钱。一块卡就算按一秒100token生产计算,一小时也只有36万token,一天只有864万,一个月峰值是2.59亿,完全不够用。

  我一个月最高用过10个亿token,也不过花了200出头,而且我买的中转站价格还算是贵的。而用本地跑大模型,功耗500瓦,一个月电费都要360度,合180块。

  实话实说,一个月的 token 用量,超过 140 块的gpt plus成本的话,自建中转站,购买日抛号池,收割准备上市的A社和OpenAI才是版本最优解法。100 亿 GPT-5.6 token,最便宜的成本是 100 块(服务肯定不稳定,但是这么便宜还有啥可抱怨的)。

  在A社和Openai上市之前,这个tokens的价格比我们买一张 4090、一台 5080、甚至一台 Mac mini跑本地推理,都便宜多了。别客气,老佛爷帮我们付过帐了。纯比 token 单价,谁家的推理服务都打不过主打薅羊毛的中转站。

  但是 Qwen 27B 的价值,从来不是「省钱」。 Qwen 27B是当前大模型智力的定价之锚

  按照一台4090主机3万元,折旧3年,电费每月180计算,3年成本36480元,可以生产9331亿tokens,平均一百万token的成本是3.9元,消费者终于能跟模型厂家议价了,同等性能的模型,价格超过4块一百万的,就可以说gg了。

  成本与隐私的最优解

  qwen3.8 27B在成本和隐私两个极端之间,形成了一个最优解。

  一端是中转站。便宜是真便宜,但你的数据从中转站走,等于把自己电脑上的各种信息扒光了给各种灰产的人看,而且投毒的风险也永远存在。另外,中转站是必然会卖掉你的数据的,所以微信、邮件、账本,你是绝对不能用中转站的tokens处理的。中转站的API就应该安全的用在我们的虚拟机或者沙盒里面。

  另一端是纯本地。隐私满分,但硬件要钱,以前的模型智能不够,可27B 的价值,就是把这两头接起来。

  具体涉及隐私的活,由本地 27B 这个智能体自己干。 搜资料、扒数据、做汇总、整理成半成品,这些涉及个人隐私又量大机械的活,全都在本地跑,数据不出门。

  中转站的贵价模型只干一件事:收口和决策。 把本地带回来的信息,做最后的推理、判断、拍板,然后继续派活。它碰到的,只有我们允许漏出去的那一点点,即使泄露了,问题也不大。

  这么一分工,我们等于既白嫖了顶尖算力,又不怕数据被人拿去卖。便宜和隐私,两头都占了一点,两头又都没牺牲。这就是折衷的优势。

  Qwen3.8能替代多少

  我让qwen3.8翻了我这两天的 agent 日志。12 个会话,1400 多次工具调用。

  1145 次是 bash 命令。剩下的,写脚本、改文件、读文件、搜资料、浏览器自动化。

  九成九是执行的活。

  OA 里需求入库、立项材料抓取,是执行的工作。逆向知乎、腾讯新闻、企鹅号、网易号、百家号五个平台的阅读量接口,也是执行的活,qwen3.8-27B干得很好。发完公众号之后,再同步到八个自媒体平台发送,还是执行活。

  真正要高智商大模型的,就两个任务:看完子代理返回的信息,然后整体考虑下一步工作安排。剩下的,全是 27B 能干的。

  我一周一亿 token 的用量,大半是这些执行活烧出来的。我把执行的工作先下放到本地 27B,剩贵价模型干收口的那部分,再用ds v4flash干本地模型干不过来的活。一个月的成本控制在 300 块以内真的不难,加上本地电费,整月大模型开销压在 500 以内,是压力不大的成本。

  上个月我们有个同事,一个月干出去一万块的 token 费。上线本地 27B 之后,这部分是实打实能压下来的。算账不是重点。重点是 27B 作为本地模型能干很多活,会改掉我们使用大模型的方式。

  算力,重新分布了

  Qwen 27B 的意义,不止是一个模型,也不止是定价锚。

  它意味着,从前只能锁在算力中心里的模型推理,被重新释放到了分布式。你家的电脑、我家的电脑,都能推理了。高智商推理,从「集中供给」变成了「包产到户」。

  再往下一步想,更好玩。

  家里的显卡,一天二十四小时,真正干活的时间能有几小时?剩下全是闲置。以前这点闲置算力没人要,因为单机算不了什么正经活。现在不一样了,27B 这个量级的矩阵计算,单卡就啃得动。

  闲置算力共享,这个模式第一次变得可行了。 你家的 4090 闲下来,借给别人跑矩阵计算;别人家的 5090 闲下来,也借给我计算。算力跟水电气一样,成了能调度、能共享的东西。

  再往下,还有一层。

  27B 跑起来了,国产算力卡就有了明确的优化靶子。不用再追着海外旗舰的屁股跑,就盯着这 27B,把推理做到又快又省,这个生态就能转起来。

  一个能干掉你 90% 工作的模型,还带着视觉能力,能看屏幕、能看图、能标边界框。已经非常完美了,真的非常完美。

  就冲这一点,阿里云跟 DeepSeek 一样伟大。一个把推理价格打了下来,一个把高智商多模态大模型从数据中心移动到个人电脑,重新定义了大模型的推理定价,都为人类的科技进步,实打实做了贡献。

  作为一个程序员,我准备部署Qwen3.8-27B未审计版了,期待。

  参考资料 & 外部链接[1] IT之家: https://m.ithome.com/html/989953.htm[2] 知乎专栏: https://zhuanlan.zhihu.com/p/2074073526588515075[3] 知乎专栏: https://zhuanlan.zhihu.com/p/2073424432857666880[4] 知乎: https://www.zhihu.com/question/2072986775899879312/answer/2073517980978262689[5] 知乎专栏: https://zhuanlan.zhihu.com/p/2073484422523905472[6] 知乎专栏: https://zhuanlan.zhihu.com/p/2072834508030744040