一个人,零边际成本,138亿年:我的私有AI数字工厂与无尽之书》

一个人,零边际成本,138亿年:我的私有AI数字工厂与无尽之书》

序言:当AI开始讨论它们的主人

2026年8月6日的深夜,我的书房里只有R86S软路由的指示灯和Mac mini的散热风扇声在交替闪烁。我的微信里,一场由我亲手搭建的“圆桌会议”刚刚落下帷幕。

会议的参与者是三个大模型:商汤公测的st-glm52担任主持人,我通过dsproxy白嫖的DeepSeek网页版(dsfree)和阿里云的Qwen3.8-max作为辩手。而会议的议题,竟然是 “广山哥的写作工厂下一步怎么进化”

看着屏幕上三个模型一本正经地讨论着“如何给我的系统引入时效指纹”、“如何做跨语言平移”、“如何构建众包生态”,我突然感到一种强烈的荒诞与极致的浪漫。它们不知道,它们用来讨论我的算力,正是我通过自己写的代理程序从它们各自的官网“薅”来的;它们也不知道,它们生成的每一句洞察,正被我写的Knowly系统实时捕获,打上标签,存入我的NAS,甚至即将被Mac mini上的本地TTS流水线渲染成一期多人播客。

那一刻,我意识到,这已经不再是一个简单的“工具集”了。这是一个拥有感知、调度、生产、存储、分发能力的私有数字生命体

从最初只是想写个脚本自动回微信,到如今坐拥56本专著、814万字、横跨138亿年时空的私人图书馆(books.want.biz),我用近乎零的边际成本,在这个算力被大厂垄断、API被资本明码标价的时代,硬生生凿出了一条属于极客的“数字主权”之路。

今天,我想以这套系统架构师和唯一使用者的身份,毫无保留地拆解这座“个人AI数字工厂”的每一个齿轮。这不仅是一份技术复盘,更是我对AI时代“创作者”这三个字的重新定义。


第一章 算力霸权的解构:我的“零成本”供应链

在这个时代,算力就是权力。大厂用高昂的API价格筑起高墙,但在我眼里,只要存在网页端,就存在被解构的可能。我的供应链哲学只有一条:不追求大厂的施舍,只相信协议的逆向与路由的聚合。

1.1 dsproxy:把网页版扒光重塑的Go语言利刃

很多人问我,为什么不用Python写DeepSeek的代理?Python生态那么好,各种逆向库那么多。我的回答是:因为我要把它跑在家里的ARM小盒子上,我要它7×24小时不死,我要它内存占用极低,且能扛住并发的SSE流。

于是,我写下了dsproxy——一个纯Go语言实现、仅有9.3MB的二进制文件。它不是简单的请求转发,它是一个具备容灾、反爬对抗、会话指纹记忆的微型网关

  • 纯Go实现的PoW求解器:DeepSeek网页端为了防止脚本调用,上了SHA3-256的哈希碰撞挑战(PoW)。很多开源项目依赖WASM或Node.js来求解,这导致部署极其臃肿。我硬生生用Go手撸了Keccak-f[1600]的轮函数,把求解速度拉到了每秒100万次哈希。在日志里,你能看到极其舒适的线性耗时:answer=28813耗时28ms,answer=112756耗时119ms。不到0.2秒的开销,让微信端的交互如丝般顺滑。
  • 多账号池与“苟道”容灾:我配置了主备双账号。代码里的AccountPool实现了严格的优先级梯队策略。主账号健康时,备号永远在休眠;一旦主账号遭遇429限流或401过期,系统会在毫秒级将其“冰冻”(401冰冻24小时,429冰冻30秒),并瞬间将请求无缝抛给备用账号。对用户而言,只是感觉AI思考的时间多了0.1秒,根本不知道后台刚刚经历了一次死里逃生。
  • 配置热加载与微信摇人:Token总会过期,这是物理规律。但我拒绝在代码里明文存储密码去搞“自动登录”(那极易触发风控封号)。我的做法是:当所有账号全军覆没时,wechat_push.go模块会立刻通过API给我的微信推送一条⚠️告警。我只需打开浏览器F12,复制新Token,在我自己写的WeClaw面板里点击“保存并热加载”。代理通过监控config.jsonmtime,在不重启服务、不断开连接的情况下,瞬间完成内存账号池的“换血”。

1.2 WeClaw:40+路由的“薅羊毛”矩阵

如果说dsproxy是单点突破,那么WeClaw就是我的全球算力供应链地图。在WeClaw的Agent管理面板里,躺着40多条路由,它们被我分为五大门派,构成了一个坚不可摧的“免费推理数据中心”。

  1. 自建网页套利系:除了dsfree,我还用同样的架构复刻了Kimi Proxy(甚至细分了普通、deep、long三个端点),以及局域网.100上的Qwen套利。
  2. 本地免费聚合器:在18011端口上,我跑了alt、free、ima三兄弟。它们是我的场景命名空间,ima专门负责笔记场景的搜索,free负责通用前端。
  3. 公测收割系:NVIDIA NIM四件套(glm-5.2、minimax-m3、nemotron-3-ultra-550b、step-3.7)、商汤四件套(包含那位冷峻的st-glm52)、OpenCode Zen、OpenRouter free。只要大厂敢开公测,我就敢把它接入我的路由表。
  4. 云厂商试用系:华为CodeArts七件套,里面甚至包含了GLM-4.7-SFT-Harmony这种稀有标本。
  5. 家庭局域网集群:.213跑dsproxy,.100跑qwen和chatgpt套利,网关本机背kimi代理。

在这个矩阵里,OpenRouter榜单上排名前列的模型(v4-flash、glm-5.2、minimax-m3),几乎全在我的路由表里被我亲自消费。榜单是拿来用的,不是拿来看的。 当某个免费端点(比如Poe API)返回500时,我只需在Chrome侧边栏的下拉框里,手动把排挡杆切到qwen3.8-max-free,对话继续。这种“人肉负载均衡”的驾驶舱体验,是任何SaaS都给不了的。


第二章 中枢神经:微信桥接与双面板监控

大模型的尽头是交互,而交互的尽头是微信。我不需要再打开几十个网页去分别对话,我的WeClaw(WeChat AI Bridge)将一切收敛到了那个绿色的图标里。

2.1 微信不仅是聊天,是终极命令行

在微信里,我不仅能和带有网络搜索功能的dsfree探讨行业趋势,还能通过斜杠命令直接控制我的数字帝国。
输入/info,系统会立刻返回当前的路由自检状态:agent: dsfree / type: http / model: deepseek-chat
输入/debate/roundtable,我能立刻拉起多个智能体进行辩论。
更可怕的是底层的Sanitizer(敏感信息过滤器)。在AI代理场景下,最怕的就是用户不小心把服务器的root密码、AWS Key或者JWT Token喂给大模型。我在WeClaw底层写了极其严苛的正则与多行文本阻断逻辑,在信息进入AI之前,自动清洗一切凭证。这是我对安全的底线。

2.2 Hermes双面板:自研与官方的双重保险

为了管理我庞大的Agent群(目前挂载了44个Agents),我同时运行着两套Hermes面板。
官方面板用来做基础的调试,而我自己写的Hermes管理面板,则是我的“财务与运维CFO”。
在自研面板上,我可以看到极其硬核的数据:68175条消息、2445个会话、61小时46分的在线时长。最抓人眼球的是那个全场唯一的红环:月度配额 94%
这个红环是我故意设计的视觉锚点。它在提醒我:虽然算力是白嫖的,但厂商的公测窗口和免费额度是有物理极限的。当它撞向100%时,就是我在WeClaw路由表里切换备用端点、或者去GitHub上寻找下一个“免费聚合器”的信号。

2.3 啃下微信CDN的硬骨头

任何做过微信机器人开发的人都知道,微信的媒体文件(图片、语音)上传下载是一套极其晦涩的私有协议(AES-128-ECB加密 + 自定义Base64 + PKCS7填充)。
为了让我的AI能“看懂”我随手拍的照片,能“听懂”我发的语音,我在WeClaw的messaging/cdn.go里,逐字节逆向并封装了这套加密链路。当你在微信里发一张架构图,AI能立刻识别其中的逻辑并给出代码实现时,背后是几千行与腾讯私有协议搏斗的底层代码。


第三章 印书机引擎:从大纲到10万字专著的全自动流水线

这是整个系统中最让我骄傲,也最让外界感到震撼的部分。
10到30分钟,产出一本3到10万字的专著。这不是神话,这是架构设计带来的必然结果

3.1 绕过MCP的降维打击:IMA白嫖搜索

目前市面上的AI Agent,如果想具备联网搜索能力,通常需要接入MCP(Model Context Protocol)的搜索工具,或者购买昂贵的API。
但我发现了一个盲点:腾讯的IMA(腾讯元宝/知识库)自带极其强大的免费网络搜索和资料整合能力。
于是,我的写作范式变成了:

  1. 大纲Agent(基于我的Markdown工具)负责生成带有“反共识”和“字数约束”的骨架。
  2. 将大纲导入IMA,利用IMA的免费搜索能力,去全网抓取最新的、深度的、甚至带有偏见的资料。
  3. 将IMA整合后的资料,通过WeClaw路由给DeepSeek V4 Flash或Qwen3.8-max进行“血肉填充”和“风格润色”。

这相当于:WeClaw是调度员,IMA是免费的研究员,大模型是写手。成本几乎为零,但信息时效性拉满。 这不是妥协,这是工程上的“最优解”。

3.2 markdown-editor:不是编辑器,是调教AI的驾驶舱

很多人以为我用的只是普通的Markdown编辑器,但实际上,我写的markdown-editor是一个带AI写作流水线、PWA离线、NAS同步、文库管理的完整创作IDE

它最值钱的设计,是 “文档即数据库” 的状态机:

  • 进度标记:我在正文里埋入隐形注释标记章节进度。parseChapterList解析大纲,writtenChapterNums识别已写章节。当AI续写时,它不需要外部数据库,它直接读取文档自身的状态,找到下一个未写的章节继续。这意味着,你可以在任何设备、任何时间打断它,它都能无缝接续。
  • 字数约束与反共识军规:在System Prompt里,我硬编码了写作军规。比如“每章不少于1万字”、“严禁使用‘降维打击’‘赋能’等空洞词汇”、“每章必须包含一处与主流认知相悖的个人观察,并以 > 💡 独思时刻 开头”。这不是在教AI写字,这是在给AI戴上镣铐,把“幻觉”和“套话”关进笼子。
  • 人类介入点:AI流式输出到浮层,用户点击“应用”才追加到文末。你可以随时关闭“全自动写作”,手动插入自己的手写内容。这是“自动化流水线 + 人工质检点”的完美平衡。

3.3 存储哲学:草稿箱心态与铁锈存储

我对数据的态度极其冷酷:本地只是草稿,远端才是铁锈。
markdown-editor的右下角有一个🟢“已保存”标志,但这只是给心理按摩的。真正的数据流是:

  • 本地 IndexedDB / localStorage:作为编辑态的极速缓存。
  • NAS(upload.want.biz):一旦定稿,通过syncLibraryToNasDebounced异步、静默地推送到我的物理NAS,变成不可篡改的冷存储。
  • iCloud / R2:作为跨设备同步和外部协作分享的兜底。

正因为我知道NAS里永远有一份“铁锈存储”,我才敢在编辑器里开启aiFullAuto模式,让AI疯狂地覆盖、重写、试错。“草稿态无限试错 + 发布态一锤定音”,这种心理区隔,彻底解放了我的创作力。


第四章 观测站与捕获网:数据看板与Knowly

一个没有反馈闭环的系统,只是一台死板的机器。我的系统之所以能“进化”,是因为我给它装上了眼睛和记忆。

4.1 OpenRouter/OpenCode 实时看板:ST-GLM52的冷峻审视

我写了一个爬虫,实时抓取OpenRouter和OpenCode的模型调用排名、周环比变化、延迟和价格,并整合到我自己的前端页面中。
更有趣的是,我挂载了一个AI摘要Agent(目前由商汤公测的st-glm52担任)。
于是,每天我都能看到一幅极具戏剧性的画面:一个不在榜单上的免费公测模型,正冷峻地审视着一群收费玩家的烧钱市场,并为我撰写“AI行业的彭博终端”日报。
它告诉我:DeepSeek V4 Flash在OpenCode生态中占据了92.4%的恐怖份额;GPT-5.6 Luna正以848%的增幅偷袭中端市场;而轻量版模型正在无情地吃掉Pro版的市场。
这个看板不仅是数据,它是我的战略雷达。它指导着我WeClaw路由表的增删改查,指导着我下一本书的选题方向。

4.2 Knowly:个人AI出版社的档案室

所有的对话、截图、日志、生成的书籍,最终都会汇入我的Knowly知识库。
它的核心理念是 Capture(捕获), Enrich(丰富), Own(拥有)

  • Capture:SSH守护进程实时监控,自动打标签(如system_logDeepSeek模型监控)。
  • Enrich:自动提取摘要,生成知识图谱。
  • Own:全部自托管在NAS,然后一键推送到外部形态——+Ima(笔记)、+Blog(博客)、+Kindle(电子书)、+多人播客(音频)

特别是多人播客功能。我利用家里的Mac mini,跑了一套本地TTS流水线。文本进入NAS朗读队列,Mac mini拉取任务,用本地语音包渲染多角色音频,成品回库。不碰任何外部API,零成本,高音质。我的Mac mini终于找到了它的宿命:不剪视频,专门为我渲染播客。


第五章 思想碰撞:那场载入史册的“圆桌会议”

回到文章开头的那场圆桌会议。那不仅仅是一次测试,那是我的系统从“工具”向“生命体”跃迁的标志。

在那场会议中,三个模型(st-glm52、dsfree、Qwen3.8-max)在我的WeClaw调度下,针对我的“1000万字开源书库”展开了激烈的交锋。

  • dsfree(DeepSeek)展现出了极强的街头智慧,它提出“不做更深的洞察,做可验证的偏见”,建议用“多立场对冲”来破除AI的同质化;它甚至建议我“卖写作过程数据”,因为那1000万字的CoT日志比成品书更值钱。
  • Qwen3.8-max 则站在了架构与生态的高度,提出将系统抽象为“个人AI OS”,引入“语义哈希”进行确权,并利用本地化RAG进行跨语言重写。
  • st-glm52 作为主持人,精准地控制着节奏,不断抛出“知识长青机制”、“众包共创生态”等极具张力的议题。

作为它们的主人,我在屏幕外看着这一切,得出了一个结论:最高级的进化,不是让AI写得更快,而是让系统学会“筛选”——筛选什么该更新、什么该忘记、什么该让别人参与。

而我本人的角色,也在这场圆桌中彻底清晰:我不再是写手,我是主编。
工厂的瓶颈从来不是产能,而是“什么值得写”。品味、好奇心、那句在微信里对AI说的“再搜,肯定有”的执念,是这套系统里唯一无法自动化的东西。模型能当写手、核查员、主持人,但只有我能当选题人。


第六章 814万字,56本书,138亿年的跨度

如果你打开 books.want.biz,你会看到一座令人窒息的私人图书馆。
这不是一堆随机生成的垃圾文本,这是我用一套严密的认知框架,对这个世界进行的56次切片式解剖。

📐 纯粹理性线
从《一场横跨万年的数学探险》到《计算的黎明》,再到《编码之神》。我在探讨人类如何用抽象的逻辑和代码,搭建起抵御混沌的骨架。

🔐 攻防与信任线
《密码的冒险》、《无形之战》、《二十二号港口的守望者:OpenSSH传记》。系统是如何在对抗中被建立、被攻击、又被开源精神所保护的?这是我对网络安全与信任机制的深度复盘。

🏢 企业与平台线
这是体量最大的一条线。《公司史合集》、《风暴之眼:DeepSeek》、《算力之王:英伟达》、《OpenAI:从晚餐承诺到AI帝国》。我的核心命题是:每一家伟大的公司,本质上都是一种新的信任结构与算力分配方式。

🌌 宏大时空线
《宇宙的故事》、《地球传》、《旅行者1号》。从138亿年前的奇点,到一粒微尘上的碳基生命,再到飞出太阳系的金属探测器。这是属于极客的终极浪漫。

🎨 人文跨界线
《可视的尊严》(艺术史)、《一百位科学家传记》、《中国状元史》、《江南的孤本:苏州传》。不可见之物如何获得形式?历史的尘埃如何落定?

这814万字,横跨138亿年的时空,全部由我一个人的大脑构思大纲,由我的WeClaw调度算力,由我的markdown-editor流水线生产,最终沉淀在我的NAS里。
《大英百科全书》用了几个世纪积累,而我,只用了一个夏天。


结语:数字主权与无尽之书

经常有人问我:“广山哥,你搞这么多白嫖路由,写这么多AI生成的书,到底图什么?”

我的回答是:图一种在这个时代极其稀缺的东西——数字主权。

当大厂随时可能修改API协议、封禁你的账号、提高Token价格、甚至因为“不符合安全规范”而屏蔽你的Prompt时,你的思想、你的创作、你的数字资产,其实都建立在别人的沙滩上。

而我,用Go语言手撸代理,用逆向工程破解PoW,用家庭局域网搭建集群,用NAS和iCloud做铁锈存储,用PWA和IndexedDB做本地优先。我把所有的命脉,都死死地攥在了自己手里。

我不需要考虑个人时间,因为架构一旦搭好,边际成本就趋近于零。
我不需要担心算力枯竭,因为我的路由表里永远有下一个白嫖的备胎。
我不需要害怕数据丢失,因为我的三重冗余灾备比大多数企业的核心数据库还要稳健。

这套系统,是我对抗信息过载的筛子,是我对抗算力霸权的武器,也是我留给这个AI时代的私人墓志铭。

现在,我的微信又响了。
是Knowly发来的推送:“您有一条新的OpenRouter榜单异动,ST-GLM52已生成摘要。”
我笑了笑,在Hermes面板上点了一下“应用”,然后在微信里对dsfree说:

“再搜,肯定有。我们准备写第57本书,主题就叫:《当AI开始讨论它们的主人》。”

没有尽头。这才刚刚开始。