WSAI-Math:基于严格验证蒸馏数据训练的 0.8B 数学推理模型

上一篇文章介绍了 WSAI-Math-Distill——3,867 条逐条判分验证、对评测集 8-gram 去污染的数学长思维链蒸馏数据集。现在,基于该数据集训练的模型 WSAI-Math 发布了。

模型基于 Qwen3.5-0.8B,以 DeepSeek deepseek-v4-flash 为教师做长思维链蒸馏冷启动,LoRA SFT 50 个优化步,merge_and_unload 合并导出 BF16 全量权重。这次实验要回答的问题很明确:高纯度蒸馏数据 + 极小训练量,能把 0.8B 基座的数学推理行为改造到什么程度。

阅读全文 >>

WSAI-Math-Distill:一个每条答案都严格验证过的数学蒸馏数据集

开源社区里的数学推理蒸馏数据集不少,规模动辄几万到几十万条。但我在调研时发现两个反复出现的问题:

  1. 答案没有逐条严格验证。部分数据集采用宽松的规范化匹配,格式不同、实质错误的回答也会被判为正确;
  2. 评测集污染。训练题与 AIME 等评测题同源重叠,训练后在榜单上的分数虚高,无法反映真实推理能力。

这两个问题直接影响蒸馏出来的模型质量评估。于是我按「验证和去污染优先于规模」的思路,构建了 WSAI-Math-Distill——一个严格验证的数学长思维链蒸馏数据集。

阅读全文 >>

被 AI 爬虫“白嫖”到破防?我手搓了一个带隐形防盗的 Hexo 博客主题

作为一名坚持在独立博客输出技术文章的人,这两年我经历了太多的“至暗时刻”。

翻遍 GitHub 找主题,发现 Hexo 主题圈似乎陷入了极端,都是一堆 Vibe Coding的光污染严重、加载卡成 PPT 的花哨模板。更让人头疼的是,想要个本地搜索、文章目录或者代码块折叠,往往需要自己拼凑一堆年久失修的第三方插件,折腾几个周末才能勉强跑通。

但最让我破防的,是AI 时代的“野蛮采集”。自己熬夜查文档、画架构图肝出来的深度长文,转头就被各种大模型爬虫默默抓走当了训练语料,连个署名和出处都不留。

既然找不到完美的轮子,那就自己造一个!

经过几个月的打磨,我开源了这款名为 Pixie 的 Hexo 主题。它不仅仅是一个“深色霓虹风”的皮肤,更是我针对现代技术博客痛点交出的一份答卷:内置现代交互、死磕移动端体验,并首次加入了针对 AI 爬虫的版权防御机制。

👉 GitHub 仓库(如果它恰好击中了你的痛点,恳请赐一个 Star ⭐!):https://github.com/wangshengithub/pixie

阅读全文 >>

不想搭后端,怎么给网页加密码保护?我写了个零依赖的开源工具

你有没有遇到过这种场景?

  • 做了一个付费课程的预览页,只想让付过钱的人看到内容
  • 开发了一个小游戏 / 小工具,只想在小圈子里分享,不想被搜索引擎收录、被陌生人随便打开
  • 临时需要把一个页面分享给特定的人,但不想搭服务器、不想写后端、不想折腾鉴权系统

传统方案是什么?Nginx 加个 Basic Auth?搭个 Node/Python 后端做登录?用第三方 SaaS 加密平台?

太重了。

我只是想给一个 HTML 页面加把锁而已。

所以我写了 StaticShield——一个零后端、零依赖的静态网页加密工具。一条命令,把你的 HTML 变成一份「自解密页面」:没有密码,看到的是一扇锁着的门;输入密码,浏览器本地解密,原始内容瞬间还原。

GitHub 地址:https://github.com/wangshengithub/staticshield

阅读全文 >>

从割草喂马到神驹降临:我做了个古风牧场育成放置游戏

「Horse Empire」(奉国牧马)—— v1.0 公测版,全球上线。

谁小时候没幻想过拥有一群自己的马呢。给它取个名、喂它吃草、看它一点点长大——然后某天它当上了爸爸或妈妈,生下一匹小马驹。你凑过去一看:比它爸还精神。

现实里养不起马,那就在浏览器里养。割草、喂马、配种、繁殖,从几匹最普通的慢驹起步,慢慢育出良驹、千里驹、贡驹——直到某天,神驹降临。

这是一个古风牧场育成放置游戏。

阅读全文 >>

敲电子木鱼,攒赛博功德:我做了个能「飞升成佛」的放置小游戏

每天上班如上坟,下班躺平如咸鱼。焦虑的时候,总想找点东西敲一敲。

以前的人敲木鱼是为了静心,现在人没木鱼就敲键盘,于是我做了一个赛博木鱼:在手机和电脑上点一点,攒的不是烦恼,是赛博功德。

它叫 「赛博木鱼:功德无量Pro」(英文名 ZenIdle)——一个放置类(idle)小游戏,点一下功德 +1,挂着也会自己涨,最终目标是飞升成佛、功德圆满

阅读全文 >>

我用 AI 自己写了一部 78 万字的网文,结果却出乎我的意料

最近我做了一个实验,用了 Claude Code ,让 AI 自己从头到尾生成了一部都市种田网文。从建项目、写总纲和详细大纲,到逐章生成正文,全程 AI 独立完成。我不做任何人工修改,包括那些明显的错误和别扭的地方,全部原样保留。

结果就是这本书:《我在城市种田养鸡》——320 章,7 卷,约 78 万字

小说点这里直接看

小说的设定本身挺典型:38 岁失业男青年方远背了一身债,突然获得「农场系统」,在自家楼顶种出品质逆天的灵植,被人质疑、自证、打脸,最后建立城市农业帝国、收获爱情。

但接下来我要说的,才是这个项目的重点。

阅读全文 >>

DeepSeek-V4 只能用来聊天?我把它接入开源项目,解决了「早餐吃什么」的世界性难题

前阵子 DeepSeek-V4 系列模型正式发布了,我关注到的不只是参数规模(V4-Pro 总参数 1.6T),还有价格——百万 tokens 输出只要六块钱,输入命中缓存甚至只要两分五。这个调用成本,已经低到可以随便用了。

我每天早上都在纠结同一个问题:冰箱里的贝果明明还有好几天才过期,但每次都被新买的其他面包挤到最里面,最后放到过期才发现。周末囤的食材,周一早上翻半天找不着,最后还是只能叫外卖。

于是花了一个周末,基于 DeepSeek-V4 全系列模型(V4-Pro / V4-Flash 都支持)做了个小工具——Breakfast Manager(早餐管理应用),现在已经在Github上完整开源。

接入了 DeepSeek-V4 全系列模型,用来干什么?

项目里最核心的 AI 能力就是调用 DeepSeek 的 API。用户先在后台填写身体数据:身高、体重、年龄、性别,还可以加上特殊要求,比如示例数据里的“减脂期,高蛋白低碳水”。

系统会结合你冰箱里现有的食材库存,调用 DeepSeek-V4 模型(默认使用 DeepSeek-V4-Pro)生成个性化的早餐建议。前端用的是流式输出,AI 的回答一个字一个字往外蹦,体验比干等几十秒舒服很多。

代码里同时预留了 V4-Pro 和 V4-Flash 的切换入口。如果你只是想随便玩玩,用 V4-Flash 成本几乎为零;如果希望营养建议更细致、逻辑更严谨,切到 V4-Pro 也就多花一两分钱。当然,其他支持OPENAI格式的API也都能接入。

除了 AI,它还是一个完整的早餐库存管理系统

只做个套壳的 API 调用网页太没意思了,我把前后端都搭了出来:

  • 库存管理:记录冰箱里的每一件早餐食材,支持“盒、袋、个、杯”等多种单位。可以一键消耗或补充库存,库存低于设定值时会自动提醒。

  • 保质期管理:设置截止日期,系统会自动标出即将过期或已过期的食材。
  • 统计仪表盘:展示总品类、总库存、低库存、即将过期数量,还有近 7 天消耗趋势折线图、品类消耗分布环形图、库存概览柱状图。图表基于 Chart.js 实现,不依赖外网 CDN,速度极快。
  • 常用模板:可以把常用的早餐存成模板,不用每次重新填一堆食材信息。
  • 数据备份与恢复:一键导出 / 导入所有数据为 JSON 文件,换电脑也不怕丢。
  • 暗色模式 + 中英双语,一键切换,装逼更有风范。

技术栈是 Node.js + Express + 原生 JavaScript + Tailwind CSS,数据直接存在本地 JSON 文件里,无需联网数据库,保证数据安全。

安装命令

项目托管在 GitHub 上,整套命令如下(Node.js 安装过程略去):

1
2
3
4
git clone https://github.com/wangshengithub/breakfast-manager.git
cd breakfast-manager
npm install
npm start

启动之后浏览器访问 http://localhost:3000 就可以用了。
首次使用需要去 DeepSeek 开放平台申请一个 API Key,然后在网页后台填进去就行。按 V4 现在的定价,你一顿早餐的钱够调几百万次都说少了。

为什么把它开源?

一方面是自己觉得确实能解决“冰箱里有东西却不知道吃什么”的痛点,就来分享给大家;另一方面也是希望如果你有兴趣,可以直接看代码学一下 Node.js + Express 的小项目是怎么组织的。如果你也经常为早餐发愁,或者厨房里总有食材放到过期,可以试试这个工具。代码很轻量,没有复杂依赖,运行起来就能用。

如果这个项目帮你省下了每天早上站在冰箱前纠结的几分钟,或者它的代码解决了你开发中的一些疑问——请在 GitHub 上给我点一个 Star ⭐️!

这是对我熬夜写代码最大的鼓励。

项目戳这里