AI 工具

SMRA — VibeThinker-3B 小模型推理增强系统

一个本地计算研究系统,用来检验 3B BF16 数学模型能否通过独立采样、确定性验证与自适应测试时计算提高最终答题质量。

本地小模型推理研究 进行中 2026 研究设计、系统架构、实现与评测
VibeThinker-3B本地推理测试时计算数学推理可复现评测

小模型能否作为一个系统变得更会推理

SMRA 的全称是 Small Model Reasoning Amplifier,是一个围绕 WeiboAI/VibeThinker-3B 搭建的本地研究项目。它研究的是:在固定计算预算下,一个 3B 数学模型能否通过多条独立解题路径、确定性检查、错误驱动重试、关键论断复核和自适应追加尝试,提高最终答案质量。

项目不会把系统提升写成底层 3B 模型已经等同于旗舰模型。真正被研究的是系统级表现:通过更谨慎的推理编排与验证,一个固定的本地模型在特定、可验证的数学任务上究竟能够被提升到什么程度。

一套完整的本地实验环境

当前系统在 24GB 统一内存的 M4 MacBook Air 上,通过 MLX 运行固定 revision 的 VibeThinker-3B 官方 BF16 权重。内存中只常驻一个模型实例,最多同时服务两条独立序列;额外请求由 FIFO 调度器排队,并在任意一条序列完成后立即补入空出的运行槽。

本地 FastAPI 服务负责运行创建、取消、健康状态、SSE token 事件和 JSONL 记录。React 界面与 Electron 桌面应用提供独立 Chat、候选实时输出、验证状态、运行历史、模型设置与诊断。服务只监听本机地址,每一道新题都会从干净 Chat 开始,不继承其他题目或候选的上下文。

从冻结基线到自适应推理

实验被拆成清楚的阶段。S0 是每题一次、没有增强的 BF16 回答;S1 加入三条独立路径和多数选择;S2 加入符号等价、代入、有限穷举与边界检查等确定性验证;S3 根据错误类型定向重试;S4 与 S5 再加入 Lite-CLR 关键论断反驳,以及从 3 个候选自适应扩展到 5 个或 7 个候选的控制器。

当前应用已经开放实际实现的 S0 与 S1。S2–S5 仍属于后续研究阶段,只有在规则、Prompt、种子和预算冻结后才会进入正式报告。这样可以把规划中的强化方法与已经通过工程验收的能力明确分开。

先保证可复现,再讨论结果

v0 BF16 裸模型基线已于 2026 年 7 月 16 日冻结,固定了模型 revision、Prompt 哈希、生成参数、种子清单、数据集 manifest 和 Git 标签。运行时使用 131,072 tokens 上下文与 65,536 tokens 输出上限,并记录 Prompt、原始输出、token 数量、结束原因、延迟、内存、swap、验证结果与源码 commit。

主评测使用不含答案的 Frontier Text-20 盲测集,答案键保存在模型无法访问的项目目录之外,只由评分桥读取。Mixed-20 继续冻结并留给后续视觉与证明轨道,不会为了让无图片输入的模型参与而临时转写或偷偷改成纯文字题。

当前状态

本地 API、真实 MLX 模型适配器、连续双路调度、SSE 流式输出、运行记录、批量评测桥、Chat 界面、设置、诊断、文档和桌面应用打包已经完成。v0 工程验收也已通过,覆盖真实模型完整输出、双并发、FIFO 排队、取消、清理后重跑和动态补位。

Frontier Text-20 的正式结果仍待完成,页面不会提前把它写成已经产生的成绩。下一阶段会先完成并复核冻结基线,再在不根据答案回头修改基线的前提下,实现确定性验证与自适应增强阶段。