研究问题
SMRA 研究的是:在固定计算预算下,一个固定的 3B 数学模型能否通过独立解题路径、确定性检查、错误定向重试、关键论断复核和自适应追加尝试,提高最终答案质量。它考察的是系统级表现,而不是把底层模型写成已经等同于旗舰模型。
实验设计
分阶段设计从 S0 开始:每题一次未经增强的 BF16 回答;S1 则加入三条独立路径与多数选择。后续阶段会加入确定性验证、错误驱动重试、关键论断反驳,以及从 3 个候选自适应扩展到 5 个或 7 个候选。当前只有 S0 与 S1 被实现并作为完成工程路径开放。
冻结基线与可复现性
v0 BF16 基线固定了模型 revision、Prompt 哈希、生成参数、种子清单、数据集 manifest 和 Git 标签。每次运行都会记录 Prompt、原始输出、token 数量、延迟、内存、验证结果与源码 commit。Frontier Text-20 通过独立评分桥评测,其答案始终保留在模型无法访问的项目树之外。
当前阶段
本地运行时、调度、流式输出、运行记录、批量评测桥与桌面界面均已可用。Frontier Text-20 的正式结果仍待完成;下一里程碑是在加入验证或自适应阶段之前,先完成并复核冻结基线。
研究记录
VibeThinker-3B 增强项目正式开始
面向 VibeThinker-3B 小模型的推理增强项目正式开始,目标是在固定基线、可复现评测与分阶段验证的基础上,探索能够稳定提升小模型表现的软件系统。