Автор создал собственный бенчмарк из 100 задач по Rust для сравнения моделей, включая модели до 3B параметров. По результатам этого бенчмарка Temper 0.5B обошла более крупные аналоги.
Для обучения модели использовались два датасета: первый из 2700 примеров, полученных от Qwen3.6–35B‑A3B, и второй из 10 тысяч примеров от DeepSeek‑V4-Flash. Финальная версия модели была дообучена с подкреплением (RL).