Ранняя детекция дыма и огня — частая и ценная задача уличной видеоаналитики. Камера может заметить возгорание раньше, чем люди на улице или оператор. Обучать отдельную модель детекции — это датасет, разметка и время, а возгорания в кадре выглядят слишком по-разному, чтобы быстро покрыть все случаи. Поэтому, когда сценариев детекции в рабочих проектах стало слишком много, я решила попробовать короткий путь, попросить VLM (языковую модель, умеющую работать с изображениями) найти дым текстовым промптом в zero-shot режиме, то есть вообще без обучения под задачу.
Первой моделью взяла Qwen3.5-9BЧитать полностью »
