Mistral пусна Shieldstral - европейски, мултимодален класификатор за безопасност с 3 милиарда параметъра и отворени тегла под Apache 2.0. Политиката за модерация влиза като обикновен текст при самото извикване, без ново трениране. По данни на Mistral моделът държи нивото на системи до 7 пъти по-големи, и го прави на една карта с 16GB памет.
- Shieldstral: мултимодален класификатор за безопасност от Mistral с 3 милиарда параметъра - промптове, отговори, отказ, токсичност; текст и изображения (04.08).
- Политиката за модерация се подава като текст при извикването; нова политика не иска претрениране. Отговорът е калибриран резултат от едно минаване.
- Отворени тегла в Hugging Face, лиценз Apache 2.0; по данни на Mistral държи нивото на системи до 7 пъти по-големи и върви на една 16GB карта.
Всеки жив AI продукт носи един и същ невидим проблем: кой пази входа и изхода. Досега отговорът бе или чужд API, или пазач, трениран веднъж завинаги върху чужда представа за 'лошо'. Твърде статично.
Това го бива, и ще кажа защо. Досегашните пазачи бяха тегла - представата какво е допустимо се пече в модела при тренирането, и после я търпиш каквато е. Тук представата е текст, твой текст. Правилата за детско приложение, за медицински асистент и за вътрешен фирмен инструмент стават три различни файла, не три различни модела.
И втората половина: Apache 2.0 на карта с 16GB памет значи, че пазачът слиза и при малките играчи. Модерация с твои правила, на твоя машина, без ред от клиентския текст да излиза от къщата - доскоро това беше лукс само за компании с цял ML екип.
Кое ще остане, питам се. Формата. Самият модел ще бъде задминат - половин година е цял живот в тази класация. Но пазач, който приема политика в движение, се подменя, без да бутнеш нищо около него.