Стратегия
Защо повечето GenAI пилоти не връщат нищо измеримо
MIT NANDA откри, че ~95% от GenAI пилотите нямат измерим ефект върху P&L. Какво мери изследването, какво не може да покаже и как се пише критерий за спиране.
- Публикувано
- Четене
- 8 мин
- Стъпва на
- Публикувани изследвания — MIT Project NANDA 2025, Gartner, Евростат — плюс собствения ни метод за гейтване на портфолиото
Числото е на всеки слайд от август 2025 г. насам: около 95% от GenAI пилотите не произвеждат измерима възвръщаемост. Цитира се като присъда над технологията. Не е. Присъда е над начина, по който пилотите са били подготвени да бъдат съдени — а корекцията е един абзац написан текст, който почти никой не произвежда, преди разработката да е тръгнала.
Изследването твърди по-малко от заглавието и нещо по-полезно
Източникът е The GenAI Divide: State of AI in Business 2025 на MIT Project NANDA: 52 структурирани интервюта, анкета сред 153 ръководители и преглед на над 300 публични внедрявания. Това е целева, а не случайна извадка, а „няма измерим ефект върху P&L“ в повечето случаи е самооценка на организации, които никога не са установили базова линия, спрямо която да мерят.
Прочетено стриктно, откритието е, че около 95% от организациите не са успели да произведат число. Това е различно твърдение от „95% не са произвели стойност“ и изследването не може да раздели двете. То е и напречно във времето: снима популация, чиито пилоти в мнозинството си са на по-малко от година — етап, на който честният отговор на „какво върна това?“ често е „твърде рано е“.
Задръжте разграничението и по-интересните резултати се оказват другаде в същите данни. Фунията за специализирани GenAI инструменти в предприятията върви около 60% проучени, около 20% пилотирани, около 5% успешно внедрени. Но генеричните чатбот инструменти минават от пилот към внедряване в около 83% от случаите. Сривът е концентриран в custom и вендорските корпоративни системи, не в езиковите модели като такива. Каквото се чупи, се чупи в точката, в която моделът среща system of record и собственик на процес.
Още две числа оцеляват след възраженията към извадката, защото са сравнителни — двете рамена са мерени по един и същи начин. Пилотите през външно партньорство стигат до внедряване в около 67% от случаите срещу около 33% при вътрешните разработки, а употребата от служителите е близо двойна при външно изградените инструменти. И около половината от GenAI бюджета отива в продажби и маркетинг, където атрибуцията е лесна, докато най-големите документирани икономии в извадката са в back office: 2–10 млн. долара годишно от премахване на BPO, 30% спад в разходите за външни агенции, около 1 млн. долара годишно от аутсорснати проверки по риск мениджмънт.
Бюджетът е следвал измеримостта, а не изплащането. Това, а не 95-те процента, е находката, по която си струва да се действа.
Пилотите рядко се провалят. Просто спират да се споменават.
Прогнозата на Gartner от юни 2025 г. е, че над 40% от проектите с agentic AI ще бъдат отменени до края на 2027 г. — заради ескалиращи разходи, неясна бизнес стойност и недостатъчен контрол върху риска. Отмяната е това, което се случва, когато свърши бюджетен цикъл. Идва късно, идва в удобния за спонсора момент и не учи организацията на нищо, защото дотогава никой не може да възстанови срещу какво изобщо е трябвало да се мери пилотът.
Написаният критерий за спиране се различава в едно отношение, което носи цялата тежест: има дата. Превръща „това работи ли?“ от преценка — на която човекът, поръчал работата, винаги отговаря оптимистично — в справка.
Критерият за спиране е шест конкретни неща, а повечето написани имат две
Тези, които виждаме на практика, съдържат метрика и надежда. Критерий, който наистина може да сработи, съдържа:
- Метрика на ниво единица работа — цена за успешно изпълнена задача, за разрешен тикет, за обработена фактура, за изготвен документ. Цената на токен е вход, не KPI.
- Базова линия, измерена преди разработката, с фиксиран в писмен вид метод на измерване. Извадка от process mining или двуседмично измерване на времето; никога оценка на мениджър и никога преизмерване с друг инструмент след това.
- Праг с посока и допуск — числото, при което пилотът продължава, се преработва или спира.
- Прозорец на измерване и календарна дата, фиксирани преди да е видян първият резултат.
- Популация, включително контролна група, която не получава инструмента. Без контрафакт не можете да отделите модела от сезонността.
- Поименен подписал. Не комисия.
Където има установени стойности, ползвайте ги. Адопция под 30% от лицензираните места е провален rollout независимо от качеството на модела; здравата устойчива адопция е над 60%. При RAG система recall@5 под 80% прави работата по качеството на генерацията безсмислена, защото по-голямата част от това, което се докладва като халюцинация, е провал на retrieval-а. Праговете за groundedness върху golden set обикновено стоят между 90% и 97% според рисковото ниво. Това са release gates. Критерият за спиране стои над тях, върху бизнес метриката — система може да мине през всеки release gate и пак да си струва да бъде изключена.
Ние самите сгрешихме това по най-лесния за грешене начин. Първият ни написан критерий беше дефиниран върху точност спрямо golden dataset: прецизен, опровержим и наш. Мереше нещо, което ние контролираме, и щеше да мине комфортно, докато инструментът стои неотворен. Критерий върху метрика, която доставчикът притежава, не може да сработи. Единственият ни проект, чието число издържа на въпроси после, е автоматизацията на имейл маркетинга за козметична марка — около -60% време за подготовка на изходящата комуникация, измерено от клиента — и то само защото времето преди това беше записано.
Подписът е механизмът, а не церемонията
Подписалият е собственикът на процеса, чиято опашка, щат или cycle time реално се променя — не изпълнителният спонсор, одобрил бюджета, не IT и не доставчикът.
Стимулът на спонсора е продължаването; спонсор, който спира проект, докладва нагоре собственото си погрешно разпределение на средства. Стимулът на собственика на процеса върви в обратната посока, а и по-практично: само той може да изпълни връщането назад, защото връщането е промяна в начина, по който екипът му работи в понеделник сутрин.
Ако никой в организацията не иска да сложи името си под прага, самият отказ е резултатът от гейта. Означава, че на нивото, където работата се случва, в стойностната обосновка никога не е било повярвано.
В деня, в който сработи, не тръгвате от нула
„Изключено“ трябва да бъде изпробвано, преди да потрябва. Измерете средното време за връщане към предишния ръчен процес, докато пилотът е още здрав — план за rollback, който никога не е бил изпълняван, е абзац, а не способност.
Пазете логовете. Член 26, параграф 6 от AI Act задължава внедрителите да съхраняват автоматично генерираните логове поне шест месеца, а извеждане от експлоатация, което сваля средата същия следобед, унищожава доказателства, които сте длъжни да държите. Неприлагането не е освобождаване от отговорност: към януари 2026 г. България няма определен орган за надзор на пазара и няма национален санкционен режим, а задължението възниква независимо от това.
После запишете кое от шестте условия е паднало и направете инвентаризация на оцелялото. Golden dataset-ът, етикетиран от вашите собствени експерти по темата, оцелява. Таксономията на изключенията — няколкостотин реални случая, кодирани по причина — оцелява и обикновено е най-ценният артефакт от целия пилот, защото в документоемкия back office голяма част от изключенията се оказват проблеми с данните нагоре по веригата (грешна референция към поръчка, липсващи master data), които никой модел не е щял да поправи. Работата по интеграциите и правата за достъп оцелява. Измерената базова линия оцелява и тя прави следващия опит по-евтин.
Портфолио с 0% спрени кандидати има декоративни гейтове. Здравото отсява 30–50% преди разработка. Питайте всеки консултант — нас включително — кои са последните три случая на употреба, срещу които е препоръчал. Консултант, който не може да назове нито един, не гейтва нищо.
Къде това спира да важи
Критерият за спиране е инструмент за случаи с ефективност и изброима единица работа. Стои зле върху залози за нова способност, върху работа, водена от регулаторно съответствие, при която няма алтернатива по избор, и върху всичко, при което контрафактът наистина не може да бъде изолиран. Да наложите фалшив праг върху тях е по-лошо от това да признаете, че се финансират по преценка.
Прозорците трябва да отговарят и на вашия собствен темп. Най-добрите средни по размер компании в извадката на NANDA минават от пилот до пълно внедряване за около 90 дни; големите предприятия отнемат девет месеца и повече. Критерий от 60 дни в организация с деветмесечен цикъл не налага дисциплина — той убива неща, преди да се разчисти интеграционният дълг, и правилният отговор е да поправите cycle time-а, а не прага.
И нищо от това не замества неблагодарната част. Данните на Евростат за 2025 г. поставят използването на AI в българските предприятия на 8,55% срещу 19,95% средно за ЕС. Разликата няма да се затвори, защото някой е написал по-добър гейт. Затваря се, когато първият случай на употреба бъде измерен спрямо нещо — и измерването е било договорено, преди някой да е видял резултата.
