Il software di analisi AI delle immagini patologiche si riferisce a un software indipendente basato su immagini patologiche digitali che utilizza tecnologie di intelligenza artificiale come il deep learning per funzioni come la segmentazione e il rilevamento. Rientra nella classe Ⅲ della gestione dei dispositivi medici. Le immagini patologiche digitali comprendono immagini microscopiche di cellule o tessuti ottenute tramite dispositivi di imaging, nonché immagini patologiche ottenute dalla tecnologia Whole Slide Imaging (WSI). Il software viene utilizzato nelle istituzioni mediche e/o nei laboratori medici per assistere i patologi nel fornire informazioni per la diagnosi, la prognosi, il trattamento delle malattie, ecc. Tuttavia, non può essere l'unica base per le decisioni diagnostiche cliniche.
Il documento "Key Points for Performance Evaluation and Review of Pathology Image AI Analysis Software" ha lo scopo di guidare i richiedenti nella preparazione e nella stesura della sezione di valutazione non clinica della domanda di registrazione del software di analisi dell'intelligenza artificiale per immagini di patologia. Serve anche come riferimento per i dipartimenti di revisione tecnica, concentrandosi sui requisiti per i dati di ricerca del software, comprese le specifiche della domanda e i dati di ricerca dell'algoritmo.
Le specifiche dei requisiti considerano la raccolta dei dati, le prestazioni degli algoritmi e le restrizioni d'uso. La raccolta dei dati deve considerare la conformità, l'adeguatezza e la diversità delle fonti di dati, la scientificità e la razionalità della distribuzione dei dati e l'adeguatezza, la validità e l'accuratezza del controllo di qualità dei dati. I dati devono provenire da diverse regioni e da non meno di 3 istituzioni di provenienza. Le istituzioni devono seguire le procedure descritte nel manuale per la produzione dei vetrini, la colorazione dei tessuti e la preparazione dell'immunoistochimica. Le prestazioni dell'algoritmo, considerando l'uso previsto del prodotto, devono valutare in modo esaustivo l'applicabilità e i requisiti degli indicatori di prestazione, quali velocità di analisi, sensibilità, specificità, ripetibilità, riproducibilità e generalizzazione. Vanno considerati anche i fattori che influenzano le prestazioni degli algoritmi, come il gradient vanishing, il gradient explosion, l'overfitting e l'underfitting. Le restrizioni d'uso devono indicare con precisione gli scenari in cui il prodotto è vietato o sconsigliato, descrivere gli scenari d'uso del prodotto e fornire le necessarie informazioni di avvertimento.

I dati relativi alla ricerca sugli algoritmi devono includere rapporti di ricerca sugli algoritmi per ogni algoritmo di intelligenza artificiale o combinazione di algoritmi. Ciò include le informazioni di base sull'algoritmo, la gestione del rischio dell'algoritmo, le specifiche dei requisiti dell'algoritmo, la raccolta dei dati, l'addestramento dell'algoritmo, la valutazione delle prestazioni dell'algoritmo e l'analisi della tracciabilità dell'algoritmo.
Il livello di sicurezza di questo software è classificato come severo. Per la raccolta dei dati, è richiesta una dichiarazione di conformità della fonte dei dati, che specifichi informazioni quali i nomi delle istituzioni di origine dei dati, le loro sedi, i volumi di raccolta dei dati e i numeri di approvazione etica. La raccolta dei dati deve essere accompagnata da un documento di procedura operativa per la raccolta dei dati, che includa i piani di raccolta dei dati e le procedure operative standard; le istituzioni cliniche eseguono principalmente la raccolta dei dati e il processo di raccolta deve prevedere la codifica e la numerazione dei dati del campione, con il piano che delinea le regole di numerazione.
L'organizzazione dei dati deve definire chiaramente le procedure di pulizia/preelaborazione dei dati, descrivere brevemente il software utilizzato nell'elaborazione dei dati e presentare i dati di ricerca per ogni software utilizzato nell'elaborazione dei dati. L'etichettatura dei dati deve specificare i requisiti di qualificazione e il contenuto della formazione del personale addetto all'etichettatura e degli arbitri; il personale addetto all'etichettatura e gli arbitri devono essere patologi e i dati devono essere etichettati da almeno due persone. Una certa percentuale di dati può essere selezionata per la valutazione del personale non addetto all'etichettatura. La costruzione degli insiemi di dati deve chiarire i metodi e le basi per la suddivisione di ciascun insieme di dati; i campioni dell'insieme di addestramento, dell'insieme di messa a punto (se presente) e dell'insieme di test non devono essere sovrapposti e devono essere verificati per evitare duplicati.
L'addestramento dell'algoritmo deve fornire una distribuzione dei dati sulla composizione della malattia negli insiemi di addestramento e negli eventuali insiemi di messa a punto, in base alla popolazione applicabile, alle istituzioni di origine dei dati, alle attrezzature di raccolta, ai tipi di campioni e ad altri fattori. L'addestramento e la messa a punto devono basarsi sul set di addestramento e sul set di messa a punto, con specifiche chiare per gli indicatori di valutazione, i metodi di addestramento, gli obiettivi di addestramento e i metodi di messa a punto. La valutazione delle prestazioni dell'algoritmo deve basarsi sul set di test per valutare il design dell'algoritmo e confermare l'efficienza, la sensibilità e la specificità delle prestazioni dell'algoritmo software. Le prestazioni devono soddisfare i requisiti di progettazione dell'algoritmo.