Il report OpenAI collega gli agenti di codifica a build di software scientifico più veloci

 | Intelligenza-Artificiale

OpenAI ha pubblicato un nuovo rapporto sul campo che traccia otto progetti di calcolo scientifico in cui gli agenti di codifica hanno ridotto i tempi di esecuzione.

Il rapporto documenta i progetti utilizzati Codice da solo in cinque casi e una combinazione di Codex e Claude Code di Anthropic in altri tre. Vale la pena segnalarlo in anticipo: si tratta di un fornitore che pubblica un sondaggio sull’applicazione del proprio prodotto in contesti di ricerca, costruito a partire da casi di studio scritti dai contributori coinvolti.

Ciò non rende il modello sottostante meno degno di essere esaminato. Il software di ricerca presenta un problema di manutenzione documentato. Gli strumenti costruiti per accompagnare un singolo articolo, codificati da piccoli team accademici senza supporto tecnico dedicato, tendono ad accumulare debito tecnico che nessuno ha il budget o il mandato per ripagare.

Il rapporto di OpenAI sostiene che gli agenti possono affrontare tale debito e gli otto progetti citati abbracciano la genomica, l’immunologia, la statistica e il sequenziamento dell’RNA.

Quali compiti hanno svolto gli agenti

Le attività si dividono grosso modo in tre categorie: creazione di pacchetti e pulizia del sistema di compilazione, ottimizzazione delle prestazioni sul codice esistente e porting completo del linguaggio o del backend.

cyvcf2una libreria Python per la lettura di file di varianti genomiche, ha visto il suo vecchio sistema di build e packaging sostituito con un processo più nuovo e unificato, secondo il collaboratore Brent Pedersen, che ha osservato che andare veloci con gli agenti è una cosa, ma andare lontano nella scienza ha ancora bisogno di “guida, comprensione, gusto e cura da parte di esperti”.

HI.SIM, un simulatore di lettura del sequenziamento del DNA, ha visto due passaggi di ottimizzazione in gran parte autonomi da GPT-5.2 e GPT-5.6 che, secondo il collaboratore Andrew Ho, hanno ridotto il tempo di esecuzione del 31% in un set di test rappresentativo senza alterare l’output.

Ho, che non si descrive né come uno specialista di genomica né come un programmatore C, ha definito il risultato “a dir poco magico” dal punto di vista dell’utente finale, avendo precedentemente perso tempo a causa di bug di prestazioni e problemi di packaging che poteva riconoscere ma non risolvere personalmente.

Hifiismoutilizzato per l’assemblaggio del genoma dalle letture PacBio HiFi, ha ottenuto una riduzione del tempo di esecuzione del 25% sul suo obiettivo di ottimizzazione e di circa il 15% su dati di sequenziamento umano separati, secondo il collaboratore Suyash Shringarpure.

Shringarpure ha descritto l’agente che ha creato la propria impalcatura di riferimento e ha proposto candidati in modo indipendente, anche se ha sottolineato che fornire risultati di profilazione e allontanare il modello da ripetute modalità di fallimento rimane un lavoro che solo un essere umano può fare.

MHCflurryche prevede i frammenti proteici presentati alle cellule T, ha fatto migrare il suo backend TensorFlow/Keras su PyTorch mantenendo la compatibilità con i pesi dei modelli rilasciati in precedenza, un cambiamento che Alex Rubinsteyn, Sergey Feldman e Timothy O’Donnell definiscono come il tipo di “manutenzione poco affascinante e ad alta intensità di lavoro” che mantiene in vita i progetti scientifici open source anziché lasciarli decadere.

bayesm-rs, un port su Rust di modelli statistici di R’s bayesm pacchetto, corrispondeva alle stime del software originale entro una tolleranza preimpostata e funzionava 2,3–2,7 volte più velocemente su un singolo thread del processore, salendo a 4,4–9,5 volte più veloce su otto thread. Secondo i contributori Andrew Bai e Andrew Ho, gli agenti hanno gestito qualsiasi cosa con un riferimento diretto per verificare in modo rapido e corretto; le estensioni che richiedevano un giudizio statistico che il codice originale non aveva mai definito necessitavano invece di una convalida umana diretta.

Le porte antiruggine e una riprogettazione della GPU spingono ulteriormente il modello

Sono coinvolti altri tre progetti: rustar-aligner, svb e kuva Ruggine build eseguite con agenti di codifica, inclusa una ricreazione completa di STAR, uno strumento di allineamento della sequenza di RNA ampiamente utilizzato che aveva perso la manutenzione attiva.

Il collaboratore James M. Ferguson afferma che gli agenti cambiano ciò che vale la pena tentare: riscrivere manualmente un allineatore di 20.000 linee non è un uso sensato del tempo, ma con un agente diventano settimane di lavoro guidato. La verifica, ha aggiunto, è una questione completamente separata. Un modello può affermare che una trama sembra a posto, ma controllarne più di 900 a occhio prima del rilascio spetta comunque a una persona.

RustQC ha consolidato 15 strumenti separati di controllo qualità per il sequenziamento dell’RNA in un unico programma che secondo il collaboratore Phil Ewels ha ridotto il tempo di esecuzione di 60 volte e l’input/output del disco di 25 volte, con il compagno che ricostruisce FastQC-Rust e Trim Galore funzionando rispettivamente sette e tre volte più velocemente preservando il comportamento degli strumenti originali.

Ewels ha anche segnalato il lato negativo: le ricostruzioni a basso costo comportano dei rischi, perché gli strumenti che divergono nel comportamento frammentano la comunità e rendono i risultati di laboratori diversi incomparabili nel tempo. “La tecnologia è la parte facile”, ha detto. “La gestione è una questione aperta”.

HelixForgeuna ricostruzione nativa della GPU dello strumento di simulazione di mutazione BAMSurgeon, secondo quanto riferito ha ridotto il tempo di esecuzione di circa 60 volte su un benchmark che coinvolge dati umani reali, secondo i contributori Mamad Ahangari, Varun Goyal e Hassan Masoudi, che affermano anche che ha prodotto frequenze di mutazione più vicine agli obiettivi richiesti e risolto diversi bug che generavano artefatti nello strumento originale.

Il vincolo ora è la verifica, non la generazione del codice

Ciò che emerge da tutti gli articoli è che gli agenti hanno gestito abilmente richieste di implementazione ben mirate, ma non sono stati in grado di giudicare se il proprio risultato fosse scientificamente valido.

I contributori descrivono agenti che esprimono fiducia nel lavoro che conteneva errori evidenti, che hanno spinto sugli esseri umani l’onere effettivo di costruire test di accettazione: corrispondenza esatta dell’output, controlli di parità rispetto a uno strumento esistente o risposte stabilite in anticipo utilizzando dati simulati.

I progetti tendevano a procedere per fasi, con gli agenti che producevano rapidamente le prime bozze e il tempo rimanente che si occupava di casi limite e piccole discrepanze numeriche che un benchmark da solo non sarebbe stato in grado di rilevare.

I minori costi di progettazione si riducono in entrambe le direzioni. Permettono a un team di due persone di occuparsi della ricostruzione che un tempo avrebbe richiesto l’assunzione di ingegneri finanziati da sovvenzioni, e rendono più semplice per tre laboratori diversi produrre tre versioni incompatibili dello stesso strumento. Le modifiche a MHCflurry e cyvcf2 sono tornate ai loro progetti upstream originali. rustar-aligner è passato alla nuova gestione della comunità perché lo strumento che ha sostituito era già stato abbandonato.

Il rapporto OpenAI punta verso una scelta specifica piuttosto che un’approvazione generale: decidere chi possiede uno strumento ricostruito e garantire tale impegno prima che venga spedita la prima riga di codice generato dall’agente.

Vedi anche: Guardoc Health elabora la documentazione clinica utilizzando i modelli Amazon Nova

Banner per la serie di eventi AI & Big Data Expo.

Vuoi saperne di più sull’intelligenza artificiale e sui big data dai leader del settore? Guardare Fiera dell’intelligenza artificiale e dei big data che si svolge ad Amsterdam, in California, e a Londra. L’evento completo è parte di TechEx ed è situato in concomitanza con altri importanti eventi tecnologici tra cui Fiera sulla sicurezza informatica e sul cloud. Clic Qui per ulteriori informazioni

AI News è alimentato da Media TechForge. Esplora altri prossimi eventi e webinar sulla tecnologia aziendale Qui.

Fonte: www.artificialintelligence-news.com

Lascia un commento

Il tuo indirizzo email non sarà pubblicato. I campi obbligatori sono contrassegnati *