Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Importante
Il supporto per l'integrazione di Git nei notebook legacy è stato rimosso il 31 gennaio 2024. Databricks consiglia di usare le cartelle Git di Databricks per sincronizzare il lavoro in Databricks con un repository Git remoto.
Questo articolo descrive come configurare il controllo della versione Git per i notebook (funzionalità legacy). È anche possibile usare l'interfaccia della riga di comando di Databricks o l'API dell'area di lavoro per importare ed esportare notebook e per eseguire operazioni Git nell'ambiente di sviluppo locale.
Abilitare e disabilitare il controllo delle versioni di Git
Il controllo della versione è abilitato per impostazione predefinita. Per attivare o disattivare questa impostazione:
- Vai a Impostazioni>Impostazioni dell'area di lavoro.
- Nella sezione Avanzate, disattiva l'interruttore Controllo delle versioni Git del notebook.
Configurare il controllo della versione
Per configurare il controllo della versione, creare le credenziali di accesso nel provider Git, quindi aggiungere tali credenziali ad Azure Databricks.
Usare le versioni dei notebook
Puoi lavorare con le versioni dei notebook nel pannello della cronologia. Aprire il pannello della cronologia facendo clic
sulla barra laterale destra.
Nota
Non è possibile modificare un notebook mentre il pannello della cronologia è aperto.
Collegare un notebook a GitHub
Fare clic
sulla barra laterale destra. La barra di stato git visualizza Git: Non collegato.
Fare clic su Git: Non collegato.
Verrà visualizzata la finestra di dialogo Preferenze Git. La prima volta che apri il notebook, lo stato è Non collegato, perché il notebook non è in GitHub.
Nel campo Stato fare clic su Collegamento.
Nel campo Collegamento incollare l'URL del repository GitHub.
Fare clic sul menu a discesa Ramo e selezionare un ramo oppure digitare il nome di un nuovo ramo.
Nel campo Percorso nella cartella Git specificare dove archiviare il file nel repository.
I notebook di Python hanno come estensione file predefinita suggerita
.py. Se utilizzi.ipynb, il tuo notebook verrà salvato nel formato di notebook iPython. Se il file esiste già in GitHub, è possibile copiare e incollare direttamente l'URL del file.Fare clic su Salva per completare il collegamento del notebook. Se questo file non esisteva in precedenza, verrà visualizzata una richiesta con l'opzione Salva questo file nel repository GitHub.
Digitare un messaggio e fare clic su Salva.
Salvare un notebook in GitHub
Anche se le modifiche apportate al notebook vengono salvate automaticamente nella cronologia delle versioni di Azure Databricks, le modifiche non vengono mantenute automaticamente in GitHub.
Fare clic
sulla barra laterale destra per aprire il pannello della cronologia.
Fare clic su Salva ora per salvare il notebook in GitHub. Verrà visualizzata la finestra di dialogo Salva versione notebook.
Facoltativamente, immettere un messaggio per descrivere la modifica.
Assicurarsi che Esegui anche il commit in Git sia selezionato.
Fare clic su Salva.
Ripristinare o aggiornare un notebook a una versione di GitHub
Dopo aver collegato un notebook, Azure Databricks sincronizza la cronologia con Git ogni volta che si riapri il pannello della cronologia. Le versioni che si sincronizzano con Git includono hash di commit nell'elemento.
Fare clic
sulla barra laterale destra per aprire il pannello della cronologia.
Scegli una voce nel pannello della cronologia. Azure Databricks visualizza tale versione.
Fare clic su Ripristina questa versione.
Fare clic su Conferma per confermare che si vuole ripristinare tale versione.
Scollegare un notebook
Fare clic
sulla barra laterale destra per aprire il pannello della cronologia.La barra di stato git visualizza Git: Sincronizzata.
Fare clic su Git: Sincronizzato.
Nella finestra di dialogo Preferenze Git fare clic su Scollega.
Fare clic su Salva.
Fare clic su Conferma per confermare che si vuole scollegare il notebook dal controllo della versione.
Utilizzare i rami
È possibile usare qualsiasi ramo del repository e creare nuovi rami all'interno di Azure Databricks.
Creare un ramo
Fare clic
sulla barra laterale destra per aprire il pannello della cronologia.Fare clic sulla barra di stato git per aprire il pannello GitHub.
Fare clic sul menu a discesa Branch.
Immettere un nome di ramo.
Selezionare l'opzione Crea ramo nella parte inferiore dell'elenco a discesa. Il ramo padre è indicato. Si crea sempre un ramo a partire dal ramo attualmente selezionato.
Crea una richiesta di pull
Fare clic
sulla barra laterale destra per aprire il pannello della cronologia.Fare clic sulla barra di stato git per aprire il pannello GitHub.
Fare clic su Crea PR. GitHub apre una pagina di richiesta pull per il ramo.
Esegui il rebase di un branch
È anche possibile eseguire il rebase del ramo in Azure Databricks. Il collegamento Rebase visualizza se i nuovi commit sono disponibili nel ramo padre. È supportato solo il rebase basato sul ramo predefinito del repository principale.
Si supponga, ad esempio, di lavorare su databricks/reference-apps. È possibile crearne il fork nel proprio account ( ad esempio , brkyvz) e iniziare a lavorare su un ramo denominato my-branch. Se viene inviato un nuovo aggiornamento a databricks:master, viene mostrato il pulsante Rebase e sarà possibile eseguire il pull delle modifiche nel proprio ramo brkyvz:my-branch.
Il rebase avviene in modo leggermente diverso in Azure Databricks. Si supponga la struttura di ramo seguente:
Dopo un rebase, la struttura del ramo si presenta così:
Ciò che è diverso in questo caso è che i commit C5 e C6 non si applicano sopra C4. Vengono visualizzate come modifiche locali nel notebook. I conflitti di merge vengono visualizzati come segue:
È quindi possibile eseguire nuovamente il commit in GitHub usando il pulsante Salva ora .
Cosa succede se qualcuno si è diramato dal ramo che ho appena ribasato?
Se il tuo ramo (ad esempio, branch-a) era la base di un altro ramo (branch-b) e esegui un rebase, non devi preoccuparti! Una volta che un utente fa anche il rebase di branch-b, tutto funzionerà. La procedura consigliata in questa situazione consiste nell'usare rami distinti per notebook diversi.
Procedure consigliate per le revisioni del codice
Azure Databricks supporta la diramazione Git.
- È possibile collegare un notebook a qualsiasi ramo in un repository. Azure Databricks consiglia di usare un ramo separato per ogni notebook.
- Durante lo sviluppo, è possibile collegare un notebook a un fork di un repository o a un ramo non predefinito nel repository principale. Per integrare le modifiche nel ramo upstream, puoi usare il collegamento Crea richiesta pull nella finestra di dialogo Preferenze Git in Azure Databricks per creare una pull request su GitHub. Il collegamento Crea pull request viene visualizzato solo se non stai lavorando sul ramo predefinito del repository padre.
Risoluzione dei problemi
Se si ricevono errori relativi alla sincronizzazione della cronologia di GitHub, verificare quanto segue:
- È possibile collegare un notebook solo a un repository Git inizializzato che non è vuoto. Testare l'URL in un Web browser.
- Il token di accesso personale di GitHub deve essere attivo.
- Per usare un repository GitHub privato, è necessario disporre dell'autorizzazione per leggere il repository.
- Se un notebook è collegato a un ramo GitHub rinominato, la modifica non viene riflessa automaticamente in Azure Databricks. È necessario collegare di nuovo il notebook al ramo manualmente.
Eseguire la migrazione alle cartelle Git di Databricks
Gli utenti che devono eseguire la migrazione alle cartelle Git di Databricks dal controllo della versione Git legacy possono usare la guida seguente: