Huggingface tasarruf belirteçleri

Oct 27 2020

Daha sonra internete erişmem gerekmeyen bir konteynerden yükleyebilmek için tokenleştiriciyi sarılma yüzünde saklamaya çalışıyorum.

BASE_MODEL = "distilbert-base-multilingual-cased"
tokenizer = AutoTokenizer.from_pretrained(BASE_MODEL)
tokenizer.save_vocabulary("./models/tokenizer/")
tokenizer2 = AutoTokenizer.from_pretrained("./models/tokenizer/")

Ancak son satır şu hatayı veriyor:

OSError: Can't load config for './models/tokenizer3/'. Make sure that:

- './models/tokenizer3/' is a correct model identifier listed on 'https://huggingface.co/models'

- or './models/tokenizer3/' is the correct path to a directory containing a config.json file

transformatör versiyonu: 3.1.0

Pytorch'ta önceden eğitilmiş modelden kaydedilen jetonlaştırıcının nasıl yükleneceği maalesef yardımcı olmadı.

Düzenle 1

@ Ashwin'in aşağıdaki cevabı sayesinde save_pretrainedbunun yerine denedim ve şu hatayı alıyorum:

OSError: Can't load config for './models/tokenizer/'. Make sure that:

- './models/tokenizer/' is a correct model identifier listed on 'https://huggingface.co/models'

- or './models/tokenizer/' is the correct path to a directory containing a config.json file

belirteç klasörünün içeriği aşağıdadır:

Ben yeniden adlandırma çalıştı tokenizer_config.jsonetmek config.jsonve sonra ben hata var:

ValueError: Unrecognized model in ./models/tokenizer/. Should have a `model_type` key in its config.json, or contain one of the following strings in its name: retribert, t5, mobilebert, distilbert, albert, camembert, xlm-roberta, pegasus, marian, mbart, bart, reformer, longformer, roberta, flaubert, bert, openai-gpt, gpt2, transfo-xl, xlnet, xlm, ctrl, electra, encoder-decoder

Yanıtlar

2 AshwinGeetD'Sa Oct 27 2020 at 17:41

save_vocabulary(), yalnızca belirteç oluşturucunun kelime dosyasını kaydeder (BPE belirteçlerinin listesi).

Tüm jetonlaştırıcıyı kaydetmek için kullanmalısınız save_pretrained()

Bu nedenle, aşağıdaki gibi:

BASE_MODEL = "distilbert-base-multilingual-cased"
tokenizer = AutoTokenizer.from_pretrained(BASE_MODEL)
tokenizer.save_pretrained("./models/tokenizer/")
tokenizer2 = DistilBertTokenizer.from_pretrained("./models/tokenizer/")

Düzenle:

bilinmeyen bir nedenle: yerine

tokenizer2 = AutoTokenizer.from_pretrained("./models/tokenizer/")

kullanma

tokenizer2 = DistilBertTokenizer.from_pretrained("./models/tokenizer/")

İşler.