Spaces:
Running on Zero
Running on Zero
Update nava_src/models/nava/modules/tokenizers.py
Browse files
nava_src/models/nava/modules/tokenizers.py
CHANGED
|
@@ -45,7 +45,17 @@ class HuggingfaceTokenizer:
|
|
| 45 |
# init tokenizer
|
| 46 |
self.tokenizer = AutoTokenizer.from_pretrained(name, **kwargs)
|
| 47 |
if self.tokenizer.pad_token is None:
|
| 48 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 49 |
self.vocab_size = self.tokenizer.vocab_size
|
| 50 |
|
| 51 |
def __call__(self, sequence, **kwargs):
|
|
|
|
| 45 |
# init tokenizer
|
| 46 |
self.tokenizer = AutoTokenizer.from_pretrained(name, **kwargs)
|
| 47 |
if self.tokenizer.pad_token is None:
|
| 48 |
+
try:
|
| 49 |
+
self.tokenizer.add_special_tokens({'pad_token': '<pad>'})
|
| 50 |
+
except Exception:
|
| 51 |
+
self.tokenizer.pad_token = "<pad>"
|
| 52 |
+
self.tokenizer.pad_token_id = 0
|
| 53 |
+
if self.tokenizer.eos_token is None:
|
| 54 |
+
self.tokenizer.eos_token = "</s>"
|
| 55 |
+
self.tokenizer.eos_token_id = 1
|
| 56 |
+
if self.tokenizer.unk_token is None:
|
| 57 |
+
self.tokenizer.unk_token = "<unk>"
|
| 58 |
+
self.tokenizer.unk_token_id = 2
|
| 59 |
self.vocab_size = self.tokenizer.vocab_size
|
| 60 |
|
| 61 |
def __call__(self, sequence, **kwargs):
|