prithivMLmods commited on
Commit
10d5380
·
verified ·
1 Parent(s): e2cda31

Update nava_src/models/nava/modules/tokenizers.py

Browse files
nava_src/models/nava/modules/tokenizers.py CHANGED
@@ -45,7 +45,17 @@ class HuggingfaceTokenizer:
45
  # init tokenizer
46
  self.tokenizer = AutoTokenizer.from_pretrained(name, **kwargs)
47
  if self.tokenizer.pad_token is None:
48
- self.tokenizer.pad_token = self.tokenizer.eos_token
 
 
 
 
 
 
 
 
 
 
49
  self.vocab_size = self.tokenizer.vocab_size
50
 
51
  def __call__(self, sequence, **kwargs):
 
45
  # init tokenizer
46
  self.tokenizer = AutoTokenizer.from_pretrained(name, **kwargs)
47
  if self.tokenizer.pad_token is None:
48
+ try:
49
+ self.tokenizer.add_special_tokens({'pad_token': '<pad>'})
50
+ except Exception:
51
+ self.tokenizer.pad_token = "<pad>"
52
+ self.tokenizer.pad_token_id = 0
53
+ if self.tokenizer.eos_token is None:
54
+ self.tokenizer.eos_token = "</s>"
55
+ self.tokenizer.eos_token_id = 1
56
+ if self.tokenizer.unk_token is None:
57
+ self.tokenizer.unk_token = "<unk>"
58
+ self.tokenizer.unk_token_id = 2
59
  self.vocab_size = self.tokenizer.vocab_size
60
 
61
  def __call__(self, sequence, **kwargs):