See https://github.com/microsoft/unilm/issues/328
word_list = []
for id in encoding['input_ids'].squeeze().tolist():
word_list.append(processor.decode([id]))
word_list1 = ' '.join([x for x in word_list if x!='[PAD]' and x!='[CLS]' and x!='[SEP]'])