Text Classification
Transformers
Safetensors
Japanese
modernbert
feature-extraction
line-classification
japanese
corpus-cleaning
custom_code
text-embeddings-inference
Instructions to use KeisukeMiyamoto/corpus-refiner-jp with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use KeisukeMiyamoto/corpus-refiner-jp with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="KeisukeMiyamoto/corpus-refiner-jp", trust_remote_code=True)# Load model directly from transformers import AutoTokenizer, AutoModel tokenizer = AutoTokenizer.from_pretrained("KeisukeMiyamoto/corpus-refiner-jp", trust_remote_code=True) model = AutoModel.from_pretrained("KeisukeMiyamoto/corpus-refiner-jp", trust_remote_code=True, device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "add_dummy_prefix_space": false, | |
| "add_prefix_space": false, | |
| "backend": "tokenizers", | |
| "bos_token": "<s>", | |
| "clean_up_tokenization_spaces": false, | |
| "cls_token": "<cls>", | |
| "do_lower_case": false, | |
| "eos_token": "</s>", | |
| "extra_ids": 0, | |
| "extra_special_tokens": [ | |
| "<line>" | |
| ], | |
| "is_local": true, | |
| "keep_accents": true, | |
| "legacy": false, | |
| "local_files_only": false, | |
| "mask_token": "<mask>", | |
| "model_max_length": 1000000000000000019884624838656, | |
| "pad_token": "<pad>", | |
| "padding_side": "right", | |
| "sep_token": "<sep>", | |
| "sp_model_kwargs": {}, | |
| "spaces_between_special_tokens": false, | |
| "tokenizer_class": "TokenizersBackend", | |
| "unk_token": "<unk>", | |
| "use_default_system_prompt": false | |
| } | |