mT5: A massively multilingual pre-trained text-to-text transformer
Paper • 2010.11934 • Published • 5
Transformer-based seq2seq normalizer for Middle High German (MHG) text, fine-tuned from google/mt5-base.
Normalizes Middle High German texts (ca. 1050–1500) according to the standards of the Referenzkorpus Mittelhochdeutsch (ReM):
Fine-tuned on the Referenzkorpus Mittelhochdeutsch (ReM), Version 2.1.
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("JonasHermann/normaere-model")
model = AutoModelForSeq2SeqLM.from_pretrained("JonasHermann/normaere-model")
input_text = "die stete wârheit"
inputs = tokenizer(input_text, return_tensors="pt")
outputs = model.generate(**inputs)
result = tokenizer.decode(outputs[0], skip_special_tokens=True)
Base model
google/mt5-base