You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

Til-GEC-Gemma4-exp087

Gemma негізіндегі қазақша GEC модельдері · Казахские GEC-модели на основе Gemma · Gemma-based Kazakh GEC models

Қазақша · Русский · English


Қазақша

Til-GEC-Gemma4-exp087 — қазақ сөйлемдеріндегі грамматикалық және орфографиялық қателерді түзетуге fine-tune жасалған Gemma модельдерінің 0.1 МБ негізгі репозиторийі. main тармағында код, дерек манифестері және бағалау нәтижелері бар; жарияланған салмақтар жеке тармақтарда сақталған.

Тармақтар мен нәтижелер

Тармақ Негізгі модель Оқыту жинағы test exact match
ft-e4b-both gemma-4-E4B-it біріктірілген жинақ, 886 467 жұп 57.5
ft-e4b gemma-4-E4B-it Til-GEC, 818 306 жұп 56.0
ft-12b gemma-4-12B-it Til-GEC, 818 306 жұп 44.0
ft-e4b-qaz gemma-4-E4B-it Qazgramma, 66 161 жұп 38.5
ft-26b gemma-4-26B-A4B-it Til-GEC, 818 306 жұп 51.0

ft-26b салмақтары сақталмаған, тек метрикалары қалған. ft-31b бағалау кезінде тоқтағандықтан, оның нәтижесі де, салмағы да жоқ. Органикалық әлеуметтік мәтіндегі exact match ft-e4b-both үшін 8.2, ал ft-e4b-qaz үшін 13.8 болды; модельді нақты қолдану ортасына жақын дерекпен бөлек тексерген дұрыс.

Нәтижелер бумасында әр бағалау бөлігінің қосымша метрикалары жеке JSON файлдарында берілген.

Оқыту деректері

Оқытуға Til-GEC және Qazgramma жұптары қолданылған. Benchmark-пен дәл не қалыптандырылған түрде сәйкес келген 1 528 жол алынып тасталған. Біріктірілген рецепт 886 467 оқыту жұбын, Til-GEC рецепті 818 306 жұбын, Qazgramma рецепті 66 161 жұбын қамтиды.

Қалай іске қосады

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-GEC-Gemma4-exp087"
revision = "ft-e4b-both"
tok = AutoTokenizer.from_pretrained(repo, revision=revision)
model = AutoModelForCausalLM.from_pretrained(
    repo, revision=revision, dtype=torch.bfloat16, device_map="auto"
)

prompt = "Сен қазақ тілінің корректорысың. Сөйлемдегі грамматикалық және орфографиялық қатені түзет. Тек түзетілген сөйлемді жаз."
messages = [{"role": "user", "content": f"{prompt}\nСөйлем: Бала үйда отыр."}]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(text, return_tensors="pt", add_special_tokens=False).to(model.device)
output = model.generate(**inputs, max_new_tokens=110, do_sample=False)
print(tok.decode(output[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))

Бұл sentence-level GEC моделі; чатқа арналмаған. Жүктегенде салмағы бар тармақты revision арқылы көрсету қажет.

Қолжетімділік

Карточка мен файлдар тізімі ашық. Салмақтар мен басқа файлдарды алу үшін «Request access» формасы толтырылады, өтінімді TilQazyna командасы қарайды.

Байланысты репозиторийлер

Оқыту корпусы — Til-GEC. Салыстырылған қазақтілді GEC моделі — Til-kk-0.5B-256k-gec-exp085; оның test exact match нәтижесі осы репозиторийдегі салыстыруда 55.0 болды.


Русский

Til-GEC-Gemma4-exp087 — основной репозиторий объёмом 0.1 МБ для моделей Gemma, дообученных исправлять грамматические и орфографические ошибки в казахских предложениях. Ветка main хранит код, манифесты данных и результаты оценки; опубликованные веса лежат в отдельных ветках.

Ветки и результаты

Ветка Базовая модель Обучающая выборка test exact match
ft-e4b-both gemma-4-E4B-it объединённая выборка, 886 467 пар 57.5
ft-e4b gemma-4-E4B-it Til-GEC, 818 306 пар 56.0
ft-12b gemma-4-12B-it Til-GEC, 818 306 пар 44.0
ft-e4b-qaz gemma-4-E4B-it Qazgramma, 66 161 пара 38.5
ft-26b gemma-4-26B-A4B-it Til-GEC, 818 306 пар 51.0

Для ft-26b сохранились метрики, но веса были удалены. Оценка ft-31b завершилась с ошибкой, поэтому у этой ветки нет результата и весов. На органических текстах из социальных сетей exact match составил 8.2 для ft-e4b-both и 13.8 для ft-e4b-qaz; перед внедрением нужна проверка на целевом потоке.

Обучающие данные

Модели обучали на Til-GEC и парах Qazgramma. Из обучения удалили 1 528 строк, совпавших с benchmark точно или после нормализации. Объединённый рецепт содержит 886 467 обучающих пар, рецепт Til-GEC — 818 306, рецепт Qazgramma — 66 161.

Как запустить

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-GEC-Gemma4-exp087"
revision = "ft-e4b-both"
tok = AutoTokenizer.from_pretrained(repo, revision=revision)
model = AutoModelForCausalLM.from_pretrained(
    repo, revision=revision, dtype=torch.bfloat16, device_map="auto"
)

prompt = "Сен қазақ тілінің корректорысың. Сөйлемдегі грамматикалық және орфографиялық қатені түзет. Тек түзетілген сөйлемді жаз."
messages = [{"role": "user", "content": f"{prompt}\nСөйлем: Бала үйда отыр."}]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(text, return_tensors="pt", add_special_tokens=False).to(model.device)
output = model.generate(**inputs, max_new_tokens=110, do_sample=False)
print(tok.decode(output[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))

Это sentence-level GEC, а не чат-модель. При загрузке нужно указать ветку с весами через revision.

Доступ

Карточка и перечень файлов видны без авторизации. Для скачивания весов и остальных материалов требуется заявка «Request access», которую рассматривает команда TilQazyna.

Связанные репозитории

Обучающий корпус — Til-GEC. В сравнении также участвовала казахская GEC-модель Til-kk-0.5B-256k-gec-exp085, получившая 55.0 test exact match.


English

Til-GEC-Gemma4-exp087 is the 0.1 MB main repository for Gemma models fine-tuned to correct grammar and spelling in Kazakh sentences. The main branch contains code, data manifests, and evaluation results, while published weights are stored on separate branches.

Branches and results

Branch Base model Training set test exact match
ft-e4b-both gemma-4-E4B-it combined set, 886,467 pairs 57.5
ft-e4b gemma-4-E4B-it Til-GEC, 818,306 pairs 56.0
ft-12b gemma-4-12B-it Til-GEC, 818,306 pairs 44.0
ft-e4b-qaz gemma-4-E4B-it Qazgramma, 66,161 pairs 38.5
ft-26b gemma-4-26B-A4B-it Til-GEC, 818,306 pairs 51.0

Metrics remain for ft-26b, but its weights were deleted. Evaluation of ft-31b crashed, leaving neither a result nor weights. Exact match on organic social-media text was 8.2 for ft-e4b-both and 13.8 for ft-e4b-qaz, so deployment should be preceded by evaluation on the intended input distribution.

Training data

Training used Til-GEC and Qazgramma pairs. A decontamination pass removed 1,528 rows matching the benchmark either exactly or after normalization. The combined recipe has 886,467 training pairs, the Til-GEC recipe has 818,306, and the Qazgramma recipe has 66,161.

How to run

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

repo = "TilQazyna/Til-GEC-Gemma4-exp087"
revision = "ft-e4b-both"
tok = AutoTokenizer.from_pretrained(repo, revision=revision)
model = AutoModelForCausalLM.from_pretrained(
    repo, revision=revision, dtype=torch.bfloat16, device_map="auto"
)

prompt = "Сен қазақ тілінің корректорысың. Сөйлемдегі грамматикалық және орфографиялық қатені түзет. Тек түзетілген сөйлемді жаз."
messages = [{"role": "user", "content": f"{prompt}\nСөйлем: Бала үйда отыр."}]
text = tok.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tok(text, return_tensors="pt", add_special_tokens=False).to(model.device)
output = model.generate(**inputs, max_new_tokens=110, do_sample=False)
print(tok.decode(output[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))

This is a sentence-level GEC model rather than a chat assistant. Loading requires a weight-bearing branch passed through revision.

Access

The card and file list are publicly visible. Model weights and repository files become downloadable after the TilQazyna team approves the “Request access” submission.

Related repositories

The training corpus is Til-GEC. The evaluation also includes the Kazakh GEC specialist Til-kk-0.5B-256k-gec-exp085, which scored 55.0 test exact match in this repository’s comparison.


Лицензия · License: gemma · TilQazyna

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for TilQazyna/Til-GEC-Gemma4-exp087

Finetuned
(185)
this model

Collection including TilQazyna/Til-GEC-Gemma4-exp087