Дмитрий Гайнуллин: «Я понимаю, что бюджеты сокращаются и так далее, но качество перевода ИИ на татарский язык пока плохое» Дмитрий Гайнуллин: «Я понимаю, что бюджеты сокращаются и так далее, но качество перевода ИИ на татарский язык пока плохое» Фото предоставлено Дмитрием Гайнуллиным

«Если доверить татарский язык только ИИ, редакцию можно закрывать»

— Дмитрий, есть ли какая-нибудь продукция на татарском языке, сделанная с помощью ИИ, которая бы вас впечатлила?

— Нет, не встречалось. Мне кажется, пока для татарского языка нейросети в целом работают не очень хорошо, поэтому не уверен, что с их помощью можно сделать что-то прямо хорошее.

Дмитрий Гайнуллин родился в ХМАО. Учился в МФТИ, затем в парижской политехнической школе — École Polytechnique. Работает ML-инженером в зарубежной компании, которая ускоряет работу языковых моделей. Участник IT-проекта Yasalma, разрабатывающего ИИ на татарском языке.

Но мы же можем сравнить, как это происходит с другими языками: сначала с английским, потом с русским и так далее. То есть до нас все доходит с каким-то опозданием. Тенденция налицо: допустим, в русскоязычных чартах есть много сгенерированных песен. То есть люди их слушают, и они становятся популярными. В какой-то момент, возможно, и у вас появится что-то такое. Возможно, к этому времени в русскоязычном сегменте это уже будет неактуально. Люди захотят читать, слушать и смотреть несгенерированный контент. Им надоест ИИ, они захотят живого.

— При этом сегодня именно в татароязычных СМИ искусственный интеллект внедряется особенно активно. Многие редакции уже используют нейросети для перевода текстов, расшифровки интервью и создания баннеров. Одновременно постепенно исчезают профессии переводчика и корректора. Как вы относитесь к этой тенденции?

— Если речь идет о татарском языке, то увольнять корректоров и переводчиков вообще безграмотное решение. Я понимаю, что бюджеты сокращаются и так далее, но качество перевода ИИ на татарский язык пока плохое. При этом читатели хотят читать на литературном, красивом татарском языке. Если вы будете выдавать им текст по уровню, соответствующему творению пятиклассника, а не профессионального переводчика, кому это нужно? Что это за продукт? Может быть, тогда просто сократить всю редакцию и ничего не выпускать, если вы настолько наплевательски относитесь к качеству своей продукции.

— На журналистстких форумах, встречах часто звучит тревога: «Скоро всех уволят и писать будет только ИИ…»

— Один мой коллега говорит, что татароязычный ИИ по большому счету пока просто хайп. Когда-то появились станки, до этого все делали вручную и люди думали, что всех уволят. Я практически уверен, что через пару лет, когда ИИ будет гораздо сильнее внедрен в реальный бизнес, в реальные компании, мы поймем, что в итоге уволили не всех, а возможно, даже и никого. Мне кажется, эта тема сильно муссируется. Возможно, даже для того, чтобы сотрудники боялись, работали чуть шустрее.

— А когда мы избавимся от акцента татарского ИИ и получим нового Тукая?

— Для русского языка мы нового Пушкина не получили. Зато получили хороший поисковик, хороший инструмент для пересказа текстов из интернета, хороший справочник. Многие сейчас консультируются с ИИ так же, как раньше искали ответы в интернете: что-то вбивали в поисковике о здоровье, каких-то психологических или просто жизненных ситуациях. Нейросеть может более-менее сносно ответить на такой вопрос. Если нейросеть дала ответ, а не сама придумала, значит, она нашла это в интернете.

Но если вы никак не могли найти статью на какую-то тему, то, скорее всего, нейросеть об этом тоже не знает. Например, о какой-нибудь редкой криптовалюте, информация о которой есть только на английском или китайском языке и больше нигде. В этом случае, скорее всего, нейросеть придумает вам ответ. Это называется галлюцинацией. Области, в которых возникают такие галлюцинации, как раз показывают, что материала по этой теме нет.

Мне кажется, что с нынешними нейросетями создать нового Тукая практически нереальная задача. Какой-то подражатель, возможно, и появится…

«Неоцифрованных книг все еще очень много. Пока все это не будет оцифровано, мы даже не знаем, каков потенциал нейросетей и насколько еще может вырасти качество» «Неоцифрованных книг все еще очень много. Пока все это не будет оцифровано, мы даже не знаем, каков потенциал нейросетей и насколько еще может вырасти качество» Фото: «БИЗНЕС Online»

«На татарском языке мало данных»

— Хорошо, не Тукая. Но нейросеть, которая отлично знает литературный татарский, когда мы получим?

— В первую очередь нужны данные. У крупных компаний есть большие ресурсы. Для обучения большой языковой модели — такой, как ChatGPT, модели Anthropic или тот же GigaChat от Сбера, — необходимы серьезные вычислительные мощности.

В первую очередь это вычислительные кластеры — огромные компьютеры с тысячами видеокарт. Видеокарта — это устройство в компьютере, которое обычно нужно для игр. Но ее приспособили для различных вычислений и стали использовать для обучения нейросетей.

Второе — данные. На татарском языке их мало. Хотя я бы не сказал, что совсем мало: их гораздо больше по сравнению со многими другими языками России и мира. Но все равно не хватает хорошо оцифрованных данных. В первую очередь это книги, газеты, в том числе старые. Что-то делает Национальная библиотека РТ, что-то делаем мы. Но неоцифрованных книг все еще очень много. Пока все это не будет оцифровано, мы даже не знаем, каков потенциал нейросетей и насколько еще может вырасти качество.

— Можете привести какие-то цифры в сравнении с русским, английским языками, чтобы мы поняли расклад?

— Сложно сказать. Русскоязычных данных тоже не прямо чтобы много. Да и сами проценты не очень многое скажут. Например, в корпусе LLaMA*, которая была популярна года два назад, русского языка было, по-моему, меньше процента. При этом эту нейросеть уже можно было дообучить на русском, и она довольно неплохо на нем разговаривала. Поэтому соотношение языков в процентах не самый принципиальный момент. Общий объем важен, но, наверное, только до определенного предела.

Важна и тематика текстов. На русском языке, например, много медицинских материалов или текстов о том, как научиться программировать. На татарском таких раз-два и обчелся. Пока их нет, приходится изощряться: например, автоматически переводить с помощью тех же нейросетей или искать другие способы заполнить эти пробелы.

Если представим это плиткой, то дворик английского будет идеальный, русского — местами побитый. А для татарского от нее останется лишь отрывочный ряд.

Если говорить об объемах, то у нас, я недавно считал, 4 миллиарда токенов. Они это, грубо говоря, слова или сочетания букв, которые нейросеть изучает в процессе обучения. Для казахского языка, насколько я недавно слышал, заявляли о 10 миллиардах токенов, переданных компании OpenAI. Для русского, думаю, может быть около триллиона токенов. Это примерно в 250 раз больше, чем для татарского. Для английского, возможно, около 10 триллионов.

Это приблизительные цифры. Данные не всегда абсолютно чистые: там много повторно использованных или переформулированных текстов. Татарские данные тоже можно искусственно увеличить: обучить нейросеть хорошо переформулировать тексты и таким образом, допустим, удвоить их количество.

Но основная закономерность заключается в том, что по мере увеличения количества токенов прирост качества уменьшается. На первых объемах качество растет огромными темпами. Допустим, на первом миллиарде токенов оно выросло очень сильно. На следующих 9 миллиардах — тоже заметно, но уже меньше. А после 10 миллиардов вы добавите еще 10, но качество изменится уже не так сильно. Грубо говоря, вначале рост огромный, а потом кривая постепенно становится почти плоской.

— Потому что в текстах начинаются повторы?

— Не только. Просто это особенность ИИ. При этом, если почти весь татарский корпус состоит из отчетов информагентства об официальных мероприятиях, посещениях чиновником какого-то очередного торжества, не стоит ожидать, что нейросеть будет хорошо объяснять бабушкам, как сажать картошку или что делать при проблемах с почками.

Нейросеть лишь переформулирует и сжимает имеющуюся информацию. В каком-то смысле нейросеть — это универсальный архиватор.

У вас есть определенный объем знаний, и вы пытаетесь поместить его в еще меньший объем — в нейросеть. Затем учите ее разговаривать, чтобы она могла выдавать что-то разумное на основе знаний, которые, условно говоря, «выучила».

— Но нейросеть же может перевести на татарский с русского или английского текст о том, как сажать картошку?

— Это будет перевод на уровне человека, который изучал татарский в школе и был хорошим учеником, но для которого татарский все равно не родной язык. Я не могу идеально оценить качество татарского нейросетей, но понимаю, что тексты не всегда грамотные. Они сильно калькированы с русского. Носители языка так не говорят. Думаю, это замечают все.

«Уже сейчас можно создать какую-то нейросеть, и у Института прикладной семиотики вроде бы что-то есть. Просто качество пока не очень высокое» «Уже сейчас можно создать какую-то нейросеть, и у Института прикладной семиотики вроде бы что-то есть. Просто качество пока не очень высокое» Фото: «БИЗНЕС Online»

«Для моей бабушки ИИ — это возможность получить помощь на родном языке»

— Как вы оцениваете работу властей республики в этом направлении, чтобы появилась татароязычная нейросеть? Выделяются ли на это средства? Например, многие давно хотели бы получить хороший расшифровщик татарской речи.

— Я согласен, что делается мало. Но мы сейчас думаем над расшифровщиком аудио и, наверное, ближе к осени что-то объявим. Но, как я уже сказал, все упирается в данные. Проблема не в вычислениях и не в каких-то умных алгоритмах талантливых программистов. Умные люди уже все сделали за вас: алгоритмы разработаны и опубликованы. Их нужно просто обучить на новых данных.

Уже сейчас можно создать какую-то нейросеть, и у Института прикладной семиотики вроде бы что-то есть. Просто качество пока не очень высокое по одной причине: не хватает данных. Требуется очень много записей голосов разных людей: мужчин и женщин, людей разного возраста, с разными особенностями речи, акцентами и диалектами. Таких данных нужно как можно больше, но в идеале — хотя бы тысяча часов. Возможно, для татарского языка уже найдется около 300 часов готовых размеченных данных. В том числе данные, которые собирал Институт прикладной семиотики. Но я не ощущаю какого-то сильного запроса со стороны руководства республики.

На постсоветском пространстве есть примеры, когда люди объединялись для такой работы. Допустим, у белорусов 10 тысяч человек записали около 2 тысяч часов аудио. Есть абхазцы, у которых для своего языкового сообщества собрано больше часов аудио, чем для татарского. Для лугово-марийского и башкирского уже записано по 300 часов. И это не считая, например, эсперанто — искусственного языка, для которого энтузиасты уже собрали около 2 тысяч часов.

С одной стороны, было бы хорошо, если бы в эту работу инвестировали деньги. Но я не уверен, что у Института прикладной семиотики есть ресурсы для поиска 10 тысяч участников в одиночку. Существует платформа Mozilla Common Voice — большая и известная в этой сфере площадка. Наверное, не очень хотят сотрудничать с такими иностранными организациями, с той же Mozilla, или, возможно, есть желание сохранить проект полностью своим — довести его до конца самостоятельно, без внешнего партнерства, чтобы данные и результат принадлежали именно им. Но в реальности для многих языков все строится на сотрудничестве. Люди объединяются, записывают голоса, организуют конкурсы, возможно, при поддержке государства или других организаций. Затем этими данными могут пользоваться все и обучать на них свои модели — Google, «Яндекс» и другие компании.

— Я вам возражу. Вы говорите мало данных, но расшифровщики татарской речи появилась у Gemini, хотя из-за запрета в России им тяжело пользоваться. Как так получилось?

— Я видел генерацию татарского текста в Gemini. Она очень хорошая, но с каким-то сильным акцентом — то ли крымскотатарским, то ли турецким, я не знаю. Обычно при нехватке данных это компенсируют вычислительными ресурсами. Например, просто дольше обучают модель или используют какие-то другие схемы.

Есть еще так называемый перенос знаний. Существует много тюркских языков, для которых данных больше, чем для татарского: казахский, турецкий и другие. Если модель уже неплохо распознает турецкий, то некоторые звуки и слова она сможет распознать и в татарском.

Можно даже взять модель, обученную только на турецком языке. Если татарское слово похоже на турецкое или совпадает с ним, она идеально распознает турецкий вариант, который затем можно как-то перевести на татарский. То есть вы начинаете уже не с нулевого качества.

Качество распознавания татарской речи у Gemini все равно не очень высокое. Татарский язык для них не является приоритетом. Они специально им не занимаются. Поддержка татарского, скорее всего, появилась как побочный эффект.

Common Voice доступен всем. Корпус, который опубликовал Институт прикладной семиотики, тоже находится в открытом доступе. Там около 300 часов записей. Если постараться, а у Google для этого есть и ресурсы, и специалисты, можно взять еще татароязычные видео с YouTube и разметить их не вручную, а с помощью различных технических методов.

Получится не очень качественный корпус, со множеством ошибок, зато данных будет много. Если затем обучить модель на этом корпусе, качество, возможно, немного улучшится. Все эти технические ухищрения доступны любому, у кого есть деньги и вычислительные ресурсы. У OpenAI и Google они есть. По сравнению с тем, что было у TatSoft, результат может стать лучше на несколько десятков процентов, а это уже довольно много. Улучшение будет заметным, но качество все равно не станет идеальным и не достигнет уровня русского языка.

— Но у TatSoft перевод, конечно, намного хуже, чем у OpenAI.

— Да, это правда. Просто в TatSoft используется прошлое поколение технологии. Такая же ситуация была с Google Translate, когда уже появился Gemini. Google Translate использовал не сам Gemini, а более старую технологию, условно похожую на ту, которую применяет TatSoft. Поэтому перевод в Google Translate был плохим.

Для переводчика, подобного TatSoft, нужно много параллельных предложений — одинаковых текстов на двух языках. В случае с Gemini сначала обучают базовую модель на огромном количестве текстов на каждом языке. Затем ее дообучают переводить с одного языка на другой.

Если базовая нейросеть уже хорошо знает какой-то язык, например, умеет грамотно писать на татарском, то и переводит на него неплохо — во всяком случае лучше, чем прежние системы.

— Чиновники Татарстана любят говорить, что республика — один из лидеров в сфере цифровых технологий. Почему тогда у нас до сих пор не появилось ничего, сопоставимого с OpenAI?

— Слушайте, так или иначе Татарстан — это регион России. Все проблемы России отражаются и скорее даже умножаются в Татарстане. Например, действуют санкции на поставку видеокарт в Россию.

Это могут позволить себе только крупные компании. В Татарстане нет компаний уровня Сбера или «Яндекса», которые могли бы себе это позволить.

Специалистов много. Понятно, что многие уезжают из Татарстана в Москву, Европу или Америку и работают в крупных компаниях. Я не считаю это чем-то плохим. Люди должны где-то набираться мирового опыта. Пока таких возможностей нет в Татарстане, приходится работать в Google, извините. Если люди созреют и в республике произойдут какие-то изменения, появится прогресс, они просто вернутся и будут что-то делать уже в Татарстане.

— Сейчас иногда в шутку говорят: «Пусть татарский язык хотя бы в ChatGPT останется». Если нейросеть заговорит на татарском лучше, чем большинство татар, это будет нашей победой или поражением?

— Не знаю. Понятно, что мы делаем это для живых людей, которые говорят на татарском. Чтобы у них была возможность пользоваться теми же услугами, что и у людей, говорящих на русском, английском и других языках.

Думаю, в какой-то момент большинство людей будет пользоваться нейросетями. В любом случае нейросети должны хорошо работать на татарском языке. Хотя бы для того, чтобы моя бабушка, живущая в деревне, могла задать какой-то, на наш взгляд, простой вопрос. Например, почему у нее болят колени в определенную погоду. Для кого-то, в том числе для пожилых людей, это еще и своего рода замена общения. Есть довольно молодые люди, которые хорошо говорят на татарском языке, это тоже глупо отрицать. Они должны получать такой же уровень сервиса и такие же услуги, как и носители других языков.

Во-вторых, если появится хорошая нейросеть на татарском языке, с ее помощью можно будет учить татарский. Она сможет заменить человеку отсутствующего в его жизни репетитора или носителя языка, с которым можно обсудить какие-то бытовые вопросы.

Есть еще одна мировая тенденция. Раньше существовало много курсов для людей, которые хотели научиться программированию: курсы «Яндекс.Практикум», Skillbox и другие школы. После появления ChatGPT количество учеников у них резко сократилось. Зачем им идти на лекцию, пусть даже с живым преподавателем, если на ней будет еще 40 человек? Ведь теперь у каждого есть персональный учитель, которому можно написать даже в час ночи, задать возникший вопрос и получить более-менее качественный ответ. Он не будет идеальным, это не заменит человеческого общения, но на свой вопрос человек получит вполне нормальный ответ.

Думаю, для татарского языка это тоже полезно. У каждого человека может появиться персональный учитель. Это гораздо легче масштабировать, чем подготовить 10 преподавателей и отправить их куда-то в Казань обучать людей татарскому языку.

При этом я не отрицаю, что нужны учителя, живые редакторы и переводчики. Думаю, из моих предыдущих ответов понятно, что я против тенденции заменять их нейросетями.

«Я понимаю, что сейчас нейросети могут решить почти все. Но, как я уже говорил, их использование требует большего внимания и более высокой компетенции, чтобы замечать мелкие ошибки» «Я понимаю, что сейчас нейросети могут решить почти все. Но, как я уже говорил, их использование требует большего внимания и более высокой компетенции, чтобы замечать мелкие ошибки» Фото: https://www.magnific.com/

«Я считаю, что люди, возможно, не до конца разобрались в теме»

— В этом году минкульт Татарстана выделил 2,5 миллиона рублей на фильм, созданный с помощью нейросетей.

— Сама технология генерации видео пока находится на той стадии, когда она объективно не позволяет получить по-настоящему качественный результат, так что ожидания от такого проекта стоило бы соотносить с реальными возможностями нейросетей на сегодняшний день. Я считаю, что люди, возможно, не до конца разобрались в теме.

Если бы в Татарстане существовала великолепная индустрия игрового кино, я бы понял: давайте выделим немного денег еще и на нейросети, посмотрим, что получится. Но мне кажется, что некоторые команды в первую очередь ориентируются не столько на качество результата, сколько на возможность заявить: «Смотрите, мы сделали это первыми в мире!» Это скорее история про хайп и привлечение внимания, чем про содержательный творческий результат. Возможно, они хотят выпустить первый фильм на татарском языке, сгенерированный нейросетями, и таким образом заявить о себе.

Есть такая компания Higgsfield из Казахстана, довольно известный стартап. Она занимается генерацией видео. Компания объявила, что на Каннском фестивале показали фильм, созданный с помощью Higgsfield. Но оказалось, что показ проходил не на самом Каннском фестивале, а где-то поблизости. Во время фестиваля они арендовали в Каннах какое-то помещение, устроили там показ и потратили на это деньги. Для компании это хорошая реклама, тут вопросов нет. Я сейчас рассказываю о них и, по сути, уже их рекламирую. И при этом, это частная компания-единорог, которая специализируется на генерации видео.

Думаю, здесь может получиться похожая ситуация. Не уверен, что этот фильм соберет большую аудиторию и результат может оказаться довольно неоднозначным. Мне кажется, что средства можно было бы направить куда-то с большей пользой.

— Уже были случаи, когда ученики участвовали в творческом конкурсе, сгенерировали рассказы с помощью OpenAI. Представители старшего поколения в жюри этого не замечали, и такие работы побеждали. Пожилой писатель с умилением показывал эти произведения остальным: «Посмотри, всего лишь в 7-м классе учится, а пишет такие рассказы!»

— Думаю, таких случаев будет все больше. ИИ будет все активнее использоваться и в образовании. Но если ребенок не думает, а просто выполняет домашние задания с помощью нейросетей, то это уже вопрос к ребенку и его родителям. Если, родители не заставляют ребенка заниматься, а он сам не хочет учиться, то в конечном итоге останется без знаний.

Я понимаю, что сейчас нейросети могут решить почти все. Но, как я уже говорил, их использование требует большего внимания и более высокой компетенции, чтобы замечать мелкие ошибки. Со временем нейросети ошибаются все менее очевидно: упускают небольшие детали или врут в мелочах.

Это уже вопросы к минобрнауки и другим ответственным людям: чему они хотят научить ребенка? Образование должно адаптироваться к новым условиям. Если вы даеье детям примеры, которые раньше можно было бездумно решить на калькуляторе, а сейчас — с помощью нейросети, то вопрос скорее к самому заданию.

— По каким признакам можно распознать текст, созданный ИИ?

— Если вы часто работаете с ChatGPT, то начинаете понимать, как выглядят его тексты. У него есть странные фразы, своя стилистика. Он любит использовать определенные выражения. У таких текстов часто бывают очень однообразные подводки, они начинаются с шаблонных фраз.

Например, ChatGPT обожает конструкцию «это не… — это другое»: «Это не просто инструмент — это новый подход». Если такое противопоставление встречается чуть ли не в каждом абзаце, это почти наверняка признак ИИ. Еще один узнаваемый прием — тройное или четверное перечисление с «без»: «без лишнего шума, без хаоса, без перегруза». Такие конструкции модель использует настолько часто, что они превращаются в своего рода фирменный почерк.

Если вы видите необычную конструкцию, которая начинает повторяться повсюду, хотя раньше не была ходовой, значит, это возникло не просто так. Либо выражение стало очень популярным, превратилось в мем, либо его массово предлагает ИИ.

— Как вы относитесь к тому, что в Институте филологии и межкультурной коммуникации КФУ открылась магистратура ИИ — ИИ в татароязычном пространстве?

— Я об этом читал, но не знаю, чем именно они будут заниматься, поэтому пока не понимаю. В целом Институт филологии, Институт прикладной семиотики и другие подобные учреждения — это нужные научно-образовательные организации. Они должны существовать и развиваться.

При этом мне кажется, что таким институтам может быть непросто конкурировать за задачи, которые выходят за пределы их привычных компетенций: у крупных игроков вроде «Яндекса» или Сбера просто другие возможности — более широкие бюджеты, соответствующие зарплаты и вычислительные мощности, которые позволяют специалистам постоянно работать над масштабными проектами.

Возможно, отчасти это связано с общим интересом к теме ИИ. А возможно, когда бюджеты сокращают, приходится изворачиваться и придумывать новые направления: «Вот сейчас мы займемся этим, и нам выделят чуть больше денег».

Если моя гипотеза верна и это просто способ как-то выжить в условиях сокращающихся бюджетов, то я отношусь к этому скорее позитивно.

Проект «Ясалма»: что готовит команда создателей татарской нейросети?

— Как вы сами пришли к татарским нейросетям?

— Я родился и вырос в Ханты-Мансийском автономном округе, родители — татары из Башкортостана. Сейчас я живу в Казани. Я хорошо понимаю татарский язык, но все еще сильно стесняюсь говорить. Я вырос в Ханты-Мансийском автономном округе, вне татарской языковой среды. В последнее время я уже неплохо прокачал понимание сложных текстов на литературном татарском, потому что много приходиться копаться в книгах.

— Где вы учились и работаете?

— Я учился в МФТИ, затем в парижском Политекнике (École Polytechnique). Сейчас работаю ML-инженером в зарубежной компании, которая занимается ускорением больших языковых моделей.

— Расскажите об IT-проекте «Ясалма».

— IT-проект «Ясалма» появился около двух лет назад. Во многом он вырос из курса Сайдаша Мифтахова по искусственному интеллекту, который организова всемирный форум татарской молодежи. На этом курсе мы познакомились и начали что-то делать вместе. С тех пор мы продолжаем сотрудничать со ВФТМ по отдельным проектам и инициативам.

Всего нас больше 20 человек. Активных участников, которые прямо сейчас чем-то занимаются, меньше. Мы планируем запустить татарскую нейросеть.

Поскольку главная проблема заключается в нехватке данных, в основном мы занимаемся их сбором. У нас есть разные тексты из интернета, в том числе из социальных сетей. Но основной источник — все-таки книги. Сначала мы собирали то, что уже находилось в свободном доступе в интернете. Сейчас в основном сканируем издания, договариваемся с редакциями газет. Пока храним отсканированные материалы у себя и передаем редакциям. В дальнейшем собираемся перевести их в текстовый формат и опубликовать в открытом доступе, чтобы любые компании могли использовать эти данные для обучения нейросетей.

В конечном итоге мы планируем обучить собственную небольшую языковую модель. Это точно не будет ChatGPT, но мы хотим создать хорошую модель, которую можно будет запустить на своем компьютере или даже телефоне. Она сможет отвечать на разные вопросы — например, рассказывать, как настроить умный дом.

Ближе к осени также планируем объявить конкурс по сбору аудиозаписей, чтобы начать решать проблему распознавания татарской речи.

— То есть вы создаете и распознаватель татарской речи? А кто вас финансирует?

— Сейчас мы в основном сосредоточены на сборе данных. Постоянного финансирования у нас нет. В основном тратим донаты и собственные деньги. Например, за сканирование книг нужно платить: люди не будут работать бесплатно. Мы сами оплачиваем работу сканировщиков.

Кроме того, мы помогаем форуму татарской молодежи создать сервис проверки грамматических ошибок для «Татарча диктант». Редакторы размечают тексты: находят неграмотные фрагменты и исправляют их, их работу оплачивают из гранта. В итоге получится корпус грамматических ошибок, который мы планируем выложить в открытый доступ — он нужен, чтобы языковые модели могли исправлять типичные ошибки, например в постах из социальных сетей.

— Когда нейросеть будет готова?

— Модель пока не обучена. Я говорю лишь о том, что мы планируем ее обучить. Но данные уже существуют: любой желающий может взять их и уже сейчас обучить свою модель. Некоторые так и делают.

Например, Сбер использовал наши данные — книги и собранные нами корпуса — в новой версии GigaChat. Отзывы о качестве противоречивые. Мне показалось, что татарский там уже неплохой, но двигаться еще есть куда.

— Кто работает в вашей команде?

— В основном это татары, работающие в IT и так или иначе связанные с Татарстаном. Есть несколько филологов, в том числе выпускники или сотрудники КФУ и других вузов.

Как организация мы никак не связаны ни с Институтом прикладной семиотики, ни с КФУ. Просто некоторые участники проекта там учились или работали.

В основном в команде молодые IT-специалисты. Есть сотрудники «Яндекса», Сбера и еще нескольких компаний. Я сам работаю в западной компании. Это люди из разных мест, которых объединил проект «Ясалма». В основном все проживают в России. Мы просто вместе занимаемся тем, что интересно каждому из нас. В среде программистов это называется pet project — проект, которым занимаются в свободное время. Для нас это хобби. Поскольку многие участники работают в IT, мы можем выделять на него и собственные деньги.

«Люди, работающие в обычном IT, часто занимаются довольно скучными вещами»

— Что побудило вас взяться за эту работу? Возможно, я говорю жестко, но вам же даже «спасибо» могут не сказать.

— Во-первых, у людей бывают разные, иногда странные хобби. Никто ведь не ждет благодарности за то, что коллекционирует пластинки.

Во-вторых, если немного прорекламировать наш проект среди специалистов… Люди, работающие в обычном IT, часто занимаются довольно скучными вещами. Это может быть что-то полезное для бизнеса, например развитие основной страницы маркетплейса, но сама работа при этом может оказаться совершенно неинтересной. А ведь многие приходили в программирование, потому что хотели делать что-то увлекательное: разрабатывать роботов, обучать языковые модели татарскому или любому другому языку. Наш проект позволяет получить новые навыки и заниматься тем, чем не можешь заниматься на основной работе, хотя, возможно, мечтал об этом, когда выбирал профессию. Кроме того, для кого-то важно сделать что-то для татарского языка, для своего народа. Это тоже серьезная часть мотивации.

Есть и профессиональная выгода. Человек может с нуля создать хорошую языковую модель для языка, который раньше почти не поддерживался. Модель, которую не сделал ни Google, ни кто-то другой. Это хорошая строчка в резюме. Можно написать технический отчет, поехать на конференцию и представить результаты. В нашей индустрии так делают все, в том числе Институт прикладной семиотики.

Это вполне серьезная научная работа в том виде, в котором сейчас существует наша отрасль. Её можно использовать как карьерный рычаг. Работодатели ценят, когда у человека есть собственный интерес, когда он самостоятельно в чем-то разобрался и что-то создал.

— То есть вы разрабатываете ИИ-сервис, который, как ChatGPT, будет понимать татарский язык и отвечать на вопросы?

— Конечная цель именно такая. Но ChatGPT — только вершина айсберга. Это просто самая известная модель, которой все пользуются: открываешь сайт, печатаешь вопрос и получаешь ответ. На самом деле существует огромная индустрия и множество других моделей. Есть много китайских моделей. Они не всегда распространяются через веб-интерфейсы. Их скачивают и запускают у себя на компьютерах компании и обычные энтузиасты.

Такие нейросети бывают относительно небольшими. В отличие от ChatGPT, который, скорее всего, очень велик и требует множества видеокарт даже для запуска, небольшую модель можно запустить на одной игровой видеокарте или на ноутбуке с большим объемом оперативной памяти. У нее может быть такой же веб-интерфейс, и вы сможете задавать ей вопросы, как в ChatGPT.

Возможно, качество окажется не таким высоким, потому что сама модель гораздо меньше. Наша цель — сначала обучить небольшую языковую модель, затем, возможно, перейти к моделям покрупнее. Мы хотим создать модель, которая будет хорошо или даже очень хорошо говорить на татарском языке.

Это должен быть не ломаный, странный, переводной язык, который сейчас используют модели многих разработчиков, а нормальный литературный и одновременно живой татарский — с устойчивыми словосочетаниями и выражениями, которыми пользуются люди.

Модель должна хорошо писать на татарском и обладать большим количеством практических знаний из книг и других источников. У современных нейросетей этих знаний часто нет, потому что многие татарские материалы до сих пор не оцифрованы. Поэтому мы собираем корпуса и публикуем их на специальной платформе. Если вопрос с вычислительными мощностями условно решен, все упирается в данные.

— Это можно назвать своего рода импортозамещением?

— Сама платформа западная. Ею пользуются программисты и в России, и за ее пределами. Что касается импортозамещения, уже существуют GigaChat и сервисы «Яндекса». Мы знакомы с некоторыми участниками этих команд, общаемся с ними и передаем им данные.

В последней версии GigaChat, обученной в том числе на собранных нами материалах, качество татарского языка стало лучше.

В целом нам безразлично, кто именно будет пользоваться этими данными. Мы хотим, чтобы на всех платформах был хороший татарский язык, без странных слов и конструкций.