Статья

Как мы измеряли сложность текста и трижды обманули сами себя

Учителю нужно знать, по силам ли ученику этот текст. Вопрос звучит просто, но ответ на него — число, а числа умеют лгать убедительно.

Мы взялись научить машину определять уровень английского текста по шкале CEFR: от A1 для начинающих до C2 для свободно владеющих. Практический смысл — отличить B1 от B2, а в израильской школе это разница между четырьмя и пятью баллами багрута.

Работа заняла один день. Самое ценное в ней — не итог, а три ошибки, каждая из которых давала растущие, правдоподобные цифры, когда измерять было нечего.

Первая ошибка: прибор мерил длину

Первые версии показывали 44 процента верных ответов, потом 51, потом 56. Цифры росли, признаки выглядели осмысленными. Мы уже готовы были поверить.

Насторожило другое. Мы стали смотреть, где прибор ошибается, и увидели слишком ровную картину: три подряд промаха пришлись на короткие тексты — 134, 151 и 218 слов, три подряд попадания на длинные — 441, 919 и 1045.

Проверили набор данных. Оказалось, в нём средняя длина текста растёт вместе с уровнем: на A2 около ста двадцати слов, на C2 больше восьмисот. И это не свойство языка, а устройство экзаменов: на лёгком дают короткий отрывок, на трудном длинный.

Мы отобрали тексты одной длины и прогнали прибор заново. Он показал 49 процентов — ровно столько же, сколько даёт стратегия «всегда отвечать B2», не глядя на текст вовсе.

Прибор измерял длину. Всё остальное было украшением.

Отдельно выяснилось неприятное про ту самую границу B1/B2, ради которой всё затевалось: в этом наборе тексты B1 занимают от 134 до 461 слова, B2 — от 451 до 759. Перекрытие — один текст из семидесяти одного. На таких данных вопрос «B1 или B2» неразрешим в принципе, и любая опубликованная точность по этой границе есть точность по длине.

Вторая ошибка: прибор, неспособный возразить

Мы попросили языковую модель описывать тексты и заодно называть их уровень. Проверка согласия двух независимых прогонов дала сто процентов. Совпадение с экзаменом — тоже сто.

Идеальный результат должен настораживать сильнее плохого.

Мы проверили по всему корпусу: из 8464 описаний 8454 называли ровно тот уровень, который уже стоял в базе. В том числе там, где уровней всего два. Разгадка оказалась унизительной: уровень подавался модели во входных данных. Она не оценивала, она повторяла.

Отсюда правило, которое мы теперь применяем ко всему: прибор, показывающий совершенное согласие, подозрителен, пока не доказано, что он вообще способен не согласиться.

Третья ошибка: направление, взятое из учебника

Мы решили посмотреть, помогает ли грамматика. Считали плотность конструкций уровня B2 и выше — по справочнику. Получили 51, 36 и 53 процента, то есть чистый шум, и сделали вывод: грамматика об уровне ничего не говорит.

Вывод был неверен, и ошибка пряталась в самой группировке.

Мы стали мерить каждое правило отдельно — и увидели, что сложность и уровень правила в справочнике расходятся систематически. Past Simple, конструкция уровня A1, оказалась сильнейшим маркером сложного текста: в 92 процентах случаев её становилось больше при усложнении. А подлежащные местоимения, тоже A1, — сильнейшим маркером простоты, они при усложнении исчезают.

Ведро «B2 и выше» смешивало растущие признаки с убывающими, и они гасили друг друга досуха.

После того как направление каждого правила было замерено, а не взято из книжки, одна только грамматика стала правильно упорядочивать девять троек текстов из десяти.

Как мы проверяли по-честному

Сравнивать разные тексты бессмысленно: мешают длина, жанр, тема. Нам повезло с набором данных, где одна и та же статья Guardian переписана редакцией в трёх уровнях сложности. Содержание постоянно, меняется только исполнение — и всё, что отличает версии, относится к сложности, а не к теме.

Признаки отбирали на одной половине этих троек, а мерили на другой, которая в отборе не участвовала. Иначе прибор запоминает ответы, а не учится.

Что в итоге получилось

81 процент верных ответов на школьной шкале, при 41 у стратегии «всегда отвечай самым частым». Языковая модель, спрошенная напрямую, даёт 44.

Самым сильным признаком оказался неожиданный: расстояние между словом и тем словом, от которого оно зависит по смыслу. Чем текст труднее, тем дальше друг от друга разъезжаются связанные слова, и тем больше читателю приходится удерживать в памяти. На верхней границе этот признак различает тексты безошибочно — сто процентов.

И обнаружилась закономерность, которой мы не ожидали. Внизу шкалы сложность растёт по форме: длиннее предложения, длиннее слова, шире словарь. Наверху — по существу: слова становятся реже, а связи между ними дальше. Признаки, отлично работающие на школьных уровнях, наверху слабеют вдвое.

Чего прибор не может

Он не отличает C1 от C2. Для школы это неважно — программа кончается на B2.

Он спотыкается на многозначности: слово minute имеет уровень A1 в значении «минута» и C1 в значении «ничтожный», а словари ключуются по написанию.

И он упирается в потолок согласия самих словарей: наш сводный и оксфордский совпадают точно лишь в 39 процентах слов. Требовать от прибора точности выше, чем согласие авторитетов, не на чем.

О новизне — честно

Заказчик спросил прямо: можно ли назвать это своей методикой. Мы проверили литературу, и ответ отрицательный.

В первой редакции отчёта мы подавали парный способ проверки и взвешенную сумму как свои рабочие решения. Оказалось, что не свои: Xia с соавторами ещё в 2016 году противопоставили попарное сравнение классификации, привели тот же довод — трудность текста непрерывна, а не разбита на ступени — и получили ту же разницу в числах.

Признаки, к которым мы пришли, перечислены в работах Vajjala и Meurers. Опасность спутать длину с уровнем известна. Парный корпус создан ровно для таких сравнений.

Прийти к тем же выводам самостоятельно — это ценность воспроизведения, но не первенства. Называть это собственной методикой нельзя.

Что, возможно, представляет интерес — три частности. Показанная числом непригодность известного набора данных для вопроса «B1 или B2». Замер направления каждой грамматической конструкции вместо взятия его из справочника. И сводный словарь как медиана трёх независимых источников с исключением спорных слов — исключение подняло точность с 58 до 66 процентов.

Зачем мы это рассказываем

Все три ошибки были найдены одинаково: мы читали случаи, в которых прибор ошибся. Не разбирали код, не рассуждали о методе — читали конкретные тексты и смотрели, что с ними не так.

Растущая цифра ничего не доказывает. Доказывает только контрольный опыт, устроенный так, чтобы прибор мог провалиться, — и прочитанные частные случаи, где он провалился.

← Все статьи