Основной задачей поисковой машины является предоставление качественных результатов, т.е. наиболее важных релевантных страниц. Компания «Яндекс» дает следующее определение поискового спама: поисковый спам — это попытки обмана поисковой системы и манипулирования ее результатами с целью завышения позиции сайтов (страниц) в результатах поиска.
Поисковый спам можно разделить на две категории: контентный и ссылочный спам.
Контентный спам. Спамеры могут попытаться сделать страницу релевантной для многих запросов, включив большое число различных терминов в документ, или повысить релевантность при помощи увеличения количества вхождений ключевых слов. Однако современные поисковые системы умеют определять подобный вид спама и снижают рейтинг, если плотность встречаемости ключевых слов превышает «нормальную».
Обычно поисковые машины присваивают больший вес терминам, встречающимся в теге title, и меньший – словам, появляющимся в мета-тегах. Ключевые слова могут встречаться в тексте гиперссылки, но в этом случае ключевое слово относится как к странице источнику, так и к странице, на которую ведет гиперссылка.
Иногда спамеры копируют тексты, например новости, с других сайтов. Но многие поисковики стараются не индексировать «сайты, копирующие или переписывающие информацию с других ресурсов и не создающие оригинального контента». Текст может копироваться не полностью, а по предложениям. Спамеры могут вводить невидимый текст с единственной целью манипуляции поисковой системой. Также распространенным приемом является использования дорвеев. Дорвеи – страницы, содержащие ключевые слова, предназначенные для поисковиков, и перенаправляющие пользователей на другие страницы.
Простейший способ – создание отдельных страниц на каждый запрос. Следующий уровень – создание дорвеев, которые индексируются поисковиками, но не отображаются в браузерах. Третий метод – клоакинг: поисковые машины и пользователи видят разный контент. Поисковые машины также определяют редирект и обычно индексируют только ту страницу, куда был переадресован пользователь. Еще один вид недобросовестной оптимизации – свопинг – замена или значительное изменение контента, когда нужное положение страницы в индексе уже достигнуто.
Активно разрабатываются методы обнаружения автоматически сгенерированного контента. Одни из первых алгоритмов для фильтрации поискового спама были основаны на эвристиках: анализ гиперссылок, DNS, автоматическая кластеризация документов и выявление практически одинаковых страниц. Предлагались статистические методы обнаружения массовых текстов: количество слов на странице (эффективно, если спамеры пытаются увеличить покрытие запросов), количество слов в заголовке, средняя длина слова, анализ отображаемого текста гиперссылок, доля отображаемого текста по отношению ко всему контенту. Из машинного перевода пришли методы сравнения языковых моделей, т.е. вероятности встречаемости строки в языке. Если некоторые страницы уже были помечены как спам, можно выявить похожие на них страницы.
Помимо лингвистических подходов, применяется также анализ оформления страниц. Этот метод опирается на предположение, что страницы генерируются по одним и тем же шаблонам. Широкое распространение получили методы генерации текстов на основе цепей Маркова. Поскольку подобные генераторы обучаются на выборках на естественном языке, для подобного спама не применимы методы, опирающиеся на «неестественность» последовательности слов. Однако современные генераторы не могут обеспечить полную связность текста и стилистическое единство, что может быть применено для выявления спама. Многие поисковые системы умеют распознавать неуникальный контент. Поэтому последнее время широкое распространение получили такие методы поисковой оптимизации (search engine optimization), как рерайтинг и копирайтинг.
Ссылочный спам. Существует два основных алгоритма, рассчитывающих рейтинг страницы на основе ссылок: HITS и PageRank. HITS-алгоритм (Hyperlink-Induced Topic Search), или алгоритм Клейнберга, ранжирует страницы в зависимости от темы. Значимость страницы первоисточника рассчитывается как сумма весов страниц посредников, указывающих на нее, а вес страницы-посредника, в свою очередь, как сумма значений весов страницы первоисточника, ссылки на которые она содержит.
Hub-рейтинг можно легко увеличить, добавив ссылки на «хорошие» страницы сайта. Authority-рейтинг можно поднять за счет исходящих ссылок со страниц, имеющих высокий hub-рейтинг. Кроме того, можно добавлять ссылки на блоги, форумы и т. д., т. е. на страницы, содержание которых спамер может модифицировать. PageRank исходит из предположения, что количество ссылок на страницу отражает популярность этой страницы среди пользователей. Для манипуляции этим алгоритмом спамеры используют так называемые линкофермы (фермы ссылок, линкфармы, link farm) «фермы» для разведения ссылок. При этом группа веб-сайтов содержит ссылки на другие сайты в группе.
Обычно эти сайты не несут полезного контента, а созданы для увеличения индекса цитирования другого сайта путем размещения ссылок на него. Привлечение пользователей на подобные сайты может осуществляться копированием «полезного» контента с чужих страниц. Наличие на веб-странице большого количества внешних гиперссылок и малое количество или полное отсутствие внутренних гиперссылок может быть сочтено за ссылочный спам.
Существуют компании, занимающиеся продвижением сайтов, как «белым», так и «черным». Можно встретить объявления о покупке ссылок со страниц с релевантным текстом, возможности генерации текстов статей по шаблонам, пакетной загрузки уникализированных статей, автоматической уникализации текстов статей и т.д. Современные алгоритмы обнаружения ссылочного спама опираются на такие признаки, как наличие определенных слов в окрестности ссылки, наличие блоков ссылок, отсутствие тематической близости между ссылкой и контентом страницы или соседними ссылками, наличие идентичных по коду ссылок, изменение ссылок без изменения основного содержания страницы и т.д.
Таким образом, существует множество методов классификации, которые используют различный математический аппарат и различные подходы при реализации. Однако эффективность этих методов зависит от конкретной решаемой задачи. Все перечисленные методы слабо проявляют себя при решении задач определения качества контента.
Несмотря на то что последнее десятилетие коммерческие компании и ученые занимаются проблемой качества содержимого и разработано достаточно много подходов, на сегодняшний день не существует методов, которые могли бы однозначно решить эту задачу. Большинство техник нацелено на обнаружение ошибок генераторов спам-страниц и они не применимы для фильтрации поискового спама, написанного людьми. Поэтому целесообразна разработка универсального метода детектирования низкокачественного контента.