Удалить HTML-теги из текста

Уберите HTML-теги и получите чистый текст: абзацы, переносы, сущности, ссылки, скрипты и комментарии. Таблица найденных тегов и обратный режим — текст в HTML.

Параметры

Убрать разметку и получить чистый текст

Разметка уходит целиком, остаётся только текст

Что попадёт в текст на месте ссылки

Через запятую: div, span, a. Угловые скобки писать не обязательно

Дополнительно
Сохранить переносы из brНа месте br останется перенос строки
Сохранить абзацы из p и блочных теговВокруг абзацев, списков и таблиц будет пустая строка
Декодировать HTML-сущности , &, « и   станут обычными символами
Удалять script и style с содержимымБлоки уходят целиком, даже если их тегов нет в списке
Убирать комментарии«<!-- текст -->» исчезает целиком, вместе со скобками

Пробелы и переносы самого HTML схлопываются так же, как их видит браузер: серия пробелов становится одним пробелом.

Исходный HTML

Результат

Разметка не задана

Найденные теги

Вставьте разметку — таблица тегов появится здесь

Отчёт

Пока считать нечего

Сущности в тексте

Здесь появятся сущности из текста

Зачем убирать HTML-разметку

Разметка приходит отовсюду: текст скопирован с сайта, выгружен из CMS, пришёл письмом в HTML или ответом API. Для поиска, анализа, перевода или вставки в таблицу нужен чистый текст без тегов — и начинается ручная работа. Мешают абзацы и выделения, неразрывные пробелы выглядят как обычные, а в тексте лежит код скрипта целиком.

Инструмент разбирает разметку именно как разметку, а не вырезает всё похожее на тег. Содержимое script и style не попадает в результат вместе с блоками, комментарии исчезают целиком, абзацы и переносы сохраняются, сущности разворачиваются в символы, а ссылки остаются текстом или адресом — на выбор. Незнакомая сущность не пропадает молча: она попадает в таблицу с пометкой.

Найденная разметка видна в таблице: сколько раз встретился каждый тег и что инструмент с ним сделал при текущих настройках. Вторая половина задачи — обратная: превратить обычный текст в HTML, экранировав служебные символы и расставив абзацы, — решается тем же инструментом, переключателем режима.

Частые вопросы

Как удалить HTML-теги из текста?

Вставьте разметку в поле «Исходный HTML» — результат появится в панели справа сразу, без кнопки «Обработать». Настройки по умолчанию убирают все теги, блоки script и style вместе с кодом и комментарии, разворачивают HTML-сущности в символы и сохраняют абзацы с переносами.

Чем режим «Текст → HTML» отличается от «HTML → текст»?

Это две стороны одной задачи. «HTML → текст» убирает разметку, а «Текст → HTML» делает обратное: экранирует символы &, < и >, чтобы они не превратились в разметку, и расставляет абзацы — каждой непустой строке свой <p>, пустой строке новый абзац или переносы через <br>. Режим переключается в параметрах, текст при этом остаётся на месте.

Сохранятся ли абзацы и переносы строк?

Да, если включены оба флажка сохранения: на месте <br> останется перенос строки, вокруг абзацев и блочных тегов — пустая строка, ячейки таблицы разделятся табуляцией, а элементы списка встанут каждый на своей строке. Переносы строк самого HTML-файла текстом не считаются: в HTML они равны пробелу, поэтому серии пробелов и переносов схлопываются в один пробел, как их и показал бы браузер. Выключите оба флажка, если нужен текст ровно таким, каким он стоит между тегами.

Что происходит со script, style и комментариями?

По умолчанию они убираются целиком, вместе с содержимым: иначе код попал бы в текст и смешался бы с ним. Содержимое этих блоков не считается разметкой, поэтому теги внутри строки кода не путаются с настоящими. Флажок можно выключить — тогда блок останется в результате как есть. Объявления вроде <!DOCTYPE html> убираются всегда, независимо от настроек.

Можно ли удалить только выбранные теги и что делать со ссылками?

Да: выберите «Только из списка» и перечислите теги через запятую — div, span, a. Угловые скобки писать не обязательно, регистр не важен, лишние теги останутся в тексте как есть. В таблице найденных тегов видно, какие из них убираются, а какие остаются. Отдельная настройка решает судьбу ссылок: оставить текст ссылки или заменить его адресом из href.

Декодируются ли HTML-сущности?

Да: &amp;, &lt;, &quot;, &laquo;, &mdash;, &nbsp; и числовые ссылки вроде &#160; или &#x2014; заменяются символами. Незнакомые сущности остаются в тексте как есть и помечаются в таблице словом «не распознана» — по ней видно, что именно не развернулось. Неразрывный пробел из &nbsp; становится символом U+00A0: он выглядит как обычный пробел, но ведёт себя иначе, и убрать его можно инструментом «Убрать лишние пробелы».

Текст отправляется на сервер?

Нет. Разметка разбирается целиком в браузере на JavaScript: ни текст, ни адреса ссылок, ни найденные теги никуда не передаются и не сохраняются. Инструментом можно пользоваться офлайн, а результат остаётся на вашем компьютере.