Уберите HTML-теги и получите чистый текст: абзацы, переносы, сущности, ссылки, скрипты и комментарии. Таблица найденных тегов и обратный режим — текст в HTML.
Пока считать нечего
Здесь появятся сущности из текста
Разметка приходит отовсюду: текст скопирован с сайта, выгружен из CMS, пришёл письмом в HTML или ответом API. Для поиска, анализа, перевода или вставки в таблицу нужен чистый текст без тегов — и начинается ручная работа. Мешают абзацы и выделения, неразрывные пробелы выглядят как обычные, а в тексте лежит код скрипта целиком.
Инструмент разбирает разметку именно как разметку, а не вырезает всё похожее на тег. Содержимое script и style не попадает в результат вместе с блоками, комментарии исчезают целиком, абзацы и переносы сохраняются, сущности разворачиваются в символы, а ссылки остаются текстом или адресом — на выбор. Незнакомая сущность не пропадает молча: она попадает в таблицу с пометкой.
Найденная разметка видна в таблице: сколько раз встретился каждый тег и что инструмент с ним сделал при текущих настройках. Вторая половина задачи — обратная: превратить обычный текст в HTML, экранировав служебные символы и расставив абзацы, — решается тем же инструментом, переключателем режима.
Вставьте разметку в поле «Исходный HTML» — результат появится в панели справа сразу, без кнопки «Обработать». Настройки по умолчанию убирают все теги, блоки script и style вместе с кодом и комментарии, разворачивают HTML-сущности в символы и сохраняют абзацы с переносами.
Это две стороны одной задачи. «HTML → текст» убирает разметку, а «Текст → HTML» делает обратное: экранирует символы &, < и >, чтобы они не превратились в разметку, и расставляет абзацы — каждой непустой строке свой <p>, пустой строке новый абзац или переносы через <br>. Режим переключается в параметрах, текст при этом остаётся на месте.
Да, если включены оба флажка сохранения: на месте <br> останется перенос строки, вокруг абзацев и блочных тегов — пустая строка, ячейки таблицы разделятся табуляцией, а элементы списка встанут каждый на своей строке. Переносы строк самого HTML-файла текстом не считаются: в HTML они равны пробелу, поэтому серии пробелов и переносов схлопываются в один пробел, как их и показал бы браузер. Выключите оба флажка, если нужен текст ровно таким, каким он стоит между тегами.
По умолчанию они убираются целиком, вместе с содержимым: иначе код попал бы в текст и смешался бы с ним. Содержимое этих блоков не считается разметкой, поэтому теги внутри строки кода не путаются с настоящими. Флажок можно выключить — тогда блок останется в результате как есть. Объявления вроде <!DOCTYPE html> убираются всегда, независимо от настроек.
Да: выберите «Только из списка» и перечислите теги через запятую — div, span, a. Угловые скобки писать не обязательно, регистр не важен, лишние теги останутся в тексте как есть. В таблице найденных тегов видно, какие из них убираются, а какие остаются. Отдельная настройка решает судьбу ссылок: оставить текст ссылки или заменить его адресом из href.
Да: &, <, ", «, —, и числовые ссылки вроде   или — заменяются символами. Незнакомые сущности остаются в тексте как есть и помечаются в таблице словом «не распознана» — по ней видно, что именно не развернулось. Неразрывный пробел из становится символом U+00A0: он выглядит как обычный пробел, но ведёт себя иначе, и убрать его можно инструментом «Убрать лишние пробелы».
Нет. Разметка разбирается целиком в браузере на JavaScript: ни текст, ни адреса ссылок, ни найденные теги никуда не передаются и не сохраняются. Инструментом можно пользоваться офлайн, а результат остаётся на вашем компьютере.