Регулярные выражения sed. Потоковый редактор SED


Автор: Rares Aioanei
Дата публикации: 19 ноября 2011 года
Перевод: А. Кривошей
Дата перевода: июль 2012 г.

1. Введение

Добро пожаловать во вторую часть нашей серии, которая посвящена sed, версии GNU. Существует несколько версий sed, которые доступны на разных платформах, но мы сфокусируемся на GNU sed версии 4.x. Многие из вас слышали о sed, или уже использовали его, скорее всего в качестве инструмента замены. Но это только одно из предназначений sed, и мы постараемся показать вам все аспекты использования этой утилиты. Его название расшифровывается как "Stream EDitor" и слово "stream" (поток) в данном случае может означать файл, канал, или просто stdin. Мы надеемся, что у вас уже есть базовые знания о Linux, а если вы уже работали с регулярными выражениями, или по крайней мере знаете, что это такое, то все для вас будет намного проще. Объем статьи не позволяет включить в нее полное руководство по регулярным выражениям, вместо этого мы озвучим базовые концепции и дадим большое количество примеров использования sed.

2. Установка

Здесь не нужно много рассказывать. Скорее все sed у вас уже установлен, так как он используется различными системными скриптами, а также пользователями Linux, которые хотят повысить эффективность своей работы. Вы можете узнать, какая версия sed у вас установлена, с помощью команды:

$ sed --version

В моей системе эта команда показывает, что у меня установлен GNU sed 4.2.1 плюс дает ссылку на домашнюю страницу программы и другие полезные сведения. Пакет называется "sed" независимо от дистрибутива, кроме Gentoo, где он присутствует неявно.

3. Концепции

Перед тем, как идти дальше, мы считаем важным акцентировать внимание на том, что делает "sed", так как словосочетание "потоковый редактор" мало что говорит о его назначении. sed принимает на входе текст, выполняет заданные операции над каждой строкой (если не задано другое) и выводит модифицированный текст. Указанными операциями могут быть добавление, вставка, удаление или замена. Это не так просто, как выглядит: предупреждаю, что имеется большое количество опций и их комбинаций, которые могут сделать команду sed очень трудной для понимания. Поэтому мы рекомендуем вам изучить основы регулярных выражений, чтобы понимать, как это работает. Перед тем, как приступить к руководству, мы хотели бы поблагодарить Eric Pement и других за вдохновление и за то, что он сделал для всех, кто хочет изучать и использовать sed.

4. Регулярные выражения

Так как команды (скрипты) sed для многих остаются загадкой, мы чувствуем, что наши читатели должны понимать базовые концепции, а не слепо копировать и вставлять команды, значения которых они не понимают. Когда человек хочет понять, что представляют собой регулярные выражения, ключевым словом является "соответствие", или, точнее, "шаблон соответствия". Например, в отчете для своего департамента вы написали имя Nick, обращаясь к сетевому архитектору. Но Nick ушел, а на его место пришел John, поэтому теперь вы должны заменить слово Nick на John. Если файл с отчетом называется report.txt, вы должны выполнить следующую команду:

$ cat report.txt / sed "s/Nick/John/g" > report_new.txt

По умолчанию sed использует stdout, вы можете использовать оператор перенаправления вывода, как показано в примере выше. Это очень простой пример, но мы проиллюстрировали несколько моментов: мы ищем все соответствия шаблону "Nick" и заменяем во всех случаях на "John". Отметим, что sed призводит поиск с учетом регистра, поэтому будьте внимательны и проверьте выходной файл, чтобы убедиться, что все замены были выполнены. Приведенный выше пример можно было записать и так:

$ sed "s/Nick/John/g" report.txt > report_new.txt

Хорошо, скажете вы, но где же здесь регулярные выражения? Да, мы хотели сначала показать пример, а теперь начинается самая интересная часть.
Если вы не уверены, написали ли вы "nick" или "Nick", и хотите предусмотреть оба случая, необходимо использовать команду sed "s/Nick/nick/John/g". Вертикальная черта имеет значение, которое вы должны знать, если изучали C, то есть ваше выражение будет соответствовать "nick" или "Nick". Как вы увидите ниже, канал может использоваться и другими способами, но смысл остается тот же самый. Другие операторы, широко использующиеся в регулярных выражениях - это "?", который соответствует повторению предшествующего символа ноль или один раз (то есть flavou?r будет соответствовать flavor и flavour), "*" - ноль или более раз, "+" - один или более раз. "^" соответствует началу строки, а "$" - наоборот. Если вы - пользователь vi или vim, многие вещи покажутся вам знакомыми. В конце концов, эти утилиты, вместе с awk и С уходят корнями в ранние дни UNIX. Мы не будем больше говорить на эту тему, так как проще понять значение этих символов на примерах, но вы должны знать, что существуют различные реализации регулярных выражений: POSIX, POSIX Extended, Perl, а также различные реализации нечетких регулярных выражений, гарантирующие вам головную боль.

5. Примеры использования sed

Синтаксис команды Описание
sed "s/Nick/John/g" report.txt Заменяет каждое вхождение Nick на John в файле report.txt
sed "s/Nick/nick/John/g" report.txt Заменяет каждое вхождение Nick или nick на John.
sed "s/^/ /" file.txt >file_new.txt Добавляет 8 пробелов слева от текста для улучшения качества печати.
sed -n "/Of course/,/attention you \
pay/p" myfile
Выводит один абзац, начинающийся с "Of course" и заканчивающийся на "attention you pay"
sed -n 12,18p file.txt Выводит только строки 12-18 файла file.txt
sed 12,18d file.txt Выводит весь файл file.txt за исключением строк с 12 по 18
sed G file.txt Удваивает пробелы в file.txt
sed -f script.sed file.txt Записывает все команды в script.sed и выполняет их.
sed "5!s/ham/cheese/" file.txt Заменяет ham на cheese в file.txt за исключением 5-й строки
sed "$d" file.txt Удаляет последнюю строку
sed "/\{3\}/p" file.txt Печатает только строки с тремя последовательными цифрами
sed "/boom/!s/aaa/bb/" file.txt Если найден "boom", заменить aaa на bb
sed "17,/disk/d" file.txt Удаляет все строки, начиная с 17-й, до "disk"
echo ONE TWO / sed "s/one/unos/I" Заменяет one на unos независимо от регистра, поэтому будет напечатано "unos TWO"
sed "G;G" file.txt Утраивает пробелы в файле
sed "s/.$//" file.txt Способ замены dos2unix:)
sed "s/^[ ^t]*//" file.txt Удаляет все пробелы перед каждой строкой в file.txt
sed "s/[ ^t]*$//" file.txt Удаляет все пробелы в конце каждой строки в file.txt
sed "s/^[ ^t]*//;s/[ ^]*$//" file.txt Удаляет все пробелы в начале и в конце каждой строки в file.txt
sed "s/foo/bar/" file.txt Заменяет foo на bar только в первом вхождении в строке.
sed "s/foo/bar/4" file.txt Заменяет foo на bar только в четвертом вхождении в строке.
sed "s/foo/bar/g" file.txt Заменяет foo на bar для всех вхождений в строке.
sed "/baz/s/foo/bar/g" file.txt Заменить foo на bar только если строка содержит baz.
sed "/./,/^$/!d" file.txt Удалить все последовательные пустые строки за исключением EOF
sed "/^$/N;/\n$/D" file.txt Удалить все последовательные пустые строки, но оставить верхнюю пустую строку.
sed "/./,$!d" file.txt Удалить все начальные пустые строки
sed -e:a -e "/^\n*$/{$d;N;};/\n$/ba" \
file.txt
Удалить все замыкающие пустые строки
sed -e:a -e "/\\$/N; s/\\\n//; ta" \
file.txt
Если файл заканчивается обратным сплешем, соединить его со следующим (полезно для скриптов оболочки)
sed "/regex/,+5/expr/" Соответствует regex плюс 5 следующих строк
sed "1~3d" file.txt Удалить каждую третью строку, начиная с первой.
sed -n "2~5p" file.txt Печатать каждую пятую строку, начиная со второй.
sed "s/ick/John/g" report.txt Другой способ записи некоторых приведенных выше примеров. Вы можете предложить свой?
sed -n "/RE/{p;q;}" file.txt Печатает только первое соответствие RE (регулярного выражения)
sed "0,/RE/{//d;}" file.txt Удаляет только первое соответствие
sed "0,/RE/s//to_that/" file.txt Изменяет только первое соответствие
sed "s/^[^,]*,/9999,/" file.csv Заменяет первое поле на 9999 в CSV-файле
s/^ *\(.*[^ ]\) *$//\1//; s/" *, */"//g; : loop s// *\([^",/][^,/]*\) *, *//\1//g; s// *, *//\1//g; t loop s/ *////g; s// *///g; s/^/\(.*\)/$/\1/; Скрипт sed для конвертирования CSV-файла в файл с вертикальной чертой в качестве разделителя (работает только с некоторыми типами CSV, со встроенными кавычками и запятыми).
sed ":a;s/\(^\/[^0-9.]\)\(\+\)\(\{3\}\)/\1\2,\3/g;ta" file.txt Меняет формат чисел в file.txt с 1234.56 на 1.234.56
sed -r "s/\<(reg/exp)+/\U&/g" Переводит любое слово, начинающееся с reg или exp в верхний регистр.
sed "1,20 s/Johnson/White/g" file.txt Производит замену Johnson на White только в строках 1 - 20.
sed "1,20 !s/Johnson/White/g" file.txt Предыдущий пример наоборот (заменяет везде, кроме строк 1-20)
sed "/from/,/until/ { s/\ /magenta/g; \ s/\ /cyan/g; }" file.txt Заменяет только между "from" и "until"
sed "/ENDNOTES:/,$ { s/Schaff/Herzog/g; \ s/Kraft/Ebbing/g; }" file.txt Заменяет только со слова "ENDNOTES:" и до EOF
sed "/./{H;$!d;};x;/regex/!d" file.txt Печатает абзац только если он содержит regex
sed -e "/./{H;$!d;}" -e "x;/RE1/!d;/RE2/!d;/RE3/!d" file.txt Печатает абзацы только если они содержат RE1, RE2 и RE3
sed "s/14"/fourteen inches/g" file.txt Так вы сможете использовать двойные кавычки
sed "s/\/some\/UNIX\/path/\/a\/new\/path/g" file.txt Работа с путями Unix
sed "s///g" file.txt Удаляет все символы, начиная с a и заканчивая g из файла file.txt
sed "s/\(.*\)foo/\1bar/" file.txt Заменяет только последнее соответствие foo на bar
sed "1!G;h;$!d" Замена команды tac
sed "/\n/!G;s/\(.\)\(.*\n\)/&\2\1/;//D;s/.//" Замена команды rev
sed 10q file.txt Замена команды head
sed -e:a -e "$q;N;11,$D;ba" \ file.txt Замена команды tail
sed "$!N; /^\(.*\)\n\1$/!P; D" \ file.txt Замена команды uniq
sed "$!N; s/^\(.*\)\n\1$/\1/;\ t; D" file.txt Обратная команда (что эквивалентно uniq -d)
sed "$!N;$!D" file.txt Эквивалент tail -n 2
sed -n "$p" file.txt ... tail -n 1 (или tail -1)
sed "/regexp/!d" file.txt Эквивалент grep
sed -n "/regexp/{g;1!p;};h" file.txt Печатает строку, находящуюся перед первым соответствием регулярному выражению, но не включающую само соответствие
sed -n "/regexp/{n;p;}" file.txt Печатает строку, находящуюся после первого соответствия регулярному выражению, но не включающую само соответствие
sed "/pattern/d" file.txt Удаляет строки, соответствующие шаблону pattern
sed "/./!d" file.txt Удаляет все пустые строки из файла
sed "/^$/N;/\n$/N;//D" file.txt Удаляет все следующие друг за другом пустые строки, за исключением первых двух
sed -n "/^$/{p;h;};/./{x;/./p;}"\ file.txt Удаляет последнюю строку каждого абзаца
sed "/^$/q" Получает заголовок письма
sed "1,/^$/d" Получает тело письма
sed "/^Subject: */!d; s///;q" Получает тему письма
sed "s/^/> /" Цитирует сообщение, вставляя "> " перед каждой строкой
sed "s/^> //" Обратная команда (убирает цитирование из сообщения)
sed -e:a -e "s/<[^>]*>//g;/ Удаляет HTML-теги
sed "/./{H;d;};x;s/\n/={NL}=/g" file.txt / sort \ / sed "1s/={NL}=//;s/={NL}=/\n/g" Сортирует абзацы в file.txt в алфавитном порядке
sed "s@/usr/bin@&/local@g" path.txt Заменяет /usr/bin на /usr/bin/local в path.txt
sed "s@^.*$@<<<&>>>@g" path.txt Попробуйте и увидите:)
sed "s/\(\/[^:]*\).*/\1/g" path.txt При условии, что path.txt содержит $PATH, выводит только первый путь в каждой строке
sed "s/\([^:]*\).*/\1/" /etc/passwd Замена awk - показывает только пользователей из файла passwd
echo "Welcome To The Geek Stuff" / sed \ "s/\(\b\)/\(\1\)/g" (W)elcome (T)o (T)he (G)eek (S)tuff Понятно без объяснений
sed -e "/^$/,/^END/s/hills/\ mountains/g" file.txt Заменяет "hills" на "mountains", но только в блоках текста, начинающихся с пустой строки и заканчивающихся строкой с тремя символами "END", включительно.
sed -e "/^#/d" /etc/services / more Показывает файл services без закомментированных строк
sed "$s@\([^:]*\):\([^:]*\):\([^:]*\)@\3:\2:\1@g" path.txt Меняет порядок элементов в последней строке файла path.txt на обратный
sed "/regex/{x;p;x;}" file.txt Вставляет новую строку выше каждой строки, соответствующей регулярному выражению
sed "/AAA/!d; /BBB/!d; /CCC/!d" file.txt Ищет соответствие AAA, BBB и CCC в любом порядке
sed "/AAA.*BBB.*CCC/!d" file.txt Ищет соответствие AAA, BBB и CCC в заданном порядке
sed -n "/^.\{65\}/p" file.txt Печатает строки длиной 65 символов и более
sed -n "/^.\{65\}/!p" file.txt Печатает строки длиной 65 символов и менее
sed "/regex/G" file.txt Вставляет пустую строку под каждой строкой
sed "/regex/{x;p;x;G;}" file.txt Вставляет пустую строку над и под каждой строкой
sed = file.txt / sed "N;s/\n/\t/" Нумерует строки в file.txt
sed -e:a -e "s/^.\{1,78\}$/ &/;ta" file.txt Выровнять текст по правому краю
sed -e:a -e "s/^.\{1,77\}$/ &/;ta" -e "s/\(*\)\1/\1/" file.txt Выровнять текст по центру

6. Заключение

Это только часть того, что можно бы было рассказать о sed, но данная серия статей представляет собой скорее практическое руководство, которое, как мы надеемся, поможет вам оценить всю мощь утилит Unix и сделает вашу работу более эффективной.

Sed - лёгкий (бинарник весит всего 128 килобайт) и удобный инструмент обработки текста.

В этой статье я приведу несколько простых примеров использования sed и расскажу о его основных возможностях.

Sed получает входной поток данных или файл построчно, редактирует каждую строку согласно правилам, определённым в sed-скрипте, и затем выводит результат. Sed это тьюринг-полный язык программирования.

Формат команды sed

Команда sed имеет формат:

sed [ -n ] [ -e скрипт ] [ -f скрипт-файл ] [ файлы ]

Флаг -n подавляет вывод
-e - указывает на список инструкций, заданный в командной строке.
-f - указывает местонахождение файла-скрипта.

Формат команд редактирования

Скриптовый файл состоит из набора команд:

[ адрес [ , адрес ] ] команда [ аргументы ]

по одной в каждой строке.
Адреса это либо номера строк, либо специальные символы, либо регулярное выражение:

$ - последняя строка
начало~N - Каждая N -я строка, начиная с номера начало
/регулярное_выражение/ - строки, попадающие под регулярное_выражение
Примеры:

1~2 - Каждая вторая строка /REGEXP/ - все строки, в которых встречается /REGEXP/ 10,20 - строки с 10-й по 20-ю 10,+10 - строки с 10-й по 20-ю 5,~N - строки начиная с 5-й и до первой, кратной N 5,/REGEXP/ - строки, содержащие /REGEXP/ , после 5-й(не включая 5-ю)
  • Если адрес не указан, обрабатываются все строки.
  • Если указан один адрес - обрабатывается соответствующая строка
  • Если указаны два адреса, то выбираются строки в заданном интервале.
  • !команда - выполняется команда , для строк, которые небыли выбраны по адресам.

Основные команды

Рассмотрим основные команды:

[адрес] a текст - добавить новую строку с текстом после указанной строки

$ cat sed_test sed_test_1 11111 sed_test_2 22222 sed_test_3 33333 $ sed -e "2 a new_line" sed_test sed_test_1 11111 sed_test_2 22222 new_line sed_test_3 33333

[адрес [, адрес]] c текст - Удаляет выбранные строки и заменяет их на текст

$ sed -e "2 с new_line" sed_test sed_test_1 11111 new_line sed_test_3 33333 $ sed -e "/3/ с new_line" sed_test sed_test_1 11111 sed_test_2 22222 new_line

[адрес [, адрес]] d - Удаляет указанные строки.

$ sed -e "2 d" sed_test sed_test_1 11111 sed_test_3 33333 $ sed -e "2!d" sed_test sed_test_2 22222

[адрес] i текст - Вставить текст на место указанной строки.

$ sed -e "2 i new_line" sed_test sed_test_1 11111 new_text sed_test_2 22222 sed_test_3 33333

[адрес [, адрес]] p (с флагом -n ) выводит найденные строки.

$ sed -ne "2p" sed_test sed_test_2 22222

[адрес] q - выход из sed.

[адрес [, адрес]] r файл - Читает файл и выдает его содержание на выход.

[адрес [, адрес]] s/регулярное_выражение/замена/флаги - Заменяет регулярное_выражение на замена -у с учётом флагов:

  • g - во всей строке
  • i - без учёта регистра
  • p - выводить результат замены
$ sed -ne "s/t/T/g" sed_test sed_TesT_1 11111 sed_TesT_2 22222 sed_TesT_3 33333 $ sed -e "s//d/g" sed_test sed_test_d ddddd sed_test_d ddddd sed_test_d ddddd

[адрес [, адрес]] y/строка1/строка2/ - Заменяет все вхождения символов в строке1 соответсвующими символами из строки2 . Длины строк должны быть одинаковыми.

$ sed -ne "y/est/EST/g" sed_test SEd_TEST_1 11111 SEd_TEST_2 22222 SEd_TEST_3 33333

[адрес [, адрес]] { команды } - скобки группируют команды
[адрес] = - Выдаёт номера строк

Метки

: метка - сопоставить группе команд метку
b метка метка , если метка отсутствует, то переход в конец командного файла.

t метка - переход к команде, обозначенной меткой метка только после удачной замены с помощью команды s///

Цикл выполнения

sed работает с двумя буферами данных: основным и вспомогательным. Изначально оба буфера пусты.
Работа с этими буферами осуществляется при помощи команд:\\`h’, `H’, `x’, `g’, `G’ `D’ h - Заменить содержимое вспомогательного буфера содержимым основного
H - Добавить новую строку к вспомогательному буферу и затем добавить содержимое основного буфера к содержимому вспомогательного
x - Поменять содержимое обоих буферов местами
g - Заменить содержимое основного буфера содержимым вспомогательного
G - Добавить новую строку к основному буферу и затем добавить содержимое вспомогательного буфера к содержимому основного
D - Удалить текст основного буфера до следующего символа перевода строки
N - Добавить новую строку к основному буферу, затем добавить туда следующую обрабатываемую строку
P - Вывести содержимое основного буфера до следующего символа перевода строки.

Более сложные примеры

Следующий скрипт меняет местами строки файла (первые строки становятся последними и наоборот)

$ cat tac.sed #!/usr/bin/sed -nf # начиная со второй строки, содержимое буфера (который уже содержит # все предыдущие строки) добавляется к текущей строке. 1! G # при достижении последней строки - печатаем $ p # Заносим данные в буфер опять h sed -nf tac.sed sed_test sed_test_3 33333 sed_test_2 22222 sed_test_1 11111

Считаем строки файла (выводим номер последней строки)

$ cat count.sed #!/usr/bin/sed -nf $=

результат

$ sed -nf count.sed sed_test 3

Обращение строк

$ cat revers.sed #!/usr/bin/sed -f # пропускаем строки из одной буквы /../! b # Переворачиваем строку. Добавляем по пустой строке перед и после текущей. s/%$@~*!G4;:%#`.*$/\ &\ / # Переносим первый символ в конец # цикл работает пока в средней строке есть символы. tx:x s/\(\\n.\)\(.*\)\(.\\n\)/\\3\\2\\1/ tx #удаляем лишние переносы строк s/\\n//g

Этот скрипт перемещает две буквы за раз.

$ sed -f revers.sed sed_test 11111 1_tset_des 22222 2_tset_des 33333 3_tset_des

Дополнительная информация

Подробнее о формате sed-скриптов можно узнать, прочитав мануал man sed или техническую документацию info sed .

sed обрабатывает поток последовательно, строчка за строчкой, начиная с первой и кончая последней (конечно если в sed-скрипте не указано иного, например можно обрабатывать только первые строки, и завершить обработку после выполнения какого-нибудь условия), обычно каждая строка обрабатывается отдельно, в три этапа.

Важно

Нижеприведённая схема в дальнейшем будет часто упоминаться, к примеру "на первом этапе обработки строки" как раз и обозначает - первый этап из этой схемы.

Процедура 2.1. Обработка текста утилитой sed.

    На этом этапе строка загружается в буфер. Буфером называется выделенная sed область памяти, размер которой не ограничен (для GNU версии sed, ну конечно на практике размер ограничен объёмом оперативной, и swap-памяти).

    Загрузка заканчивается после чтения из потока символа новой строки (\n), или после завершения потока. При этом символ новой строки хотя и читается из потока, однако не пишется в буфер.

    Обработка строки.

    На этом этапе выполняется sed-скрипт, при этом содержимое буфера обычно изменяется. sed-скрипт состоит из особых sed-команд, каждая из которых представляет собой одну из букв латинского алфавита. Как обычно, малые и БОЛЬШИЕ буквы различаются: n и N это разные команды. Проще всего записывать sed-команды в командной строке, сразу после sed и её ключей, например:

    Sed -n "p;p;p"

    Для разделения команд используется точка с запятой (;).

    Предостережение

    Если вы пишете скрипты прямо после команды, то всегда заключайте их в одиночные "кавычки", дело в том, что только в этом случае оболочка не будет обрабатывать эти скрипты, в некоторых случаях допустимо использовать двойные кавычки, например если вы хотите внести внутрь скрипта shell-переменную, однако при этом будьте внимательны: shell попытается раскрыть многие служебные символы в вашем скрипте.

    Подсказка

    Если внутри скрипта вам необходимо использовать символ одиночной кавычки, то вы можете воспользоваться её шестнадцатеричным представлением: «\x27 » .

    Команды sed могут изменить содержимое буфера, но кроме того, как и в других языках программирования, в sed-скриптах можно применять команды условных и безусловных переходов (b , t , и T ), имеются также команды прерывания работы (q и Q ). Некоторые команды воздействуют не только на этап обработки строки, но и на другие этапы, кроме того, внутри скрипта можно ввести ещё одну или несколько строк из входного потока (как на первом этапе).

    Важно

    Нужно понимать, что sed работает с потоком, а не с файлом, она просматривает строки только последовательно, с начала и до конца. Потому невозможно прочитать десятую строку после двадцатой - если в этом есть необходимость, следует сохранить десятую строку во время её обработки. Так-же невозможно узнать, что данная строка является например предпоследней, не смотря на то, что вполне можно определить номер строки от начала потока. Можно выяснить, что данная строка является последней, но только в момент её обработки.

    Перед (почти)любой командой sed вы можете поставить адресное выражение, в таком случае, команда выполнится тогда, и только тогда, когда адресное выражение истинно. В качестве адресного выражения можно использовать

    Номер строки Тогда команда выполнится только для той строки, чей номер указан Диапазон номеров строк Команда выполнится для всех строк из указанного диапазона(диапазон указывается через запятую, вместо второго числа допустимо указывать `$", этот символ обозначает последнюю строку. Регулярное выражение

    Команда выполнится только если в буфере найдётся данное RE.

    Комбинированный диапазон.

    Можно создать и более сложное условие, к примеру от заданного RE, и до строки $ (до конца). Или от первого RE до второго (включительно).

    Замечание

    Строки в sed нумеруются с единицы. Сначала производится поиск строки, в которой есть совпадение с первым адресом диапазона, для этой строки выполняется команда. Начиная со следующей строки производится поиск второго адреса диапазона. Однако, для первой строки такое поведение можно изменить: если записать не `1,RE", а `0,RE", то регулярное выражение будет проверятся так-же и в первой строке.

    Подсказка

    Если вы хотите, что-бы одно адресное выражение действовало сразу не несколько команд, тогда заключите эти команды в {фигурные скобки}.

    Замечание

    Допустимы вложенные блоки, кроме того, допустимо внутри блока использовать адресные выражения в т.ч. и для вложенных блоков.

    Кроме написания скрипта сразу после команды, вы можете записать его в файл, для выполнения такого файла можно использовать опцию -f , например:

    $ sed -f my_script.sed test_file.txt

    Эта команда выполнит sed-скрипт my_script.sed для файла test_file.txt . Кроме того, используя sha-bang

    #!/bin/sed -f

    вы можете заставить исполнять ваши скрипты оболочку, например, если вы дописали в ваш скрипт в первую строку этот sha-bang, и кроме того у вас есть право выполнения этого скрипта, то прошлый пример можно выполнить так:

    $ ./my_script.sed test_file.txt

    Предостережение

    Первое время, я-бы рекомендовал записывать в файлы все sed-скрипты из тех, в которых более одной команды. Во первых их понять намного проще, во вторых они таким образом сохраняются, и в третьих их намного удобнее редактировать. Кроме того, в sed-файлах вы можете использовать любые кавычки. Следует так-же учесть, что некоторые команды необходимо записывать последними в строке, что часто невозможно, если строка одна. И наконец, в файле вы можете использовать комментарии, которые позволят вам быстро приспособить уже готовый скрипт для нового применения.
  1. Вывод буфера

    После завершения работы скрипта sed выводит содержимое буфера в выходной поток. Однако, это далеко не всегда необходимо, если вам это не нужно, воспользуйтесь опцией -n , которая блокирует вывод буфера. Кроме того, на этом же этапе происходит вывод и некоторой другой информации, если в скрипте выполнились команды a , c , и/или i . Эти команды тоже выводят информацию в выходной поток, но не во время исполнения, а в этом этапе. Существуют три команды (d , D и Q ), которые так-же подавляют вывод буфера на этом этапе.

Первые sed-скрипты.

Для начала изучения sed нам потребуется какой-нибудь простой текст, например этот:

Пример 2.1. Текст используемый для проверки скриптов.

Вы можете пожертвовать небольшую сумму яндекс-денег на счёт 41001666004238 для оплаты хостинга, интернета, и прочего. Это конечно добровольно, однако это намного улучшит данный документ (у меня будет больше времени для его улучшения). На самом деле, проект часто находится на грани закрытия, ибо никаких денег никогда не приносил, и приносить не будет. Вы можете мне помочь. Спасибо.

Утилита sed это мощный потоковый редактор текста с поддержкой регулярных выражений. С помощью sed вы можете заменять шаблоны текста (причем непосредственно в файле!), удалять строки (элементы массива), выводить подходящие по маске строки (подобно grep ). Редактор sed поддерживает применение нескольких команд и расширенный синтаксис регулярных выражений (при котором не нужно экранировать спец. символы).

В sed нет поддержки опережающих и ретроспективных проверок в регулярках! Для замены с использованием расширенного синтаксиса regex используйте:

Внимание!

В довольно проблемно работать с символом перевода строки! Самое удобное решение — это:

В качестве разделителей можно использовать любые символы (напрмиер: ,). Match части (которые внутри круглых скобок) доступны как, .

Опции утилиты:

Флаги строки-команды (указывать в конце маски):

Примеры

Фильтрация строк

Вывести строки 1-5:

Вывести файлы соответствующие маске:

Строки длиннее 80 символов:

Замена по шаблону

Вывести вхождения (matches ) через табуляцию:

Заменить названия файлов (composer на composer-dev ):

Заменить символы (regex):

Заменить URL в файле (штука в разделителях, и для замены в файле):

Заменить параметр в конфиге:

Удалить начальные пробелы (аналог ltrim ):

Удаление строк

Удалить из файла строку подходящую шаблону:

Удалить первую строку вывода:

Удалить строки от первой до соответствующей regex :

Заменить подстроку:

Примечание

По умолчанию необходимо экранировать все спец. символы в regex’ах, что крайне затрудняет чтение масок. Для того, чтобы экранировать спец.символы только в случае описания в тексте их самих — включите расширенный режим regex выражений с помощью опции.

Удалить пустые строки:

Удалить последние N=2 символа:

Извлечение подстрок

Вырезать / запомнить последние N=4 символа:

#sed, #regexp, #bash

Изучаем команды Linux: sed

Потоковый редактор SED

Sed - лёгкий (бинарник весит всего 128 килобайт) и удобный инструмент обработки текста.

В этой статье я приведу несколько простых примеров использования sed и расскажу о его основных возможностях.

Sed получает входной поток данных или файл построчно, редактирует каждую строку согласно правилам, определённым в sed-скрипте, и затем выводит результат. Sed это тьюринг-полный язык программирования.

Формат команды sed

Команда sed имеет формат:

sed [ -n ] [ -e скрипт ] [ -f скрипт-файл ] [ файлы ]

Флаг -n подавляет вывод
-e - указывает на список инструкций, заданный в командной строке.
-f - указывает местонахождение файла-скрипта.

Формат команд редактирования

Скриптовый файл состоит из набора команд:

[ адрес [ , адрес ] ] команда [ аргументы ]

по одной в каждой строке.
Адреса это либо номера строк, либо специальные символы, либо регулярное выражение:

$ - последняя строка
начало~N - Каждая N -я строка, начиная с номера начало
/регулярное_выражение/ - строки, попадающие под регулярное_выражение
Примеры:

1~2 - Каждая вторая строка /REGEXP/ - все строки, в которых встречается /REGEXP/ 10,20 - строки с 10-й по 20-ю 10,+10 - строки с 10-й по 20-ю 5,~N - строки начиная с 5-й и до первой, кратной N 5,/REGEXP/ - строки, содержащие /REGEXP/ , после 5-й(не включая 5-ю)
  • Если адрес не указан, обрабатываются все строки.
  • Если указан один адрес - обрабатывается соответствующая строка
  • Если указаны два адреса, то выбираются строки в заданном интервале.
  • !команда - выполняется команда , для строк, которые небыли выбраны по адресам.

Основные команды

Рассмотрим основные команды:

[адрес] a текст - добавить новую строку с текстом после указанной строки

[адрес [, адрес]] c текст - Удаляет выбранные строки и заменяет их на текст

[адрес [, адрес]] d - Удаляет указанные строки.

[адрес] i текст - Вставить текст на место указанной строки.

[адрес [, адрес]] p (с флагом -n ) выводит найденные строки.

[адрес] q - выход из sed.

[адрес [, адрес]] r файл - Читает файл и выдает его содержание на выход.

[адрес [, адрес]] s/регулярное_выражение/замена/флаги - Заменяет регулярное_выражение на замена -у с учётом флагов:

  • g - во всей строке
  • i - без учёта регистра
  • p - выводить результат замены

[адрес [, адрес]] y/строка1/строка2/ - Заменяет все вхождения символов в строке1 соответсвующими символами из строки2 .

Длины строк должны быть одинаковыми.

[адрес [, адрес]] { команды } - скобки группируют команды
[адрес] = - Выдаёт номера строк

Метки

: метка - сопоставить группе команд метку
b метка метка , если метка отсутствует, то переход в конец командного файла.

t метка - переход к команде, обозначенной меткой метка только после удачной замены с помощью команды s///

Цикл выполнения

sed работает с двумя буферами данных: основным и вспомогательным. Изначально оба буфера пусты.
Работа с этими буферами осуществляется при помощи команд:\\`h’, `H’, `x’, `g’, `G’ `D’ h - Заменить содержимое вспомогательного буфера содержимым основного
H - Добавить новую строку к вспомогательному буферу и затем добавить содержимое основного буфера к содержимому вспомогательного
x - Поменять содержимое обоих буферов местами
g - Заменить содержимое основного буфера содержимым вспомогательного
G - Добавить новую строку к основному буферу и затем добавить содержимое вспомогательного буфера к содержимому основного
D - Удалить текст основного буфера до следующего символа перевода строки
N - Добавить новую строку к основному буферу, затем добавить туда следующую обрабатываемую строку
P - Вывести содержимое основного буфера до следующего символа перевода строки.

Более сложные примеры

Следующий скрипт меняет местами строки файла (первые строки становятся последними и наоборот)

Считаем строки файла (выводим номер последней строки)

результат

Обращение строк

Этот скрипт перемещает две буквы за раз.

Дополнительная информация

Подробнее о формате sed-скриптов можно узнать, прочитав мануал man sed или техническую документацию info sed .

Вернуться к оглавлению

02.02.2013

Разложение строк средствами Bash в примерах (parameter expansions)

(Использовались материалы [ 1] [ 2] и [ 3])

Для работы над строками средствами Bash используются параметры разложения (parameter expansions ) Описание этого принципа можно найти в в пункте.
Описание трудновато для понимания. Намного проще понять принцип работы на примерах.

1. Удаление символов в начале или в конце строки

Любой одиночный символ обозначается как

Зададим переменную

$ STRING=aabbcc $ echo ${STRING} aabbcc Для удаления символов в начале строки используем команды: $ echo ${STRING#?} abbcc $ echo ${STRING#???} bcc для удаления символов в конце строки: $ echo ${STRING%?} aabbc $ echo ${STRING%???} aab Что бы запомнить, когда применять знак, а когда используют вот такой оригинальный способ:
Символы располагаются на клавиатуре последовательно и:
— слева от, означает с начала строки
— справа от, означает до конца строки

2. Удаление регулярных выражений в начале или в конце строки

Регулярные выражения (regular expressions или RegExp, regex) — это строка-шаблоном или «маска» задающая правило поиска.

Снова зададим переменную

$ STRING=GNULinux $ echo ${STRING} GNULinux удаляем регулярное выражение в начале строки: $ echo ${STRING#GNU} Linux удаляем регулярное выражение в конце строки: $ echo ${STRING%Linux} GNU Теперь тоже самое, но используя «*» (астериск)
удаляем регулярное выражение в начале строки (): $ echo ${STRING#*U} Linux удаляем регулярное выражение в конце строки (): $ echo ${STRING%L*} GNU

Использование регулярных выражений может быть скомбинировано с «?» (знаком любого символа) ():

$ echo ${STRING%??n*} GNU

3. Использование сдвоенных ## и %%

Если при удалении из строки регулярных выражений (*regex или regex*), при использовании «#» и «%» с «*» — удаление идёт до первого вхождения регулярного выражения , то при использовании сдвоенных «##» и «%%» — до последнего:

И снова зададим переменную

$ STRING=abcdcba $ echo ${STRING} abcdcba STRING=abcdcba ${STRING#*c} dcba ${STRING##*c} ba ${STRING%c*} abcd ${STRING%%c*} ab $ echo ${STRING#*c} dcba $ echo ${STRING##*c} ba $ echo ${STRING%c*} abcd $ echo ${STRING%%c*} ab

4.

Шпаргалка по sed

Поиск и замена

Замена первого вхождения

Глобальная замена

$ STRING=»abracadabra» $ echo «${STRING/a/O}» Obracadabra $ echo «${STRING//a/O}» ObrOcOdObrO $ echo «${STRING/#a/O}» Obracadabra $ echo «${STRING/%a/O}» abracadabrO $ echo «${STRING/a/}» bracadabra $ echo «${STRING//a/}» brcdbr

5. Извлечение подстроки используя смещение и длину

Смещение от края строки

Длина подстроки

5.1 Смещение при положительных значениях

При положительных значениях смещения первому символу строки соответствует значение «».

Примеры с положительными значениями: $ STRING=»Debian Gentoo RedHat» $ echo ${STRING:0:6} Debian $ echo ${STRING:14} RedHat $ echo ${STRING:7:6} Gentoo
5.2 Смещение при отрицательных значениях

При отрицательных значениях отсчёт ведётся от конца строки, а последнему символу строки соответствует значение равное «».

Для записи отрицательного смещения между двоеточием и знаком минус нужно оставлять пробел или брать отрицательное значение в круглые скобки.

Если не задана, то длина подстроки автоматически продляется до конца.

Примеры с отрицательными значениями: $ STRING=»Debian Gentoo RedHat» $ echo ${STRING: -6} RedHat $ echo ${STRING:(-6)} RedHat $ echo ${STRING:(-6):3} Red $ echo ${STRING:(-6):10} # длина превышает смещение RedHat
5.3 Отрицательные значения.

Если принимает отрицательное значение, то она работает как смещение от конца строки. Результатом будет подстрока между первым и вторым смещениями:

$ STRING=»Debian Gentoo RedHat» $ echo ${STRING:7:-7} Gentoo $ echo ${STRING:(-14):-7} Gentoo

Как всё это применить на практике:

Ниже представлены различные варианты кода для смены расширения с на при пакетном перекодировании аудио файлов: for i in *.wav; do lame «$i» «${i%???}mp3»; done; for i in *.wav; do lame «$i» «${i%wav}mp3»; done; for i in *.wav; do lame «$i» «${i%.*}.mp3»; done; for i in *.wav; do lame «$i» «${i/wav/mp3}»; done; for i in *.wav; do lame «$i» «${i:0:-3}mp3»; done;

6. Подсчёт количества символов в строке

$ STRING=»Подсчёт количества символов в строке» $ echo ${#STRING} 36
Узнать количество символов в файле: $ ARRAY=(`cat file.html`) $ echo ${#ARRAY[@]} 1158

Здесь нужно отметить, что файл читается не просто в переменную, а в массив, так как он состоит из нескольких строк. Поэтому для правильного подсчёта необходимо ставить. Если этого не сделать, то команда прочитает только первую строку из файла:

$ ARRAY=(`cat file.html`) $ echo ${#ARRAY} 7 И правда, первая строка содержит лишь тег и символ перевода строки виндовс () — и того 7 символов.

7. Изменение регистра символов

Переводит первый символ в верхний регистр

Переводит все символы в верхний регистр

Переводит первый символ в нижний регистр

Переводит все символы в нижний регистр

Инвертирует регистр первого символа

Инвертирует регистр всех символов

Теги: Linux, bash, shell, regular expressions, parameter expansions, RegExp, regex, length, offset, for, in, do. lame, done, *.wav, mp3, CR+LF, регулярные выражения, шаблон, поиск, переменная, массив, строка, символы, верхний, нижний, регистр

Последние материалы раздела:

Файловая система RAW и как вернуть NTFS, FAT32 Система не видит файловую систему жесткого диска
Файловая система RAW и как вернуть NTFS, FAT32 Система не видит файловую систему жесткого диска

Современные накопители на основе флеш-памяти имеют большие объёмы и высокую скорость чтения-записи, благодаря новому протоколу передачи данных USB...

VLC Media Player скачать бесплатно для windows русская версия Скачать последнюю версию проигрывателя vlc
VLC Media Player скачать бесплатно для windows русская версия Скачать последнюю версию проигрывателя vlc

Среди списков программ, которые обязательны для установки на любой компьютер, обсуждение медиапроигрывателей вызывает наиболее бурные дискуссии....

Призма Как скачать приложение prisma на андроид
Призма Как скачать приложение prisma на андроид

Упоминая про фоторедакторы, способные работать не только на компьютерах, но и на мобильных устройствах, стоит назвать еще одну программу - Prisma....