Вы здесьПо рукам надавать за такое разпознавание текста
Опубликовано сб, 14/03/2009 - 11:54 пользователем Psychedelic
Вот есть книга http://lib.rus.ec/b/141245 Цитата:
Как только начинашь перевод в fb2, начинаются сущие мучения, т.к. автомат не подхватывает 80% текста.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
edvud RE:Подайте бедному копеечку на книжку с литреса... 16 часов
bmusanov Оплатил, но абонемент не отображается 2 дня holla RE:Багрепорт - 2 2 дня sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 3 дня konst1 RE:Файнридер для Win11 5 дней larin RE:Оплатил, но абонемент не отображается 1 неделя sem14 RE:Книжная серия «Сlio» издательства "Евразия" 1 неделя Isais RE:Национальный конкурс на лучшее литературное произведение... 1 неделя Isais RE:Детство, опаленное войной (Вторая мировая 1939-1945 и ВОВ) 1 неделя sem14 RE:Современная корейская литература. Книжная серия... 1 неделя sem14 RE:«Морской роман» — книжная серия Калининградского книжного... 1 неделя larin RE:Оплатил,но абонемент не отображается 1 неделя sd RE:Fishing 2 недели Алексей111111111111 RE:Оплатила,но абонемент не отображается 2 недели sd RE:Доступ 27 2 недели kopak RE:Беженцы с Флибусты 2 недели Isais RE:Вадим Иванович Туманов - Всё потерять - и вновь начать с... 3 недели Isais RE:Семейственность в литературе 3 недели Впечатления о книгах
DGOBLEK про Чепижный: Гагаи. Том 1 (Советская классическая проза)
07 08 о людях донецкого села Крутой Яр ----------------------------------------- нету Крутого Ярауже ....русские с лица земли стерли(
dolle про Мусаниф: Другие грабли. Том 3 [СИ] (Альтернативная история, Боевик, Попаданцы, Самиздат, сетевая литература)
05 08 Можно прочесть вбоквелл физрука. Можно и не читать , ничего не потеряете. Оценка: хорошо
дядя_Андрей про Азимов: Я люблю маленькую киску (Юмористическая фантастика)
04 08 А почему "морально устаревший"? Вполне милый рассказец в духе раннего Марка Твена. Главному герою, конечно нужно посочувствовать. Но не меньшее сочувствие вызывает и Киска. А в целом вполне читабельно и вызывает улыбку. Оценка: отлично!
decim про Азимов: Я люблю маленькую киску (Юмористическая фантастика)
04 08 Необязательный рассказец, морально устаревший лет уж 50 назад. Оценка: плохо
obivatel про Волшебник
04 08 Читабельно, ненапряжно, завлекательно. Причин развала страны масса, не указано ни одной, это типичная "окопная правда". Ну и пусть: это не историческая работа, я "благие пожелания автора из его окопа", я не против. С учетом ………
DiSp про Лорд Системы
03 08 Хорошая серия. Любителям почитать, как герои-попаданцы с нуля налаживают быт, а потом развивают себя и общество до высот, о которых сперва и мечтать не могли - самое то. Слог хороший, юморной. И нет излишней жести и жестокости. ГГ удаётся остаться человеком.
udrees про Лей: Инвазия 3 (Боевая фантастика, Ужасы, Фантастика: прочее, Самиздат, сетевая литература)
03 08 Наверное это завершение трилогии про новых ксеноморфов. Вторая книга растянулась на две части. Вот в этой книге автор описывает продолжение борьбы с монстрами. Получается плохо, несмотря на все технические навороты, наличие ……… Оценка: неплохо
udrees про Вальтер: Точка невозврата (Боевая фантастика, Космическая фантастика, Самиздат, сетевая литература)
03 08 Я так понял это завершение трилогии про Элпис. Мне казалось, что третья книга будет еще слабее чем вторая, но надо сказать, что получилось наоборот. Описания достаточно красочные, до самого конца сюжет кажется предсказуемым, ……… Оценка: хорошо
udrees про Михайлов: Ярость бога [повесть] (ЛитРПГ)
03 08 Прикольный рассказ из мира Вальдиры. Короткий, смешной, увлекательный. Оценка: хорошо
udrees про Михайлов: Кроу [СИ] (ЛитРПГ, Самиздат, сетевая литература)
03 08 Хорошо написанная книга в жанре литРПГ, не сильно перегруженная статами персонажа и эффектами от артефактов. Да и вообще в книге совсем мало боевых эпизодов и приключений, как ни странно. Можно даже сказать, что это симулятор ……… Оценка: хорошо
udrees про Варламова: С ума сойти! Путеводитель по психическим расстройствам для жителя большого города (Психология, Психотерапия и консультирование)
03 08 Хорошая книга, написанная популярным языком про основные психические заболевания, можно многое почерпнуть про самые различные состояния, какие у них симптомы, кому грозит «шиза» и как ее лечить. Из книги я узнал, что шизофрения ……… Оценка: хорошо
Barbud про Ланцов: Железный лев (Альтернативная история, Социальная фантастика, Попаданцы, Самиздат, сетевая литература)
02 08 Тетушки, в первой половине XIX века употребляющие названия "ацетон" и "серная кислота" - явный анахронизм, тогда эти вещества назывались по-другому. А так вообще - типичная махровая ланцовщина. ГГ круче каленых яиц, всяких ……… Оценка: плохо |
Комментарии
Отв: По рукам надавать за такое разпознавание текста
А я и не занл, что там есть такая галка. Наверное, по умолчанию она выключена. Или это зависит от того, в каком формате сохранять распознанный текст.
Отв: По рукам надавать за такое разпознавание текста
В девятом FR можно выбирать вручную разные опции сохранения при сохранении в разных форматах. Там много разнополезного можно сделать, а так же можно создавать свои шаблоны.
Отв: По рукам надавать за такое разпознавание текста
Не торопитесь паниковать. Для FBE давно существует отличный скрипт, как раз для такого случая ;)
http://home.doramail.com/Snout/Files/abruption_killing.rar
Как разложить файлы скрипта по папкам.
1. js-файл следует разместить в папке CMD, выбранной в настройках FBE.
2. htm-файлы в папке CMD редактора, чей exe-файл будете запускать.
3. css-файлы в поддиректории CSS каталога редактора, чей exe-файл будете запускать. Вместо "удаление разрывов_main.css" можно подложить main.css от вашего FBE (если вы стили настраивали под себя).
Запускать со следующими настройками:
а) галки "ручной выбор" отовсюду убрать, ибо заколебаетесь, да и скрипт будет работать около часа.
б) Маленькая буква | маленькая буква - соединить через пробел
в) тире или дефис, перед которым непробельный символ | любой символ - соединить без пробела,сохранив тире\дефис
г) запятая | любой символ - соединить через пробел.
д) остальное поставьте нетрогать.
Благодарим товарища Sclex с форума www.fictionbook.org
Отв: По рукам надавать за такое разпознавание текста
Пара часов на эксперименты с FineReader-ом, обучение и пополнение пользовательского шаблона и можно достичь удивительных результатов в OCR, впоследствии экономящих гораздо большее время. Если же потратить еще некоторое время на знакомство с макросами MS Word, и изучение FBE со скриптами уважаемого Sclex-а - и изготовление книги превратится в элементарное дело :-)
P.S. Самое сложное в OCR, imho - это тщательная вычитка.
Отв: По рукам надавать за такое разпознавание текста
Не то, чтобы сложное, но трудоемкое и утомительное. Но можно сочетать приятное с полезным: одновременно читать и вычитывать. Т.е. удержаться от соблазна прочитать книгу перед оцифровкой. А если еще делать все это не вставая с дивана, да под хорошую музыку - то и вообще вполне себе не утомительно :)
Отв: По рукам надавать за такое разпознавание текста
Я всегда так и вычитывал. Только не на диване, а за столом (люблю нормальный монитор и клаву), и без музыки - не могу под нее даже просто читать, отвлекает. Или одно, или другое ;).
Отв: По рукам надавать за такое разпознавание текста
Это смотря какая музыка. Если, скажем, на 1.FM включить Otto's Baroque Musick - отлично работается.
Отв: По рукам надавать за такое разпознавание текста
Вообще-то такая хрень (извините) легко убирается в Word'e - поиск/замена символов дефис+перевод строки на ничего. После чего остаются сущие пустяки для ручной правки. Открою еще страшную тайну: в Word'e легко делать макросы, которые пишутся на языке WBA, а с ними можно такое натворить... Например, я приводил в свое время, как учебное, такое задание: вставить 3 пробела в начале любой строки текста, в которой встречается частица "не" (это очень простой пример, для чайников, так что прошу не кидать камнями ;). Про язык WBA, кстати, говорится больше для понта, а в действительности отлично написать макрос можно, и совершенно не владея этим языком, и даже не зная о его существовании ;D. Во всяком случае, это в разы проще, чем делать валидные fb2, или даже просто хорошо отсканировать книгу. Так что, ИМХО, нет ни малейшего смысла заново распознавать текст, разве что из любви к искусству и FR ;))).
Отв: По рукам надавать за такое разпознавание текста
Вы не поверите, но язык этот называется VBA. Потому что сокращение от Visual Basic for Applications, а вовсе не World Boxing Association.
P.S. Продвинутые какие у нас специалисты по вирусам и троянам пошли..
P.P.S. Кстати VBA в русской раскладке дает МИФ. Что отлично этому языку подходит :)
Отв: По рукам надавать за такое разпознавание текста
Не придирайтесь так к очепяткам ;), я преподавал этот язык лет 10 назад :(, нетрудно и правда забыть название ;D. МИФ - хорошо! Понравилось! Возьму на вооружение в следующей жизни, если снова буду заниматься тем же ;). Но должен заметить, что тот же VBA в Excel'e - уже не совсем миф, а больше похож на настоящий... Как-то пришлось на нем даже написать программку для регистрации постояльцев в гостинице, включая стстистику, выписку счетов и т.п. Было интересно!
Отв: По рукам надавать за такое разпознавание текста
Не легко, т.к. остаются другие фразы, которые идут без дефиса - таких кстати большинство.
Я распознал по новой, заняло это 15 мин с указанием картинок (вы бы не справились за 15 мин с убиранием этих переводов строк, это заняло бы как минимум 4 часа). Скан хороший, потому ошибок почти нет.
Отв: По рукам надавать за такое разпознавание текста
ФБД с включенной галкой re-format completely приводит такие тексты в нормальный вид секунд за 20...
Уже сколько их таких обработано - не сосчитать...
OCR pad опять же есть сто лет в обед.
Отв: По рукам надавать за такое разпознавание текста
Вы думаете я не делал этого? Делал, но посмотрев что получилось, я подумал что намного быстрее будет сделать распознавание по новой.
По пробуйте сделать то что вы предложили, увидите результат.
Отв: По рукам надавать за такое разпознавание текста
Вы думаете, я не делал этого? ))
Я не предлагаю, не проверив сначала. Нет такой привычки советовать не проверенное лично.
К сожалению, исходника дежавю или pdf под рукой не было, потому и увидеть, что там не так с Вашей точки зрения, не могу.
Отв: По рукам надавать за такое разпознавание текста
Закончил книгу. Читаем : http://lib.rus.ec/b/142243
Там проблема со сносками. Дело в том что в doc что в djvu - текст уже был распознан (потом закручен в djvu) и некоторые сноски были повреждены.
Там в конце идут сноски, и перед словом ставиться номер этой сноски. так вот половина номеров толком не распознались (именно в исходном документе - djvu или doc - там они уже "повреждены") - поэтому непонятно какая сноска - где..