Вы здесьПо рукам надавать за такое разпознавание текста
Опубликовано сб, 14/03/2009 - 11:54 пользователем Psychedelic
Вот есть книга http://lib.rus.ec/b/141245 Цитата:
Как только начинашь перевод в fb2, начинаются сущие мучения, т.к. автомат не подхватывает 80% текста.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Iron Man RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 40 мин.
Isais RE:Багрепорт - 2 17 часов konst1 RE:Файнридер для Win11 1 день Океана RE:Подайте бедному копеечку на книжку с литреса... 8 часов larin RE:Оплатил, но абонемент не отображается 3 дня sem14 RE:Книжная серия «Сlio» издательства "Евразия" 6 дней Isais RE:Национальный конкурс на лучшее литературное произведение... 6 дней Isais RE:Детство, опаленное войной (Вторая мировая 1939-1945 и ВОВ) 6 дней sem14 RE:Современная корейская литература. Книжная серия... 1 неделя sem14 RE:«Морской роман» — книжная серия Калининградского книжного... 1 неделя larin RE:Оплатил,но абонемент не отображается 1 неделя larin RE:Оплатил, но абонемент не отображается 1 неделя sd RE:Fishing 1 неделя Алексей111111111111 RE:Оплатила,но абонемент не отображается 1 неделя sd RE:Доступ 27 2 недели kopak RE:Беженцы с Флибусты 2 недели Isais RE:Вадим Иванович Туманов - Всё потерять - и вновь начать с... 2 недели Isais RE:Семейственность в литературе 2 недели Впечатления о книгах
Barbud про Ланцов: Железный лев (Альтернативная история, Социальная фантастика, Попаданцы, Самиздат, сетевая литература)
02 08 Тетушки, в первой половине XIX века употребляющие названия "ацетон" и "серная кислота" - явный анахронизм, тогда эти вещества назывались по-другому. А так вообще - типичная махровая ланцовщина. ГГ круче каленых яиц, всяких ……… Оценка: плохо
mysevra про Блэквуд: Вендиго [сборник litres] (Ужасы, Фэнтези, Городское фэнтези)
02 08 Чувствуется несовременность текста: деликатность в описании, сдержанность и отсутствие показной кровожадности. Оценка: хорошо
mysevra про Кинг: Долгая прогулка [The Long Walk ru] (Социальная фантастика)
02 08 Ого, меня проняло. Это же надо уметь так излагать (да и переводить тоже). Хорошая история, заставляет задуматься, не зря включена в список ALA. Оценка: отлично!
mysevra про Пиккирилли: Осколки [The Shards ru] (Ужасы, Триллер)
02 08 С ужасами здесь не густо. Скорее вялотекущий «крутой детектив», в котором главный герой с тёмным прошлым спит с красавицами и мутит – по его же словам – воду. Не хватает многозначительной сцены на пирсе в дождливую ночь под звуки саксофона. Оценка: хорошо
Aleks_Sim про Стопичев: СВО. Босиком по стеклу (Современная проза, Публицистика, О войне)
01 08 Русским, где бы они не жили никто не мешает, а вот бандеровцам мешают - поляки, венгры, сербы и конечно русские... Оценка: отлично!
Perca про Шаргородский: Защитник феи [СИ] (Городское фэнтези, Самиздат, сетевая литература)
01 08 Даже не верится, что Шаргородский закончил хоть одну серию! Щось у лісі здохло... Оценка: хорошо
дядя_Андрей про Крусанов: Совиная тропа [litres] (Историческая проза, Современная проза)
31 07 А, что, разве десятые тоже были "ревущие", как девяностые?
Лысенко Владимир Андреевич про Стопичев: СВО. Босиком по стеклу (Современная проза, Публицистика, О войне)
31 07 Как и во все времена русским весь мир мешает, были бы в мире одни русские все было хорошо, а то весь мир против русских. Оценка: нечитаемо
miri.ness_ про Катаев: Трава забвенья (Биографии и Мемуары)
30 07 Да, "Трава забвения" - отличная книга, как и "Алмазный мой венец", обложка от которого есть, а книги в этой раздаче нет. Как-то непонятно, какую третью повесть кто-то имел в виду: "Святой колодец" или "Уже написан Вертер"? ……… Оценка: отлично!
Олег Макаров. про Илья Городчиков
30 07 Удивительное отсутствие у автора умения согласовывать предложения. Невозможно читать
epoost про Спрингер: Энола Холмс и маркиз в мышеловке [The Case Of The Missing Marquess] (Детская проза)
30 07 Данная книга представлена в формате фото и нуждается в OCR и конвертации в формат FB2.
Никос Костакис про Петр Алмазный
29 07 Nicout, не будем спорить, был ли доступен автору приведенный вами список "гранита науки". Вполне достаточно того, что тост шашлычника из "Кавказской пленницы" ("Так випьем за кибэрнэтикэ!") был услышан каждым обывателем ……… |
Комментарии
Отв: По рукам надавать за такое разпознавание текста
А я и не занл, что там есть такая галка. Наверное, по умолчанию она выключена. Или это зависит от того, в каком формате сохранять распознанный текст.
Отв: По рукам надавать за такое разпознавание текста
В девятом FR можно выбирать вручную разные опции сохранения при сохранении в разных форматах. Там много разнополезного можно сделать, а так же можно создавать свои шаблоны.
Отв: По рукам надавать за такое разпознавание текста
Не торопитесь паниковать. Для FBE давно существует отличный скрипт, как раз для такого случая ;)
http://home.doramail.com/Snout/Files/abruption_killing.rar
Как разложить файлы скрипта по папкам.
1. js-файл следует разместить в папке CMD, выбранной в настройках FBE.
2. htm-файлы в папке CMD редактора, чей exe-файл будете запускать.
3. css-файлы в поддиректории CSS каталога редактора, чей exe-файл будете запускать. Вместо "удаление разрывов_main.css" можно подложить main.css от вашего FBE (если вы стили настраивали под себя).
Запускать со следующими настройками:
а) галки "ручной выбор" отовсюду убрать, ибо заколебаетесь, да и скрипт будет работать около часа.
б) Маленькая буква | маленькая буква - соединить через пробел
в) тире или дефис, перед которым непробельный символ | любой символ - соединить без пробела,сохранив тире\дефис
г) запятая | любой символ - соединить через пробел.
д) остальное поставьте нетрогать.
Благодарим товарища Sclex с форума www.fictionbook.org
Отв: По рукам надавать за такое разпознавание текста
Пара часов на эксперименты с FineReader-ом, обучение и пополнение пользовательского шаблона и можно достичь удивительных результатов в OCR, впоследствии экономящих гораздо большее время. Если же потратить еще некоторое время на знакомство с макросами MS Word, и изучение FBE со скриптами уважаемого Sclex-а - и изготовление книги превратится в элементарное дело :-)
P.S. Самое сложное в OCR, imho - это тщательная вычитка.
Отв: По рукам надавать за такое разпознавание текста
Не то, чтобы сложное, но трудоемкое и утомительное. Но можно сочетать приятное с полезным: одновременно читать и вычитывать. Т.е. удержаться от соблазна прочитать книгу перед оцифровкой. А если еще делать все это не вставая с дивана, да под хорошую музыку - то и вообще вполне себе не утомительно :)
Отв: По рукам надавать за такое разпознавание текста
Я всегда так и вычитывал. Только не на диване, а за столом (люблю нормальный монитор и клаву), и без музыки - не могу под нее даже просто читать, отвлекает. Или одно, или другое ;).
Отв: По рукам надавать за такое разпознавание текста
Это смотря какая музыка. Если, скажем, на 1.FM включить Otto's Baroque Musick - отлично работается.
Отв: По рукам надавать за такое разпознавание текста
Вообще-то такая хрень (извините) легко убирается в Word'e - поиск/замена символов дефис+перевод строки на ничего. После чего остаются сущие пустяки для ручной правки. Открою еще страшную тайну: в Word'e легко делать макросы, которые пишутся на языке WBA, а с ними можно такое натворить... Например, я приводил в свое время, как учебное, такое задание: вставить 3 пробела в начале любой строки текста, в которой встречается частица "не" (это очень простой пример, для чайников, так что прошу не кидать камнями ;). Про язык WBA, кстати, говорится больше для понта, а в действительности отлично написать макрос можно, и совершенно не владея этим языком, и даже не зная о его существовании ;D. Во всяком случае, это в разы проще, чем делать валидные fb2, или даже просто хорошо отсканировать книгу. Так что, ИМХО, нет ни малейшего смысла заново распознавать текст, разве что из любви к искусству и FR ;))).
Отв: По рукам надавать за такое разпознавание текста
Вы не поверите, но язык этот называется VBA. Потому что сокращение от Visual Basic for Applications, а вовсе не World Boxing Association.
P.S. Продвинутые какие у нас специалисты по вирусам и троянам пошли..
P.P.S. Кстати VBA в русской раскладке дает МИФ. Что отлично этому языку подходит :)
Отв: По рукам надавать за такое разпознавание текста
Не придирайтесь так к очепяткам ;), я преподавал этот язык лет 10 назад :(, нетрудно и правда забыть название ;D. МИФ - хорошо! Понравилось! Возьму на вооружение в следующей жизни, если снова буду заниматься тем же ;). Но должен заметить, что тот же VBA в Excel'e - уже не совсем миф, а больше похож на настоящий... Как-то пришлось на нем даже написать программку для регистрации постояльцев в гостинице, включая стстистику, выписку счетов и т.п. Было интересно!
Отв: По рукам надавать за такое разпознавание текста
Не легко, т.к. остаются другие фразы, которые идут без дефиса - таких кстати большинство.
Я распознал по новой, заняло это 15 мин с указанием картинок (вы бы не справились за 15 мин с убиранием этих переводов строк, это заняло бы как минимум 4 часа). Скан хороший, потому ошибок почти нет.
Отв: По рукам надавать за такое разпознавание текста
ФБД с включенной галкой re-format completely приводит такие тексты в нормальный вид секунд за 20...
Уже сколько их таких обработано - не сосчитать...
OCR pad опять же есть сто лет в обед.
Отв: По рукам надавать за такое разпознавание текста
Вы думаете я не делал этого? Делал, но посмотрев что получилось, я подумал что намного быстрее будет сделать распознавание по новой.
По пробуйте сделать то что вы предложили, увидите результат.
Отв: По рукам надавать за такое разпознавание текста
Вы думаете, я не делал этого? ))
Я не предлагаю, не проверив сначала. Нет такой привычки советовать не проверенное лично.
К сожалению, исходника дежавю или pdf под рукой не было, потому и увидеть, что там не так с Вашей точки зрения, не могу.
Отв: По рукам надавать за такое разпознавание текста
Закончил книгу. Читаем : http://lib.rus.ec/b/142243
Там проблема со сносками. Дело в том что в doc что в djvu - текст уже был распознан (потом закручен в djvu) и некоторые сноски были повреждены.
Там в конце идут сноски, и перед словом ставиться номер этой сноски. так вот половина номеров толком не распознались (именно в исходном документе - djvu или doc - там они уже "повреждены") - поэтому непонятно какая сноска - где..