Вы здесь(OMG!) Координация сканирования и вычитки - черт ногу сломает
Опубликовано пн, 05/08/2013 - 15:26 пользователем Psychedelic
Когда у меня есть свободное время, я сканирую\распознаю\верстаю fb2. Насколько я понимаю ЦЕЛЬ этой фичи - в том, чтобы быстро найти книжную работу - сканировать, распознать, вычитать, исправить битый fb2 итп. с регистрацией того, кто будет ее делать, а также для того, чтобы не пересекались работы, т.к. чтобы Вася не делал ту же книгу, что делает сейчас Петя. Возможно конечно преследовались другие цели, к примеру ТОЛЬКО сбор статистики работы - тогда да (сарказм), этот функционал полностью покрывает цель, т.к. сколько я не рылся, я видел только одну статистику - кто че сделал. Итак подробно: Первая ошибка в том, что фильтр (значение "любое" на все колонки) находит людей которые: Ок, давайте поиграемся с фильтром. Моя цель найти: 1. Готовый скан 2. Электронный текст НЕ в книжных форматах (doc, rtf). Итак после 5 минут трехэтажных натягиваний нервов (т.е. методом тыка, не того результата и снова тыка), я наконец понял как найти нужное.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
alexej36 RE:Подайте бедному копеечку на книжку с литреса... 2 дня
commodore RE:Письма 1 неделя Саша из Киева RE:Три минуты истории 1 неделя [email protected] RE:Как бы с этим побороться и побороть? 2 недели Саша из Киева RE:Книги на латышском языке 2 недели stevecepera RE:Список современных французских писателей? 4 недели etorus2008 RE:Отв: Помогите найти книгу по описанию 1 месяц lemma7 RE:Чёрный нимб и другие истории, исполненные неизъяснимого ужаса 1 месяц Wedmak RE:Помогите найти!.. #2 1 месяц sem14 RE:Координация сканирования и вычитки 1 месяц babajga RE:Кто сможет раздобыть и оцифровать нужные мне книги? 1 месяц Isais RE:Мои открытия 1 месяц kopak RE:О группе Дятлова. О той самой, того самого... 1 месяц A5. RE:Не присылает пароль на почту 1 месяц babajga RE:Плюмаж 2 месяца babajga RE:Блошкинс и Фрю. Опасное путешествие 2 месяца alexk RE:Багрепорт - 2 2 месяца babajga RE:Удивленная сова 2 месяца Впечатления о книгах
mysevra про Дембский: Властители ночи (Детективная фантастика)
09 06 Вот уж действительно «фантастическая авантюра». Для чтения в поездке – самое оно, на большее не претендует. Оценка: неплохо
mysevra про Симмонс: Горящий Эдем [Литрес] (Ужасы, Триллер)
09 06 Красотища-то какая! Этнофэнтези, да в таких роскошных декорациях. Тут тебе и кровища, и гавайский фольклор, и Марк Твен. Даже философско-социальные проблемы, составляющие канву всей истории, не портят повествование. Оценка: отлично!
mysevra про Корбут: Иван Царевич и серый морг (Ужасы, Триллер)
09 06 Интригующее начало, а дальше, до середины книги - ни о чём. Бросила. Оценка: плохо
Nicout про Акунин: Проснись! у(дис)топия (Социальная фантастика, Современная проза)
09 06 Брат-2 - Одно слово - румын! - Так он болгарин. - Да? Какая разница? (с) Если человек пишет "столько-же", "ту-же", "Ну-да" - с ним все ясно, ему что Мальдивы, что Мальвины...
decim про Эрнест: Города дыма и звёзд [litres] [Cities of Smoke and Starlightde ru] (О любви, Любовная фантастика)
07 06 Часто вы видите, как взрослый мужик - или взрослая баба - закатывает глаза? А ГГ только этим и занят. В подлиннике обычно то же самое: автору на большее не хватает фантазии. Фтопку. Оценка: плохо
nik_ol про Полякова: Одна тайная ставка (Детективы: прочее)
06 06 Ура! Спасибо, что выложили, заждалась новых книг) Оценка: хорошо
Саша из Киева про Акунин: Проснись! у(дис)топия (Социальная фантастика, Современная проза)
06 06 sapiens01 Конфликт между Аргентиной и Великобританией в 1982 году был не из-за Мальдив, а из-за Фолклендских (Мальвинских) островов. Фолклендскими эти острова называют британцы, а Мальвинскими - аргентинцы.
sapiens01 про Акунин: Проснись! у(дис)топия (Социальная фантастика, Современная проза)
05 06 Конфликт России и украины,значит ровно столько-же,как и конфликт Аргентины с Англией из-за Мальдив.После его завершения,он будет благополучно положен на ту-же полку военной истории.
nevskaya25 про Прилепин: Тума (Современная проза)
04 06 Лицо одряблело, как вчерашний холодец" - собственно, как и сама книга. Читается влет, осилила за несколько часов, на этом все достоинства исчерпываются, остается недоумение: "На кой это всё?" Нет ответа. Наоригинальничать ……… Оценка: плохо
дядя_Андрей про Хазанов: Россия, которую мы потеряли. Досоветское прошлое и антисоветский дискурс (История, Публицистика)
03 06 «Сибирский цирюльник» НЕ СТАЛ блокбастером в новейшей России Оценка: плохо
nik_ol про Платова: Увидимся в темноте (Детективы: прочее)
03 06 А где Виктория-то, она жива? Почему больше не пишет? Оценка: хорошо |
Комментарии
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
1) Оно, конечно, караул, но не караул-ужас-убивают. Гуманитарий (то бишь я) с двух пинков находит. Если не лень.
2) А варианты? Т.е. спасибо, что поделились эмоциями, но... других межсайтовых сервисов по информированию о верстке fb2 что-то не наблюдается. Будет где-то более удобная, дружелюбная и неглючная страничка с такой инфой - все будут ходить туда, http://lib.rus.ec/ocr тихо увянет; но пока же нет(?).
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Длинно как-то все.
Есть, наверно, минусы в координации. Почему бы не предложить решение по улучшению?
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Основная мысль сервиса: "я купил, покупаю, сканирую книгу. Ребята, если вам это интересно, то сообщаю об этом, можете не тратить деньги на эту же книгу, а купить другую. Но если вам нефиг делать, то покупайте такую же, фиг с вами, дублируйте мою работу". Деньги сэкономить и друг друга не дублировать - основная мысль. А по всем интересующим вас вопросам вы можете списаться в личку с человеком, нафигачившим статусы в карточке.
Отличный сервис, вообще-то. Чего не устраивает - не вкурил.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Хороший сервис, если разобраться:) Вообще можно поиграться ещё со ссылками напротив позиций: Книги в работе, Заказы, Статусы.
Например, нужны нулевые карточки без статусов. Смотрим позицию - Заказы, жмем, например, По поступлению и вуаля - http://lib.rus.ec/ocr/null
Получили список нулевых карточек. Можно и другие ссылки напротив позиции "Заказы" понажимать. Фильтры это для карточек со статусами.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Мысль хорошая, но этого не было в ТЗ при создании сервиса.
Обычно решалось и решается в личке. Без ОМГ и громких стенаний на форуме.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
А искать книги не в текстовых форматах для конвертации вообще не тут нужно. Они в книгах уже, и можно выбрать любой файл, скачать и конвертнуть. Если конечно его еще не конвертнули до.
Я в основном достаю и сканирую книги. И мне удобнее оставить статус, а не файл. Увидев статус Отсканировал, чел придет ко мне в личку и я адресно пошлю ему сканы. А не вывалю в пространство инета в надежде, что кто-нибудь когда-нибудь их возьмет в работу.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
1. Не надо вываливать куда-то. Нужно просто залить pdf\djvu (или на худой конец 7z пак с jpeg картинками, по размеру он еще меньше pdf) на либрусек в список книг автора - это в идеале.
Кстати ежедневно на либрусек заливается куча pdf книг. Найти их можно через поиск, логично и необходимо чтобы КСВ был связан с такими файлами. Человек интуитивно подразумевает связь с файлами сканов, когда видит КСВ.
Обращаться к кому то, чтобы выслали скан - это долго (пока человек прочитает, ответит, зальет - в среднем мин. сутки), у большинства свободное время есть сейчас, когда он зашел на либрусек, в поисках файла для работы (выходные например), вечером или завтра его уже может не быть.
А что с системой координации какая то другая надежда появляется? :) Все тоже - "в надежде что кто-нибудь когда-нибудь их возьмет в работу".
Понятно что КСВ+ файлы намного удобнее -- упорядоченная статистика с заявками + удобство работы и приоритеты (кто -то попросил вычитать fb2 или распознать pdf итп ) - чтобы работы не пересекались, иначе надежды нет.
Имхо тогда нужно написать так: Координация сканирования и вычитки (только статистика)..
Еще раз:
На данный момент эта фича реально полезна только тем, кто достает, они могут отследить заявки, выполнить их и отметиться - остальным же (сканировать\распознать\вычитать\сверстать) — только трата времени для добавления своей статистики в КСВ.
Трата - потому что средняя, ненаучная книга (с готового хорошего скана) делается за вечер (включая программную вычитку). Поэтому смысла регистрироваться на распознавание там нет.
Но КСВ служил бы хорошей системой для поиска приоритетных книг, которые нужно распознать\исправить (для поиска заявок).
P.s. Кстати, тот кто достает книгу, обычно ее и сканирует. Имхо пункты Достать\сканировать нужно объеденить, также как и пункты "могу достать" и "достаю".
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Я обычно сканирую книги, судьба которых мне не безразлична. Стало быть, если долго не найдется желающий забрать сканы, я сделаю их сама. Опять же, отдавая сканы одному человеку, я почти уверена, что книгу сделает он. Оставляя их в сети/библиотеке, я не знаю, кто их взял, взял ли кто. Многим (в т.ч. мне) лень отмечаться в карточках, так вполне возможна ситуация, что несколько человек скачают мои сканы и будут делать задвоенную работу. В общем, мне нравится так, как сейчас, с небольшими недостатками, но в целом все устраивает.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Напомню еще раз: в первую очередь, сервис создан для удобства и минимизации трат времени/денег сканировщиков, а не для тех, кто хочет "вотпрямщас" что-нибудь вычитать.
Чаще всего пдф остается сырым полуфабрикатом, потому-что книги на вычитку берут или уже распознанные, или в сканах. Перераспознавать пдф заново занятие бессмысленное и глупое. То-же самое можно сказать о выкладывании сырых пдф и сканов в библиотеку(откуда они обязательно расползутся по сети.) С таким же успехом можно выкладывать невычитанные фб2 болванки сразу из ФайнРидера...
Естественно я не имею в виду те книги которые предназначены для выкладки в пдф.
Если кто-то хочет вычитать книгу - он маякнет в личку. Нет - значит ему это не так важно.
К тому же в координации участвует много других библиотек, и существующий порядок вещей, может быть и неидеальный, всех устраивает. Делать все красиво и удобно лично для вас , никто не будет.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
+500!
Это была основной идеей, и она отлично работает.
Желающие конвертировать/вычитывать могут воспользоваться инструментами по закладке Статистика.
Выбрав тип файла, можно найти книги для конвертирования (если целесообразно).
Выбрав оценку файла, можно найти книги для вычитки.
Или заглянуть на Максиму:
Список запросов на конвертацию
Список запросов на вычитку
Файлы, как правило, в обеих библиотеках идентичные.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Я может вас удивлю, большинство сканов художки в pdf\djvu - это именно не распознанный pdf, в pdf его собирают для удобства - чтобы сканы были в одном файле, и все сканы можно быстренько смотреть.
Наоборот распознавать в худ книге текст сохраняя его в отдельном слое в контейнере pdf -- это глупое занятие если вы делаете так, не делайте, - вы тратите свое время.
Т.к. во первых этот распознанный текст все равно не вытащишь без слитых абзацев, потерянного курсива, жирности и сносок(FineReader во время распознавания сноски определяет автоматом, и сохраняет их в fb2 как сноски) .
Во вторых распознают его тяп-ляп, "по-бырику", полагаясь на автомат, без шаблонов обучения и подстройки под язык - короче с кучей ошибок.
Поэтому в любом случае (что со слоем текста, что без) pdf, будущий fb2\epub итп, все равно нужно распознавать.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Вы мне прямо глаза открыли...
Давайте я вас тоже удивлю. Текст из пдф можно не вытаскивать. Можно (та-даам!) прямо из ФР сохранить его в в любом другом формате с сохранением форматирования, курсивов, сносок и т.д. А пдф остается лишь подспорьем.
Впрочем, делайте так, как привыкли.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Ага-ага.
Сам Adobe Acrobat не может толково сохранить текст ИЗ pdf без искажений (абзацы), а все потому, что исходный текст (текстовый слой) там, как правило, делается полностью на автомате (без вычитки, без курсива и жирности, без размеров шрифтов и цвета.)
А нужен текстовый слой pdf для того (и он задумывался для этого), чтобы скопировать кусок текста в буфер.
Да кстати, даже если бы текстовый слой извлекался идеально, с курсивами без ошибок, без слитых абзацев, то остаются еще проблемы, который все перечеркивают -- сноски придется делать вручную, и главное - в текст добавляется нумерация страниц и колонтитул (надпись вверху-внизу с названием книги и автора). Искать их и удалять вручную оч. долго и нудно.
P.s. Сними галочку в FR с "Автоматически распознавать" - она по дефолту включена. Когда забрасываешь pdf он сразу анализируется и распознается (именно с картинки, не со слоя). Включи "Отключить анализ и распознавание".
Потом загрузи текстовый pdf и попробуй сохрани в текстовый формат и удивись в второй раз.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Дался вам этот пдф...
Мы, вроде, о сервисе координации говорили, не?