Реклама на сайте Advertise with us

Автоматизация на локальных LLM: парсеры, обработка данных.

Расширенный поиск по форуму
 
Новая тема Новая тема   
Автор
Поиск в теме:



С нами с 09.11.18
Сообщения: 7
Рейтинг: 1

Ссылка на сообщениеДобавлено: 03/08/26 в 16:38       Ответить с цитатойцитата 

Разработка и автоматизация под задачи, где данные не должны уходить наружу.

Работаю на своём железе: Ryzen AI 9 HX 370, 32 GB VRAM, 64 GB RAM. Локальные модели
(Qwen 2.5 32B, DeepSeek-R1) через Ollama. Ни OpenAI, ни Claude, ни одного внешнего
API — ваши базы, тексты и логи остаются на моей машине и потом удаляются.

ЧТО ДЕЛАЮ

Парсеры и сборщики данных
Асинхронный Python (httpx/Playwright), обход JS-рендеринга, устойчивость к падениям,
докачка после обрыва, состояние в SQLite. Не разовый скрипт, а то, что работает
месяцами без присмотра.

Обработка текста локальными LLM
Классификация, извлечение структурированных данных, суммаризация, перевод.
Ключевое отличие: вывод по JSON Schema с валидацией и автоматической проверкой на
выдумки. Модель обязана подтверждать факты дословными цитатами из источника, а всё,
что не проходит проверку, отбраковывается, а не отдаётся вам.

Автоматизация процессов
n8n, systemd-сервисы, Telegram-боты, обработка входящих файлов, вебхуки,
уведомления. Связываю то, что у вас уже есть, в конвейер без ручных шагов.

Работа с документами и медиа
OCR (Tesseract, многоязычный), транскрипция аудио (whisper.cpp на GPU, ~7x реального
времени), парсинг PDF, извлечение таблиц.

Серверное и системное
Linux, Docker, systemd, миграции, дуалбут, диагностика железа и производительности,
настройка ROCm/CUDA под инференс.

ПРИМЕР РАБОТЫ

Последний проект — конвейер сбора и обогащения B2B-данных. Собирает компании из
открытых источников, анализирует их сайты локальной моделью, извлекает структуру
и генерирует персонализированные тексты. Четыре уровня защиты от галлюцинаций:
JSON Schema, верификация цитат против исходника, фильтр качества цитат, аудит
результата. На последнем прогоне 33 текста из 37 прошли автоматическую проверку,
4 отбракованы и не попали в выдачу. Всё локально, ~2500 строк Python.

Готов показать код и разобрать архитектуру.

ЦЕНЫ

Небольшой скрипт или парсер — от 100 EUR
Конвейер с LLM-обработкой — от 300 EUR
Автоматизация процесса под ключ — от 500 EUR

Консультация по архитектуре, час — бесплатно, если задача интересная

ЧЕГО НЕ ДЕЛАЮ

Не пишу спам-рассылки и не собираю базы под них. Не занимаюсь обходом капч,
накрутками и всем, что ломает чужие системы. Не беру задачи, где нужно врать
конечному пользователю.

Европа, работаю удалённо. Пишу и говорю по-русски, польски, английски.
Пример задачи в личку — отвечу, реально ли и за сколько.

ТГ: @ser_mish25

0
 



С нами с 30.04.05
Сообщения: 7043
Рейтинг: 3660


Передовик Master-X (01.10.2015) Передовик Master-X (16.03.2016) Передовик Master-X (01.04.2016) Передовик Master-X (16.04.2016) Передовик Master-X (01.05.2016) Ветеран трепа Master-X (01.06.2016)
Ссылка на сообщениеДобавлено: 05/08/26 в 03:14       Ответить с цитатойцитата 

Прикольные у тебя скиллы! Но мне сейчас хочется самому влезть в подобную тему и научиться автоматизации для наполнения собственных проектов. Там достаточно парсера на Python и обработчика, который будет формировать .csv файл с измененными описаниями (десками). Но чтобы парсить такие ресурсы, почти всегда нужен обход капчи. Странно, что с капчами не работаешь. Ну, ок буду тогда сам разбираться в тонкостях парсинга и закажу парсер на Python у прогером с обходом капчи. Есть парсер уже, который уже не пашет и его нужно допилить и полностью переписать. Потом только нужно будет немного разобраться с созданием и настройкой обработчика полученных данных icon_cool.gif

Надежный и отзывчивый VPS хостинг для серьезных проектов

0
 



С нами с 09.11.18
Сообщения: 7
Рейтинг: 1

Ссылка на сообщениеДобавлено: 05/08/26 в 14:12       Ответить с цитатойцитата 

Что могу сделать прямо сейчас:
Асинхронный парсер (Playwright / httpx) любой сложности с обходом Cloudflare/JS и докачкой при обрывах.
Автоматизация рутины (файлы, базы, Telegram-боты, n8n-воркфлоу).
Обработка и фильтрация текста через локальные LLM (без отправки ваших данных в сторонние OpenAI/Claude).
Кидайте ТЗ в ЛС или прямо в тему — разберем задачу и сделаем в лучшем виде.

0
 
Новая тема Новая тема   

Текстовая реклама в форме ответа
Заголовок и до четырех строчек текста
Длина текста до 350 символов
Купить рекламу в этом месте!


Перейти:  



Спонсор раздела Стань спонсором этого раздела!

Реклама на сайте Advertise with us

Опросы

Рецепт новогоднего блюда 2022



Обсудите на форуме обсудить (11)
все опросы »