← Назад

models

Настройка базы знаний на Amazon Bedrock для обработки крупных и сложных документов с помощью Amazon Textract

Статья демонстрирует, как настроить собственную базу знаний на Amazon Bedrock для обработки больших и сложных документов, объединяя возможности Amazon Textract и Amazon Bedrock для повышения точности и скорости работы с документами.

AS1 NewsИсточник: aws.amazon.com

awsdocument-processingtextractbedrockknowledge-base
AMZN$256.78-0.82%Scale AI

Для команд поддержки клиентов, обрабатывающих тысячи коммунальных счетов ежемесячно, актуальный разбор и анализ сложных многостраничных документов является постоянной задачей. Непоследовательные форматы, плотные таблицы и разнообразные макеты усложняют быстрое извлечение нужной информации, что ведет к задержкам, ошибкам в расчетах и недовольству клиентов. По мере роста объемов документов эти проблемы усугубляются, оставляя организации без возможности эффективно использовать уже имеющиеся данные.

Amazon Bedrock, интегрированный с Amazon Textract, предоставляет возможности поиска и генерации, решая эти задачи. Объединяя высокоточное извлечение структурированного и неструктурированного контента с помощью Amazon Textract и генеративные возможности Amazon Bedrock, организации могут перейти от ручного поиска к программному запросу документов. Это позволяет получать ценные инсайты из коммунальных счетов в масштабах и обеспечивает более быстрые и точные взаимодействия с клиентами.

В статье показано, как взаимодействовать с коммунальными счетами в сложных форматах PDF и изображениях, парсить их, анализировать содержимое и тегировать таблицы для облегчения извлечения информации крупными языковыми моделями (LLMs). Код для реализации представлен на GitHub.

Обзор кейсов использования Команда поддержки сталкивается с множеством запросов по коммунальным счетам, охватывающих такие области, как выставление счетов, использование, платежи и обслуживание клиентов. Обработка этих запросов в различных форматах — PDF, DOCX, TXT, HTML, XLSX — занимает много времени и подвержена ошибкам, что вызывает задержки и недовольство клиентов.

Изначально команда пыталась реализовать решение Retrieval Augmented Generation (RAG), напрямую используя счета. Однако возникли проблемы: модель LLM пропускала важные детали, иногда генерировала ложную или нерелевантную информацию, что снижало надежность ответов.

После анализа было решено использовать более продвинутый подход: предварительная обработка документов с помощью Amazon Textract для извлечения текста и структурированных данных, их очистка и обогащение, а также использование контекстуальных меток для повышения точности. Такой подход позволяет строить более надежные решения на базе RAG, обеспечивающие точное извлечение информации и улучшение взаимодействия с клиентами.

Поддерживаемые типы файлов Поддерживаются PDF, DOCX, TXT, HTML, XLSX и PNG. Amazon Textract способен извлекать текст из многостраничных PDF, Word-документов, изображений и таблиц, что делает его универсальным инструментом для обработки различных форматов.

Обзор решения Интеграция Amazon Textract с Amazon Bedrock позволяет автоматизировать процесс обработки документов: Textract предварительно извлекает и очищает данные, а затем они поступают в модель для анализа и генерации ответов. Такой подход обеспечивает высокую точность и масштабируемость.

Для развертывания решения используется скрипт, создающий инфраструктуру через AWS CloudFormation, включая Lambda-функции, S3-бакеты, кластер OpenSearch и базы знаний Amazon Bedrock. После автоматической установки необходимо загрузить документы, настроить базу знаний и протестировать систему, задавая вопросы по счетам.

Заключение Данный пример демонстрирует, как объединение AWS-сервисов позволяет создавать интеллектуальные системы обработки документов. Использование CloudFormation обеспечивает повторяемость и надежность инфраструктуры, а автоматизированный pipeline — масштабируемость и эффективность.

Ответственный ИИ При внедрении решений на базе RAG важно учитывать меры по обеспечению надежности и доверия. Amazon Bedrock Guardrails позволяет управлять содержанием, фильтровать нежелательные темы и защищать конфиденциальность. Также рекомендуется использовать механизмы валидации, чтобы снизить риск генерации ложной информации.

Данное решение особенно полезно для организаций с большим объемом структурированных документов, таких как коммунальные счета, позволяя автоматизировать их обработку и повысить качество обслуживания клиентов. В будущем возможна интеграция с дополнительными сервисами AWS для расширения аналитических возможностей или создание пользовательских интерфейсов для удобства взаимодействия.

нейтрально

Обеспечивает автоматизированную обработку и анализ сложных документов, повышая эффективность и точность работы с данными.