1 مستودع
Configuration options for controlling how content is retrieved, including redirect following and encryption handling.
Distinct from Web Content Fetching: Distinct from Web Content Fetching: focuses on the behavioral policies of the fetcher (redirects, SSL) rather than the format conversion for LLMs.
Explore 1 awesome GitHub repository matching data & databases · Fetch Control Policies. Refine with filters or upvote what's useful.
Crawler4j هو زاحف ويب (web crawler) متعدد الخيوط بلغة Java مصمم للزحف إلى الويب واستخراج المحتوى بأحجام كبيرة. يعمل كإطار عمل للزحف المهذب الذي يتيح اكتشاف وفهرسة محتوى HTML والمحتوى الثنائي عبر مواقع ويب متعددة. يتميز المشروع بنموذج زحف مستمر يقوم بتسلسل حالة الجلسة إلى التخزين المحلي، مما يسمح للمحرك باستئناف الفهرسة بعد حدوث عطل أو انقطاع. يتضمن وحدة تحكم في التهذيب لتنظيم تكرار الطلبات والتأخيرات، مما يمنع تحميل الخادم بشكل زائد وحظر عنوان IP. يغطي النظام مجموعة واسعة من قدرات الزحف، بما في ذلك إدارة النطاق المحدود بالعمق، وتصفية الأهداف، واعتراض الطلبات لوكلاء المستخدم المخصصين وتوجيه الوكيل (proxy). تتم إدارة تخزين البيانات عبر نمط المستودع (repository pattern) الذي يفصل منطق الزحف عن استمرارية بيانات تعريف الصفحة في قواعد البيانات العلائقية.
Provides control over whether to follow redirects, include encrypted pages, or process specific content types.