
El director de infraestructura de TI de la Fundación Linux dijo que ahora gastan más ciclos de CPU «Presentación de renderizado para capturador Más de lo que gastamos en todos los demás tipos de acceso legal. »
En cualquier momento, en 5 nodos distribuidos geográficamente, hay 14 núcleos de CPU que no hacen más que representar confirmaciones de git en html…
[W]Cuando se garantiza que una fuente está libre de LLM, como lo es todo el historial de confirmaciones principales, su valor como fuente de capacitación es extremadamente valioso… Al momento de escribir este artículo, linux.git tiene aproximadamente 1,48 millones de confirmaciones. Ah, y tenemos alrededor de 922 bifurcaciones en git.kernel.org, pero no te preocupes, en realidad es muy eficiente en el backend porque el contenido de cada bifurcación es básicamente el mismo. A menos, por supuesto, que seas un rastreador, en cuyo caso puedes rastrear miles de millones de URL válidas pero sólo obtener 922 duplicados de los mismos 1,48 millones de envíos, que es exactamente lo que está haciendo el rastreador. Pero espera, no es sólo la promesa en sí. También puede solicitar parches, renderizados puros, diferencias entre confirmaciones arbitrarias; cgit estará feliz de permitirle hacerlo, lo cual es perfecto para una era en la que Internet existe para humanos o rastreadores que obedecen a robots.txt, y horrible Ahora, ya que podemos generar 1.2 Métrica decenas de miles de millones Una URL válida únicamente para una única rama de linux.git.
Inicialmente, esta era la solución: mirar los registros, descubrir qué IP son los bots obvios y desactivarlos. Al principio, esto es fácil porque los bots te ayudan a decirte quiénes son a través de sus agentes de usuario. Luego se despiertan y empiezan a fingir que son navegadores normales al azar. Entonces comenzamos a prohibirlos por IP; después de todo, es fácil ver que intentar obtener las IP de cada posible confirmación en una rama de Linux que quedó obsoleta hace 8 años no es factible. real Un usuario de Chrome en Windows hace clic frenéticamente en cada enlace que aparece en la pantalla. Luego, los bots comenzaron a extenderse por la subred, pero eso sigue siendo aburrido porque aparentemente las IP de Google Compute son solo pretender Conviértete en usuario de Firefox…
Y entonces… fue entonces cuando las cosas realmente dieron un giro. real Feo. De repente, los rastreadores provienen de millones de IP residenciales o móviles aleatorias, todas haciéndose pasar por navegadores modernos aleatorios. IP como esta realizarán de 4 a 5 solicitudes y luego nunca volverán a aparecer en los registros… caen como un enjambre de langostas, golpean fuerte y rápido hasta que el sistema falla y luego pasan al siguiente objetivo hasta que usted se recupera. Luego regresaron. enjuagar. repetir. Todavía lo hacen: bienvenido al maravilloso mundo de la «monetización del SDK proxy». Éste es un gran negocio y Tu televisor puede estar haciendo esto…
Hoy en día, git.kernel.org recibe alrededor de 6 millones de solicitudes al día para ver confirmaciones aleatorias. De ellos, el 66% todavía son inmediatamente rechazados por el desafío de Anubis, pero el 33% ahora está resolviendo los problemas matemáticos y dirigiéndose al sitio principal – porque claramente lo que ofrecemos vale la pena gastar muchos ciclos calculando el desafío de Anubis… Según un montón de suposiciones generosas, las solicitudes legítimas sólo representan alrededor del 2% del tráfico de git.kernel.org – todo lo demás es un raspador…
[W]Estamos desactivando algunas funciones para reducir la cantidad de URL rastreables y cerrar operaciones cuya ejecución nos resulta costosa. Espere perder algunas funciones, al menos en lo que respecta al acceso anónimo a nuestros recursos. Créame, lo odiamos tanto como usted, pero es necesario en este momento… [W]Prometemos seguir haciendo que todos nuestros datos estén disponibles para su descarga para cualquiera que los solicite. Es posible que tengas que pasar por más obstáculos para conseguirlo.
Lo siento.









