
Tag: Cloud
10 entradas encontradas

AWS Acquires DuckLabs: What Changes and What Doesn't for DuckDB Users
On August 26th, Mark Raasveldt and Hannes Mühleisen published a very short note on the DuckDB blog: DuckLabs, the company behind DuckDB, is becoming a subsidiary of Amazon Web Services. The deal closes in early September.
I read it more carefully than usual because at CARTO we’ve been using DuckDB for a relatively short time, and I’ve written here about file formats and performance and about the httpfs proxy mess. When you adopt a piece of software in production and months later a hyperscaler buys it, the least you can do is sit down and read the fine print.

AWS compra DuckLabs: qué cambia y qué no para quienes usamos DuckDB
El 26 de agosto, Mark Raasveldt y Hannes Mühleisen publicaron una nota muy breve en el blog de DuckDB: DuckLabs, la empresa detrás de DuckDB, pasa a ser una filial de Amazon Web Services. La operación se cierra a principios de septiembre.
Lo he leído con más atención de la habitual porque en CARTO llevamos relativamente poco tiempo usando DuckDB, y yo mismo he escrito aquí sobre formatos de archivo y rendimiento y sobre el lío de httpfs detrás de un proxy. Cuando adoptas una pieza en producción y meses después la compra un hiperescalador, lo mínimo es sentarse a mirar la letra pequeña.

Cinco años conectando data warehouses: lo que he aprendido
En abril de 2021 hice mi primer commit en el monorepo de la plataforma cloud-native de CARTO. Era el PR número 9, un docker-compose. Cinco años después he mirado hacia atrás con calma y me he encontrado con unos 450 commits, unos 447 pull requests y presencia en prácticamente todos los servicios del repositorio.
Lo interesante no son las cifras. Lo interesante es que, revisando ese historial, aparece un hilo conductor que yo mismo no había identificado del todo: he pasado media década conectando la plataforma a data warehouses ajenos. Seis proveedores distintos —BigQuery, Snowflake, Redshift, Databricks, Oracle y PostgreSQL—, cada uno con su propio modelo de credenciales, su pooling, sus timeouts y sus mensajes de error.

Five Years Connecting Data Warehouses: What I've Learned
In April 2021 I made my first commit to the monorepo behind CARTO’s cloud-native platform. It was PR number 9, a docker-compose. Five years later I’ve looked back with some calm and found around 450 commits, around 447 pull requests, and a presence in virtually every service in the repository.
The numbers aren’t the interesting part. What’s interesting is that, going through that history, a thread shows up that I hadn’t fully identified myself: I’ve spent half a decade connecting the platform to other people’s data warehouses. Six different providers — BigQuery, Snowflake, Redshift, Databricks, Oracle and PostgreSQL — each with its own credential model, its pooling, its timeouts and its error messages.

Amazon S3 Vectors: Almacenamiento vectorial nativo en la nube
Amazon ha dado un paso importante en el mundo de la inteligencia artificial con el lanzamiento de S3 Vectors, el primer servicio de almacenamiento en la nube con soporte nativo para vectores a gran escala. Esta novedad promete reducir hasta un 90% los costes de subida, almacenamiento y consulta de datos vectoriales.
¿Qué son los vectores y por qué nos importan?
Los vectores son representaciones numéricas de datos no estructurados (texto, imágenes, audio, video) generados por modelos de embedding. Son la base de las aplicaciones de IA generativa que necesitan encontrar similitudes entre datos usando métricas de distancia.

Amazon S3 Vectors: Native vector storage in the cloud
Amazon has taken an important step in the world of artificial intelligence with the launch of S3 Vectors, the first cloud storage service with native support for large-scale vectors. This innovation promises to reduce costs by up to 90% for uploading, storing, and querying vector data.
What are vectors and why do we care?
Vectors are numerical representations of unstructured data (text, images, audio, video) generated by embedding models. They are the foundation of generative AI applications that need to find similarities between data using distance metrics.

Getting back to the blog
Daily life has kept me from doing many things, including keeping this blog updated, but there’s no time for everything, and in the end fatigue forces me to reorganize priorities.
In recent months, I’ve been working on implementing RedHat CloudForms, Ansible Tower, and more, so I’ve had to work much more with Ansible. It was already a habit, but lately it’s been much more intensive.
So I’ve earned a few RedHat “certifications”:

Retomando el blog
El día a día me ha impedido hacer muchas cosas, una de estas es tener actualizado el blog, pero no hay tiempo para todo, y al final el cansancio hace que tenga que reorganizar prioridades.
Estos últimos meses he estado trabajando en la implantación de RedHat Cloudforms, Ansible Tower, … por lo que ha sido mucho el Ansible que he tenido que tocar, ya era habitual, pero últimamente es mucho más.

Que hacer ante un desastre
Siempre he dicho: ” hay dos tipos de personas: Los que han perdido datos y los que aún no“. Ante este panorama tratamos de hacer todo lo que está en nuestra mano para salvaguardar toda la información que tenemos en los ordenadores de la forma más segura.

What to do in a disaster
I have always said: ” there are two types of people: Those who have lost data and those who have not yet“. Given this scenario, we try to do everything in our power to safeguard all the information we have on computers in the safest way.




