Buscar este blog

CONTADOR DE VISITAS

Mostrando entradas con la etiqueta Metadatos. Mostrar todas las entradas
Mostrando entradas con la etiqueta Metadatos. Mostrar todas las entradas

viernes, 15 de octubre de 2010

KnowledgeTree

Es un sistema de gestión electrónica de documentos, por medio de esta  herramienta se pueden editar trabajos y metadatos lo que permite que la información se encuntre organizada y clasificada en formatos de archivos electrónicos o digitales.

Por otro lado también permite la indización  documentos, el cual permite que busque en texto completo el contenido de los documentos.

Las principales funciones de este sistemas son:
  • Búsqueda e indexación
  • Control de metadatos
  • Importación de contenidos

domingo, 10 de octubre de 2010

Recuperación y Organización de la Información en la Web

Los lenguajes de recuperación de información  web  nacen  ante la necesidad de extraer  grandes cantidades de información  que en su gran mayoría son importantes para una persona o empresa.

Para recuperar información y documentos en la Web, se han desarrollado algunas estrategias como uso de metadatos o utilización de lenguajes semánticos basados en XML para indizar documentos web.

Algunos lenguajes de recuperación son:
  • Lenguajes de recuperación en XML
  • Lenguajes de recuperación en bases de datos
  • Lenguajes de recuperación enRDF
  • Lenguajes de recuperación en OWL.

domingo, 12 de septiembre de 2010

Navegación versus Recuperación de Información

  • Concepto
  • La navegación es el programa que permite consultar y obtener información mediante los sistemas hipertexto. 
  • Diferencias
  • La diferencia esencial entre ambos conceptos, radica en la forma de obtener información; mientras que en la recuperación de información se obtiene de forma lineal, la navegación tiene la capacidad de obtener información a través del hipertexto. Esto quiere decir que, la adquisición de conocimiento se realiza paulatinamente y dependiendo del interés del usuario se profundiza a través de los nodos de información en una materia u otra.
  • Directorios versus Motores de búsqueda
Motores de búsqueda Vs. Directorios
La información se actualiza automáticamente por la red.
La información se actualiza mediante la mano humana que se da de alta en el directorio cuando crea un lugar web.
Recogen toda la información almacenada en la página.
No almacenan todos los contenidos web, solamente los campos más relevantes como son el título, las palabras clave, etc.
Almacenan la información mediante una base de datos propia.
Almacenan información mediante directorios, clasificados en categorías.
La búsqueda se realiza en la base de datos mediante la ecuación de búsqueda.
La búsqueda se realiza jerárquicamente según las categorías establecidas.
La presentación de los resultados se establece por orden de relevancia según unos criterios establecidos en la ecuación de búsqueda.
La presentación de los resultados se lleva a cabo mediante un listado de todos los documentos correspondientes en la categoría, sin ningún criterio de presentación.
Apropiados para localizar información específica.
Apropiados para localizar información general sobre un tema.

  • Metadatos
  • Los metadatos en la navegación y recuperación de información se utilizan para detectar información relevante de una forma rápida y eficaz. Las etiquetas describen el contenido del recurso web, que posteriormente utilizan las herramientas de búsqueda para localizar y acceder al recurso. Principalmente son las etiquetas de palabra clave y título las que dan paso a localizar el documento. 

Information Retrieval

Contenidos

1. Evolución del significado del término
2. Recuperación de Información y Recuperación de Conocimiento
3. Recuperación de Información y Sistemas de Recuperación de Información
4. Metadatos, descriptores e indización
5. Recuperación de Información mediante vocabularios controlados
6. Relevancia
7. Medidas de Recuperación
8. Modelos de Recuperación


La recuperación de información es el conjunto de actividades orientadas a facilitar la localización de determinados datos u objetos, y las interrelaciones que estos tienen a su vez con otros. Existen varias disciplinas vinculadas a esta actividad como la lingüística, la documentación o la informática.
 
1. Evolución del significado del término

Aunque tradicionalmente se limitaba a la recuperación de documentos escritos, el término se redefinió para incorporar la creciente aparición de materiales multimedia. Asi, los nuevos buscadores de información en Internet, que originariamente buscaban textos, expandieron su actividad a imágenes, videos o audios.  De esta forma términos como Recuperación de textos, recuperación documental y recuperación de información son utilizados como equivalentes.
Por otro lado, la necesidad de localizar datos concretos ha ido expandiendo su área de actuación. En la actualidad se está migrando desde la recuperación de documentos a la recuperación pregunta-respuesta, que responden con el dato concreto y no con el conjunto de documentos que posiblemente contenga este dato.

2. Recuperación de Información y Recuperación de Conocimiento
Con frecuencia, la información responde a qué es algo y que propiedades lo describe, pero tan sólo parte de la información indica cómo se elabora o se desarrolla un proceso. Este tipo de información es básicamente  conocimiento. Esta premisa muestra que el conocimiento implica dos cuestiones fundamentales: la existencia de un fin y una relación con otra información de un sistema para lograr un objetivo.
La existencia de un fin para saber cómo se realiza algo presupone la intencionalidad y necesidad de lograr algo. Esta finalidad ha provocado que el conocimiento se asocie a los seres vivos.
Por otra parte, el conocimiento implica que la información esté relacionada dentro de un sistema para lograr un objetivo. La información necesaria sobre cómo procesar un objetivo se transforma así en una serie de reglas y restricciones. De esta manera es comprensible que muchos sistemas de recuperación especializada, hayan pasado a autodenominarse Sistemas de Recuperación de Conocimiento.
Asi el desarrollo de ontologías, agentes inteligentes y de la inteligencia artificial ha propiciado un cambio de denominación hacia recuperación del conocimiento. Desde esta perspectiva no se pretende que el buscador recupere por palabras presentes en los documentos, sino que sea posible recuperar procesos y otros tipos de interrelaciones entre los elementos almacenados.

3. Recuperación de Información y Sistemas de Recuperación de Información
En la literatura, la exposición de estas estrategias suele estar vinculada a determinado Sistema de Recuperación. Ya que el desarrollo de estas aplicaciones informáticas surgió como respuesta a la gestión de la sobreabundancia de información actual. La forma en que esta información es almacenada suele ser mediante Bases de Datos y repositorios documentales.

4. Metadatos, descriptores e indización
Dado la limitada capacidad de los ordenadores, originariamente, la recuperación tenía que estar limitada a unos pocos atributos o metadatos del objeto. Entre los que destacaban el autor, el título o las palabras más significativas del contenido expresado en el texto o descriptores. La asignación de estos descriptores, denominada indización, era manual.
Estos mismos metadatos son empleados actualmente en la Web Semántica por su mayor simplicidad que el lenguaje natural, facilitando la interoperabilidad y la navegación en la Web.
La indización automática trata de automatizar la asignación de términos relevantes a un documento de forma automática. La relevancia es calculada mediante cálculos estadísticos y localización del mismo. Ejemplos son tf-IDF, la eliminación de palabras vacías, el mayor valor de los términos en los títulos, en formato destacado (p.e. negrilla), etc. Muchos de estos factores son utilizados para ordenar los resultados en los motores de recuperación.

5. Recuperación de Información mediante vocabularios controlados
Los descriptores, usualmente, estaban listados en un vocabulario de un dominio cerrado y normalizado, denominado controlado. En este vocabulario pueden existir, incluso, interrelaciones entre estos términos. El control de este vocabulario trata de solventar dos de los principales problemas de la recuperación de información: la polisemia, la homonimia y la sinonimia.
Las relaciones de estos vocabularios pueden ser de varios tipos. En el caso de los tesauros están son de equivalencia, jerarquía y relación. Los tesauros facetados  disponen de varias vistas que facilitan la recuperación.

6. Relevancia
La relevancia es una medida del grado en que determinado elemento responde a una consulta. Su medida es frecuentemente subjetiva, ya que responden a la consulta en función del conocimiento de quién evalúa y del que pregunta.

7. Medidas de Recuperación
El funcionamiento de un sistema de recuperación de información se puede medir analizando los datos (o documentos) recuperados ante una consulta. Dos son las principales medidas:
  • Precision: volumen de datos relevantes entre el total de datos recuperados 
  • Exhaustividad: volumen de datos relevantes entre el total de datos  relevantes en el repositorio o la BD
Ambas medidas tienden a evolucionar en sentido inverso (Ley de Cleverdon). Cuanto más crece la precisión más disminuye la exhaustividad, y al contrario. Esto es debido a que miden factores distintos, el ruido y el silencio:
  • Ruido: información recuperada no relevante
  • Silencio: información no recuperada que es relevante
Dado que para calcular estas medidas es necesario conocer cuantos elementos relevantes existen, son necesarios listados de la relevancia de los documentos ante un conjunto de consultas. Estos listados se llaman colecciones de pruebas (test collections), y son utilizadas en competiciones internacionales para testear los sistemas de recuperación. La más conocida de las cuales es TREC.

8. Modelos de Recuperación
Los modelos de recuperación tratan de calcular el grado en que determinado elemento de información responde a determinada consulta. En general esto se consigue calculando los coeficientes de similitud (Coseno, Phi, etc). Los tres modelos más utilizados son:
  • Booleano: se crea un conjunto con los elementos de la consulta y otro con los documentos, y se mide la correspondencia.
  • Vectorial: en el que la consulta y los términos del documento se representan mediante dos vectores, y se mide el grado en que ambos vectores divergen. 
  • Probabilístico: se calcula la probabilidad en que el documento responde a la consulta. Frecuentemente utiliza retroalimentación. La retroalimentación se basa en que el usuario indique que documentos se parecen más a su respuesta idonea, para asi reformular la consulta.
Referencias 
  • ANTONIOU, G., VAN HARMELEN, F. (2004). A semantic Web Primer. Massachussets: MIT, 2004
  • BAEZA-YATES, R., RIBEIRO-NETO, B. (1999)Modern information retrieval. New York : ACM Press ; Madrid[etc.]:  Addison-Wesley. 
  • CLEVERDON, C.W. (1972). “On the inverse relationship of recall and precision”. Journal of Documentation, Vol. 28, pp. 195-201.
  • SPARCK, J. (1997). Readings in information retrieval . edited by Karen Sparck Jones, Peter Willett.San Francisco : Morgan Kaufmann.

Disponible en:  http://sites.google.com/site/glosariobitrum/Home/recuperacion-de-informacion

viernes, 10 de septiembre de 2010

Metadata: Herramienta para la recuperación de información en Internet


La enorme cantidad de recursos de información disponibles en Internet, la disparidad en las calidades de los contenidos y la dificultad de encontrar información relevante con cierta rapidez y eficiencia, pusieron de manifiesto la necesidad de establecer una metodología y lenguaje para la descripción de recursos online, con el objetivo principal de hacer más efectiva la recuperación de la información en lnternet.

Qué es metadata

La literatura especializada define los Metadata o Meta Tags, como "Datos acerca de los datos" o "información acerca de la información" . A través de esta metodología es posible describir el contenido de un recurso de aprendizaje. Otra definición es: información sobre objetos web, comprensible por máquinas.

Los metadata proporcionan un buen método para controlar la forma en que los sitios web son indexados por los motores de búsqueda. También mejoran la opción de encontrar páginas con poco texto, como es el caso de sitios construidos con "Frame".

Básicamente la descripción por Metadata de recursos de aprendizaje, podría compararse con una lata de conserva, en la cual, a través de la etiqueta exterior de la lata, es posible saber detalles del contenido sin necesidad de abrir la lata.

Tipos de metadata

Se distinguen principalmente dos tipos de metadatas que pueden ser incorporados en un documento web:

· HTTP-EQUIV
· META NAME


HTTP-EQUIV

Indican atributos que poseen un significado especial, para browsers y motores de
búsquedas. A través de los metadatas de¡ tipo Http-Equiv, se pueden especificar
instrucciones tales como la fecha de expiración de un sitio, insertar cookies, comandos,
actualización periódica de la caché de un browser o comando PICS. Eje:


Meta Name

A través de los Meta Name, es posible describir los contenidos sitio web. Los marcadores de este tipo hacen posible la catalogación de los sitios web.

Incluyen un conjunto de pares atributo/valor con los que se especifican diferentes propiedades del documento y donde el atributo corresponde al nombre del campo y el valor al contenido de la misma. Ej.:


Cómo están organizados los Metadatas

Los Metadatas están organizados en categorías o campos. Cada Campo representa una característica del recurso. Cada campo tiene un valor, pero también pueden ser valores múltiples, como por ejemplo colocar las palabras claves en varios idiomas.

Dónde se encuentran los metadatas

Los metadata se codifican en el HEADER de un documento HTML. Para verlo debemos ingresar al código de fuente del sitio, dónde encontrar este código depende del Browser que se está utilizando:

El Hyper Text Markup Languaje (HTML) es un lenguaje simple de indicación de formato utilizado para crear documentos en hipertexto que sean portables de una plataforma a otra. Los documentos HTML, son una aplicación de SGML (Standard Generalized Markup Languaje, norma ISO 8879-1986) con semántica genérica que son apropiados para representar información a partir de un amplio espectro de aplicaciones.

HTML es básicamente un fichero de texto ASCII que incluye, además del texto legible en Internet, las instrucciones que definen la presentación del mismo en cuanto a distribución en el espacio de la página y sus atributos estéticos.

Los documentos HTML comienzan con una declaración seguidas por elementos HTML conteniendo un elemento HEAD y luego un elemento BODY:

HEAD: Contiene información sobre el contenido del documento, esta información está
dirigida a Browsers y Motores de Búsqueda.

BODY: Contiene todo lo que se muestra del documento en la pantalla: texto, imágenes, gráficos, ilustraciones, etc.

Todo documento HTML debe comenzar con la declaración que es necesaria para distinguir la versión del HTML que se está utilizando en la construcción del documento.


CREACIÓN DE METADATA

En general, los metadata son creados por sus generadores, existiendo sí la posibilidad de que sean creados en forma automática por motores de búsqueda:

Editores Automática
(Generación manual) (Generación por robot)
- Autores - UKOLN
- Webmaster - SOLF
- Institución


Formatos

La existencia de una ilimitada cantidad de información generada por instituciones académicas disponibles en lnternet, tales como documentos de texto completo, archivos fotográficos y video, bases de datos, etc., han definido diversas necesidades de recuperación. Es así como IMS y otras organizaciones que han generado sus propios formatos, reconocen la necesidad de contar con un equivalente a un registro mínimo de formato MARC. A esto apunta Dublin Core, la inclusión de estos elementos en otros formatos, permitirá que los motores de búsqueda y otras herramientas de recuperación como la Z39.50 puedan ejercer su función indiferentes a los formatos que se hayan utilizado en la descripción del sitio.

Tipos de Formatos

Muchas instituciones se han dedicado a desarrollar sus formatos de metadata respondiendo a necesidades propias. Entre estos formatos se destaca el uso que están haciendo los centros de investigaciones aeroespaciales y geográficos, pero dentro de los proyectos más conocidos se encuentra:

IMS - Instructional Management System - EDUCOM
PICS -W3 - W3 Consortium
UKOLN

El rango de los formatos de Metadata se encuentra en grado de complejidad intermedia entre los sistemas más elementales, como el de los buscadores y formatos más sofisticados como MARC.

Disponible en:

sábado, 4 de septiembre de 2010

DEFINICIONES BASICAS DE RECUPERACION DE INFORMACION

CARÁCTER Estilo o forma de cualquier símbolo, signo numérico, alfabético o especial que se emplea en la escritura.

DATO
Es un representación simbólica como: numérica, alfabéticas, etc. Es un antecedente necesario para acceder al conocimiento exacto.
Definición disponible en: http://buscon.rae.es/draeI/SrvltConsulta?TIPO_BUS=3&LEMA=dato

DESCRIPTOR
Término o frase de un lenguaje documental, utilizado como termino de indización y de recuperación el cual indica el tema o asunto de que trata un documento.
Palabra clave que define el contenido de un documento y que permite localizarlo en un archivo manual o informatizado.
Termino consultado en: http://www.wordreference.com/definicion/descriptor

DESCRIPTOR LIBRE
Es un proceso de descriptor que extrae varios conceptos que representan un contenido.

DOCUMENTO
Es el resultado funciones de instituciones o personas físicas, jurídicas, públicas o privadas, registrado en una unidad de información en cualquier tipo de soporte (papel, cintas, discos magnéticos, películas, fotografías, etcétera) en lengua natural o convencional. Es el testimonio de una actividad humana fijada en un soporte.

DOCUMENTO DIGITAL
Es aquel que contiene información codificada en forma de dígitos binarios que puede ser capturada, almacenada, analizada, distribuida en cualquier medio de sistemas informáticos. Su contenido puede ser en vídeos, sonidos imágenes, etc., y que permiten almacenar en reducidos espacios grandes cantidades de información para ser distribuidos con facilidad.
Definición disponible en: http://fterrazas.wordpress.com/glosario/

DOCUMENTO VIRTUAL
Son todos los documentos digitales que existen en un momento determinado y que son de gran utilidad y que en determinado momento dejan de existir.

DUBLIN CORE
Dublin Core se define como fundamentales porque sus elementos son amplios y genéricos, y que pueden utilizarse para describir una amplia gama de recursos.
Dublin Core se define como el conjunto más amplio de metadatos que proporciona elementos de un texto y que la mayoría de los recursos pueden ser descritos y catalogados, incluso describe recursos físicos como libros, materiales digitales como video, sonido, imagen o texto de archivos.
Definición disponible en: http://www.rediris.es/search/dces/

ENCABEZADO DE MATERIA
Palabra o conjunto de palabras que representan un concepto o una combinación de conceptos los cuales constituyen la entrada a una lista de encabezamientos de materia.

ETIQUETA O ROTULO
Palabra o expresión representada lingüísticamente o semántica la cual identifica y representa a un conjunto de nociones que ingresan a un concepto.

INFORMACIÓN
Es un conjunto organizado de datos que constituyen un mensaje sobre un cierto fenómeno o ente, esta permite tomar decisiones, resolver problemas ya que su base es el conocimiento.

INTERFAZ
Es la conexión entre dos ordenadores o maquinas de cualquier tipo dando una comunicación entre ambas.
Interfaz hace referencia a un conjunto de referencias y métodos para lograr interactividad entre un usuario y la computadora
Interfase sinónimo de interfaz.
Definición disponible en: http://www.alegsa.com.ar/Dic/interfaz.php

INTEROPERABILIDAD
Se conoce como la condición mediante la cual sistemas heterogéneos pueden intercambiar procesos o datos. Es la capacidad que tiene un producto o un sistema, cuyas interfaces son totalmente conocidas, para funcionar con otros productos o sistemas existentes o futuros y eso sin restricción de acceso o de implementación.
Capacidad de los sistemas de tecnologías de la información y de las comunicaciones (TIC) en los procesos empresariales que apoyan el intercambio de datos y posibilitar la puesta en común de información y conocimientos.
Definición disponible en: http://olea.org/diario/archive/2006/dic-21-0.html

LENGUAJE DE MARCADO
Se conoce como una forma de codificar un documento que junto al texto se añade etiquetas, marcas o anotaciones con información adicional relativa a la estructura del texto.
Es una sintaxis extra-textual que puede ser usada para describir acciones de formato, información de la estructura de un documento, la semántica de un texto, los atributos, entre otras.

METADATOS
Son datos que describen los datos generalmente utilizado para el uso de índices y recuperación de información.
También puede definir como descripciones estructuradas y opcionales que están disponibles en forma pública para ayudar a localizar información.

ONTOLOGÍAS
Este término en informática hace referencia a la formulación exhaustiva y rigurosa de un esquema conceptual dentro de uno o varios dominios dados; con la finalidad de facilitar la comunicación y el intercambio de información entre diferentes sistemas y entidades.
Aunque toma su nombre por analogía, ésta es la diferencia con el punto de vista filosófico de la palabra ontología

PALABRA CLAVE
Termino o significativo seleccionado de un documento para presentar un documento de información contenida, conjunto de términos obtenidos en un lenguaje natural que representan un contenido.

RECUPERACIÓN DE INFORMACIÓN
Existen diversas definiciones como:

Stephen Harter: La recuperación de información es un proceso en el que el ser humano utiliza un terminal informático para interactuar con un servicio de búsqueda en un intento de satisfacer de satisfacer las necesidades de información.

Geraldene Walker. Menciona que la recuperación de información que la recuperación de información es el término usado normalmente para describir muchos tipos de búsqueda.

Karen Sparck Jones y Peter Willett: Indican que la recuperación de información es considerada como sinónimo de recuperación de documentos o recuperación de texto y que implica dos actividades como la indización y búsqueda.

Robert R. Korfhage: Señala que el almacenamiento y recuperación de información son el análisis de todos los conceptos y de la lectura de contenidos extraídos de cualquier fuente de información

REPOSITORIOS
Es un sitio centralizado donde se almacena y mantiene información Digital, habitualmente bases de datos y archivos informáticos. Puede ser una institución o un servidor o dispositivo donde se encuentran almacenados los programas correspondientes a un sistema operativo, donde se encuentren ficheros, archivos de cualquier índole los cuales se pueden leer y descargar

SEMÁNTICA
Relacionado con elementos que reflejan el significado, sentido o interpretación de un determinado, símbolo, palabra o expresión

SINTAXIS
Parte de la gramática que enseña a coordinar y unir las palabras para formar las oraciones y expresar conceptos. En informática es el conjunto de reglas que definen las secuencias correctas de los elementos de un lenguaje de programación

TERMINO
Es la palabra o la expresión que se representa en un rotulo o etiqueta y su contenido es conceptual construido mediante un lenguaje desde el mismo concepto.

WEB SEMÁNTICA
Es una Web extendida en la que cualquier usuario de internet encontrara respuestas a cada una de sus preguntas de una forma más rápida y sencilla gracias a su información definida ya que al dotar la WEB de significado esta es mas semántica la cual dará resultados cada búsqueda de información gracias a la utilización y a la infraestructura común que usa y que por la cual se puede compartir, procesar y trasferir información ya que su infraestructura común. 


Fuente:
CONCEPTOS RECUPERACIÓN DE INFORMACIÓN. Disponible en:  http://uvirtual.lasalle.edu.co/mod/glossary/view.php. 
Consulta: 4 de septiembre de 2010.